Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Що являє собою дво зразка CDF Росії
Я намагаюся зрозуміти, як отримати -значення для однобічного тесту Колмогорова-Смірнова , і я намагаюся знайти CDF для і у випадку двох зразків. Нижче в кількох місцях цитується як CDF для у випадку одного зразка:pppD+n1,n2Dn1,n2+D^{+}_{n_{1},n_{2}}D−n1,n2Dn1,n2−D^{-}_{n_{1},n_{2}}D+nDn+D^{+}_{n} p+n(x)=P(D+n≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jpn+(x)=P(Dn+≥x|H0)=x∑j=0⌊n(1−x)⌋(nj)(jn+x)j−1(1−x−jn)n−jp^{+}_{n}\left(x\right) = \text{P}\left(D^{+}_{n} \ge x | \text{H}_{0}\right) = x\sum_{j=0}^{\lfloor n\left(1-x\right)\rfloor}{ \binom{n}{j} \left(\frac{j}{n}+x\right)^{j-1}\left(1 - x - \frac{j}{n}\right)^{n-j}} …

1
Добавка проти мультиплікативного розкладання
Моє запитання дуже просте, але це ті, які мене справді отримують :) Я не знаю, як оцінити, чи потрібно розкласти конкретний часовий ряд за допомогою добавки або мультиплікативного методу розкладання. Я знаю, що є візуальні підказки, як розповідати їх один від одного, але я їх не розумію. Візьмемо для прикладу …

2
Чому кореляція Пірсона рангів чинна, незважаючи на припущення про нормальність?
Зараз я читаю припущення щодо кореляцій Пірсона. Важливим припущенням для наступного t-тесту, здається, є те, що обидві змінні походять від звичайних розподілів; якщо цього не зробити, то рекомендується використання альтернативних заходів, таких як Spearman rho. Кореляція Спірмена обчислюється як кореляція Пірсона, лише використовуючи ранги X і Y замість самих X …

2
Оцінка коригуваних коефіцієнтів ризику у двійкових даних за допомогою реагресії Пуассона
Мені цікаво оцінити скоригований коефіцієнт ризику, аналогічний тому, як можна оцінити скоригований коефіцієнт шансів за допомогою логістичної регресії. Деяка література (наприклад, ця ) вказує на те, що використання регресії Пуассона зі стандартними помилками Губера-Уайта є модельним способом зробити це Я не знайшов літератури про те, як коригування на безперервні коваріати …

1
Моделювання конвергенції у ймовірності до постійної
Асимптотичні результати неможливо довести за допомогою комп'ютерного моделювання, оскільки вони є твердженнями, що стосуються поняття нескінченності. Але ми повинні мати можливість зрозуміти, що справи дійсно йдуть так, як нам каже теорія. Розглянемо теоретичний результат limn→∞P(|Xn|>ϵ)=0,ϵ>0limn→∞P(|Xn|>ϵ)=0,ϵ>0\lim_{n\rightarrow\infty}P(|X_n|>\epsilon) = 0, \qquad \epsilon >0 де XnXnX_n - функція nnn випадкових величин, сказати однаково і …

1
Перебіг з категоричними змінними
Мені хотілося б виконати комбінацію пересимплінгу та недооцінки, щоб збалансувати мій набір даних із приблизно 4000 клієнтами, розділеними на дві групи, де одна з груп становить приблизно 15%. Я вивчив SMOTE ( http://www.inside-r.org/packages/cran/DMwR/docs/SMOTE ) та ROSE ( http://cran.r-project.org/web/packages/ROSE/ ROSE.pdf ), але обидва вони створюють нові синтетичні зразки, використовуючи існуючі спостереження …

1
Який взаємозв'язок між заходами надійності на шкалі (альфа Кронбаха тощо) та навантаженнями компонентів / факторів?
Скажімо, у мене є набір даних із оцінками на купі питань анкети, які теоретично складаються з меншої кількості шкал, як, наприклад, у психологічних дослідженнях. Я знаю, що тут поширений підхід - перевірити надійність ваг за допомогою альфа Кронбаха чи чогось подібного, а потім об'єднати елементи в масштабах, щоб сформувати шкали …

2
Як знайти оптимальні значення параметрів налаштування у збільшити дерева?
Я усвідомлюю, що в моделі прискорення дерев є 3 параметри настройки, тобто кількість дерев (кількість ітерацій) параметр усадки кількість розщеплень (розмір кожного складового дерева) Моє запитання: як для кожного з параметрів настройки я повинен знайти його оптимальне значення? А який метод? Зауважте: параметр усадки та кількість параметрів дерев працюють разом, …

3
Перехресне підтвердження K-згину або витримки для регресії хребта з використанням R
Я працюю над перехресною валідацією прогнозування моїх даних з 200 предметами та 1000 змінними. Мене цікавить регресія хребта, оскільки кількість змінних (я хочу використовувати) більша, ніж кількість вибірки. Тому я хочу використовувати оцінювачі усадки. Наступні складені приклади даних: #random population of 200 subjects with 1000 variables M <- matrix(rep(0,200*100),200,1000) for …

1
anova тест III типу для ГЛММ
Я вписую glmerмодель в lme4пакет R. Я шукаю таблицю anova з вказаною в ній величиною p, але не можу знайти жодного пакета, який би їй підходив. Чи можливо це зробити в R? Модель, яка мені підходить, має форму: model1<-glmer(dmn~period*teethTreated+(1|fullName), family="poisson", data=subset(dataset, group=='Four times a year'), control=glmerControl(optimizer="bobyqa"))

1
Як glmnet обробляє наддисперсію?
У мене є питання про моделювання тексту над даними підрахунку, зокрема, як я можу використовувати lassoтехніку для зменшення функцій. Скажіть, у мене є N онлайн-статей і кількість переглядів сторінок для кожної статті. Я вилучив 1-грам і 2-грам для кожної статті і хотів провести регресію на 1,2-грам. Оскільки особливостей (1,2-грам) набагато …

4
Допоможіть інтерпретувати сюжет взаємодії?
У мене виникають проблеми з інтерпретацією графіків взаємодії, коли існує взаємодія між двома незалежними змінними. Наступні графіки з цього сайту: Тут і - незалежні змінні, а - залежна змінна.AАABБBDVDVDV Питання: Є взаємодія та головний ефект , але немає головного ефектуAАABБB Я можу бачити , що чим вище значення , тим …

1
Влада в протеоміці?
Грантів часто потребують аналізу потужності для підтримки запропонованого розміру вибірки. У протеоміці (і більшості -оміках) є 100/1000 характеристик / змінних, виміряних у 10-х зразках (можливо, 100-х, але малоймовірно). Також відомо, що деякі з цих вимірювальних одиниць (наприклад, спектральні підрахунки білків) зазвичай не розподіляються, і тому ми будемо використовувати непараметричний тест …

5
Логістична регресія на великих даних
У мене набір даних близько 5000 функцій. Для цих даних я вперше використав тест Chi Square для вибору особливостей; після цього я отримав близько 1500 змінних, які показали залежність значущості від змінної відповіді. Тепер мені потрібно підходити до цього логістичної регресії. Я використовую пакунок glmulti для R (пакет glmulti забезпечує …

1
Який розподіл використовувати для моделювання часу читання веб-сторінки?
У мене є функція, яка повертає середньому користувачеві час очікування. Тобто це дає середній час перебування середнього користувача на веб-сторінці, враховуючи довжину веб-ресурсу словами. Я хочу використовувати цю функцію (і отриманий середній показник) у поєднанні з розподілом для моделювання "середнього користувача" в Інтернеті. Який розподіл може підходити для цього і …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.