Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як мені подумки боротися з парадоксом Бореля?
Я відчуваю себе трохи непросто з тим, як я подумки мав справу з парадоксом Бореля та іншими пов'язаними з ними "парадоксами", що стосуються умовної ймовірності. Для тих, хто читає це, які не знайомі з цим, дивіться це посилання . Моя психічна реакція до цього моменту полягала в тому, щоб зважати …

3
Який взаємозв'язок між R-квадратом та p-значенням у регресії?
tl; dr - для регресії OLS, чи має вищий R-квадрат також вищу величину P? Зокрема для однієї пояснювальної змінної (Y = a + bX + e), але також було б цікаво знати декілька n пояснювальних змінних (Y = a + b1X + ... bnX + e). Контекст - я виконую …

2
Інтуїтивне пояснення періодичності в ланцюгах Маркова
Чи може хтось інтуїтивно пояснити мені, що таке періодичність ланцюга Маркова? Він визначається наступним чином: Для всіх станів iii в SSS didid_i = gcd{n∈N|p(n)ii>0}=1{n∈N|pii(n)>0}=1\{n \in \mathbb{N} | p_{ii}^{(n)} > 0\} =1 Дякую за ваші зусилля!

3
Підгонка t-розподілу в R: параметр масштабування
Як мені підходять параметри t-розподілу, тобто параметри, що відповідають "середньому" та "стандартному відхиленню" нормального розподілу. Я припускаю, що їх називають "середніми" та "масштабуючими / ступенями свободи" для розподілу t? Наступний код часто призводить до помилок "оптимізації оптимізації". library(MASS) fitdistr(x, "t") Чи потрібно спочатку масштабувати х чи перетворювати на ймовірності? Як …

5
Чому k-означає не дає глобального мінімуму?
Я читав, що алгоритм k-означає сходиться лише до локального мінімуму, а не до глобального мінімуму. Чому це? Я логічно можу подумати про те, як ініціалізація могла б вплинути на остаточну кластеризацію, і існує можливість субоптимальної кластеризації, але я не знайшов нічого, що це математично доведе. Крім того, чому k - …

1
Як інтерпретувати вихід прогнозу.coxph?
Після встановлення коксмоделі можна зробити прогнози та отримати відносний ризик нових даних. Що я не розумію - це як обчислюється відносний ризик для окремої людини і який він відносний (тобто середній показник чисельності населення)? Якісь рекомендації щодо ресурсів, які допоможуть зрозуміти (я не дуже просунувся в аналізі виживання, тим чим …

1
Зв'язок між функцією, що генерує момент, і характерною функцією
Я намагаюся зрозуміти зв’язок між функцією, що генерує момент, і характерною функцією. Функція генерування моментів визначається як: MX(t)=E(exp(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n!MX(t)=E(exp⁡(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n! M_X(t) = E(\exp(tX)) = 1 + \frac{t E(X)}{1} + \frac{t^2 E(X^2)}{2!} + \dots + \frac{t^n E(X^n)}{n!} Використовуючи розширення ряду exp(tX)=∑∞0(t)n⋅Xnn!exp⁡(tX)=∑0∞(t)n⋅Xnn!\exp(tX) = \sum_0^{\infty} \frac{(t)^n \cdot X^n}{n!}, Я можу знайти всі моменти розподілу для …

1
Негативний коефіцієнт у впорядкованій логістичній регресії
Припустимо, у нас є порядковий відповідь і набір змінних X : = [ x 1 , x 2 , x 3 ], які, на нашу думку, пояснять y . Потім робимо впорядковану логістичну регресію X (матриця проектування) на y (відповідь).y:{Bad, Neutral, Good}→{1,2,3}y:{Bad, Neutral, Good}→{1,2,3}y:\{\text{Bad, Neutral, Good}\} \rightarrow \{1,2,3\}X:=[x1,x2,x3]X:=[x1,x2,x3]X:=[x_1,x_2,x_3]yyyXXXyyy Припустимо , …

8
Як інтерполяція пов'язана з поняттям регресії?
Поясніть коротко, що розуміється під інтерполяцією. Як це пов'язано з поняттям регресії? інтерполяція - це мистецтво читання між рядками таблиці, а в елементарній математиці термін зазвичай позначає процес обчислення проміжних значень функції з набору заданих або табличних значень цієї функції. Я не можу дати відповідь на друге запитання. Будь ласка, …

3
Як працює стандартна помилка?
Нещодавно я розглядав внутрішню розробку стандартної помилки і виявив, що не можу зрозуміти, як це працює. Моє розуміння стандартної помилки полягає в тому, що це стандартне відхилення розподілу засобів вибірки. Мої запитання: • як ми знаємо, що стандартна помилка - це стандартне відхилення вибірки, коли ми зазвичай беремо лише один …

2
Зворотна трансформація коефіцієнтів регресії
Я роблю лінійну регресію з перетвореною залежною змінною. Наступне перетворення було зроблено для того, щоб було допущено нормальність залишків. Нетрансформована залежна змінна була негативно перекошена, і наступне перетворення зробило її близькою до нормальної: Y=50−Yorig−−−−−−−−√Y=50−YorigY=\sqrt{50-Y_{orig}} де є залежною змінною у вихідній шкалі.YorigYorigY_{orig} Я думаю, що є сенс використовувати деяке перетворення на …

1
Як вибрати між ANOVA та ANCOVA в розробленому експерименті?
Я провожу експеримент, який має наступне: DV: Споживання скибочок (безперервне або може бути категоричним) IV: Здорове повідомлення, нездорове повідомлення, відсутність повідомлення (контроль) (3 групи, до яких люди призначаються випадковим чином - категоричні) Це маніпульоване повідомлення про здоров’я шматочка. Наступні IV можна вважати індивідуальними змінними різниці: Імпульсивність (це може бути категоричним, …

1
Чому ми вважаємо, що помилка зазвичай розподіляється?
Цікаво, чому ми використовуємо припущення Гаусса при моделюванні помилки. У курсі МЛ Стенфорда професор Нг описує це в основному двома способами: Це математично зручно. (Це пов'язано з розміщенням найменших квадратів і їх легко вирішити за допомогою псевдоінверси) Зважаючи на теорему центрального ліміту, ми можемо вважати, що існує безліч фактів, що …

5
Як вказати логічний нормальний розподіл в аргументі сімейства glm в R?
Просте запитання: Як визначити логічний нормальний розподіл в аргументі сімейства GLM в R? Я не міг знайти, як цього можна досягти. Чому в сімейному аргументі лонормальне (або експоненціальне) не є варіантом? Десь в R-архівах я прочитав, що потрібно просто використовувати посилання log для сімейства, встановленого на гаусса в GLM, для …

1
Конвенції позначень для випадкових змінних та їх розподілів
Я плутаюсь у правильних позначеннях значень, а також значеннях деяких позначень, що стосуються випадкових змінних та їх розподілу. Нижче я перерахую речі, які, на мою думку, є правдивими, а також речі, які я не розумію, і я хотів би ввести / виправити. Я позначив кожну точку / питання номером для …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.