Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Сліпого розділення опуклої суміші?
Припустимо, у мене є незалежних джерел, і я спостерігаю опуклі суміші: Х 1 , Х 2 , . . . , X n m Y 1nnnX1,X2,...,XnX1,X2,...,XnX_1, X_2, ..., X_nmmmY1...Ym=a11X1+a12X2+⋯+a1nXn=am1X1+am2X2+⋯+amnXnY1=a11X1+a12X2+⋯+a1nXn...Ym=am1X1+am2X2+⋯+amnXn\begin{align} Y_1 &= a_{11}X_1 + a_{12}X_2 + \cdots + a_{1n}X_n\\ ...&\\ Y_m &= a_{m1}X_1 + a_{m2}X_2 + \cdots + a_{mn}X_n \end{align} з …
18 pca  ica 

2
Чому у визначенні асимптотичної нормальності?
Послідовність оцінювачів для параметра є асимптотично нормальною, якщо . ( джерело ) Потім ми називаємо асимптотичну дисперсію . Якщо ця дисперсія дорівнює границі Креймера-Рао , ми говоримо, що оцінювач / послідовність є асимптотично ефективним. θ √UnUnU_nθθ\thetavUnn−−√(Un−θ)→N(0,v)n(Un−θ)→N(0,v)\sqrt{n}(U_n - \theta) \to N(0,v)vvvUnUnU_n Питання: Чому ми використовуємо зокрема?n−−√n\sqrt{n} Я знаю, що для зразка …

2
Середнє значення вибірки завантаження та статистика вибірки
Скажіть, у мене є зразок і зразок завантажувального пристрою з цього зразка для статичного (наприклад, середнього). Як усі ми знаємо, ця самозавантаження зразок оцінює на розподіл вибірки з оцінки з статистики.χχ\chi Тепер, чи є середнє значення цього зразка завантаження кращою оцінкою статистики популяції, ніж статистика вихідної вибірки ? За яких …

2
Чому куртоз нормального розподілу дорівнює 3, а не 0
Що мається на увазі під твердженням, що куртоз нормального розподілу дорівнює 3. Чи означає це, що на горизонтальній лінії значення 3 відповідає піковій ймовірності, тобто 3 - режим системи? Коли я дивлюся на звичайну криву, то здається, що пік настає в центрі, він же дорівнює 0. Так чому куртоз не …

6
Як пояснити тестування гіпотез для підлітків менше ніж за 10 хвилин?
Вже більше року я приділяю одногодинний клас "смак статистики". Кожен раз, коли я приїжджаю різну групу дітей, і я даю їм клас. Тема заняття полягає в тому, що ми проводимо експеримент, в якому 10 малюків (хто любить пити кока-коли) отримують дві (без маркування) чашки, одну з кока-колою та одну з …

3
Асимптотична консистенція з ненульовою асимптотичною дисперсією - що це собою являє?
Питання виникла раніше, але я хочу поставити конкретне запитання, яке намагатиметься отримати відповідь, яка уточнить (і класифікує) його: У «Асимптотиці бідної людини» чітко розмежовується між ними (a) послідовність випадкових змінних, яка ймовірно сходиться до постійної на противагу (b) послідовність випадкових змінних, яка ймовірно сходиться до випадкової величини (а отже, і …

3
Чи поєднують методи оптимізації з методами вибірки?
З будь-якого загального алгоритму вибірки можна отримати алгоритм оптимізації. Дійсно, щоб домогтися довільної функції , достатньо скласти зразки з . Для достатньо малих розмірів ці зразки впадуть близько глобального максимуму (або локальних максимумів на практиці) функції .f: x → f( х )f:х→f(х)f: \textbf{x} \rightarrow f(\textbf{x})г∼ еf/ Тг∼еf/Тg \sim e^{f/T}ТТTfff Під …

1
Вибір між функціями втрат для двійкової класифікації
Я працюю в проблемній області, де люди часто повідомляють про ROC-AUC або AveP (середня точність). Однак нещодавно я знайшов папери, які оптимізують втрату журналу , а інші повідомляють про втрату шарніру . Хоча я розумію, як обчислюються ці показники, мені важко зрозуміти компроміси між ними і що добре для чого …

2
Уніфікована випадкова величина як сума двох випадкових величин
Взяті від Гріммета та Стірцакера : Покажіть, що не може бути випадку, що де рівномірно розподілено на [0,1], а і незалежні та однаково розподілені. Не слід вважати, що X і Y - суцільні змінні.U = X + YU=X+YU=X+YU X YUUXXYY Простий доказ протиріччя достатній для випадку, коли , вважаються дискретними, …

3
Чи неправильно називати результати "високими значеннями"?
Чому статистики не заважають нам називати результати « високо значущими», коли -значення значно нижче звичайного рівня ?α 0,05pppαα\alpha0,050.050.05 Чи справді неправильно довіряти результату, який має 99,9% шансу не помилки типу I ( ) більше, ніж результату, який дає лише такий шанс на 99% ( )?p = 0,01р = 0,001p=0.001p=0.001р = …

2
Інтерпретація бета-версій, коли є кілька категоричних змінних
Я розумію поняття, що - це середнє значення, коли категоріальна змінна дорівнює 0 (або є еталонною групою), даючи кінцевій інтерпретації, що коефіцієнт регресії - це різниця середнього значення для двох категорій. Навіть із> 2 категоріями я вважаю, що кожна пояснює різницю між середньою категорією та посиланням.β^0β^0\hat\beta_0β^β^\hat\beta Але що робити, якщо …

4
Яка інтуїція стоїть за незалежністю
Я сподівався, що хтось може запропонувати аргумент, що пояснює, чому випадкові змінні і , зі стандартним нормальним розподілом, є статистично незалежними. Доказ цього факту легко випливає з методики MGF, але я вважаю це надзвичайно контрінтуїтивним.Y 2 = X 1 + X 2 X iY1= X2- X1Y1=Х2-Х1Y_1=X_2-X_1Y2= X1+ X2Y2=Х1+Х2Y_2=X_1+X_2ХiХiX_i Тому я …

4
Неперехідність кореляції: кореляція між статтю та розміром мозку та розміром мозку та IQ, але немає кореляції між статтю та IQ
У блозі я знайшов таке пояснення, і хотів би отримати більше інформації про неперехідність кореляції: У нас є такі незаперечні факти: В середньому різниця в обсязі мозку між чоловіками і жінками Існує кореляція між IQ та розміром мозку; кореляція становить 0,33 і, таким чином, відповідає 10% варіабельності IQ З цих …

3
Чому байєсова статистика не є більш популярною для контролю статистичних процесів?
Я розумію, що баєсийські та частосоціальні дебати - така статистика часто: є (або претендує на це) об'єктивним або принаймні неупереджено тому різні дослідники, використовуючи різні припущення, все ще можуть отримати кількісно порівнянні результати в той час як байєсівська статистика вимагає робити "кращі" прогнози (тобто менші очікувані втрати), оскільки може використовувати …

1
Як відбілити дані за допомогою аналізу основних компонентів?
Я хочу перетворити свої дані таким чином, що відхилення будуть одна, а коваріації будуть нульовими (тобто я хочу відбілити дані). Крім того, засіб має бути нульовим.ХX\mathbf X Я знаю, що потраплю туди, зробивши Z-стандартизацію та перетворення PCA, але в якому порядку я повинен їх робити? Додам, що складене відбілююче перетворення …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.