Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

11
Чи можете ви зрозуміти причинність у кореляційному прикладі диктаторської гри?
Я щойно пройшов іспит, де нам представили дві змінні. У грі на диктатора, де диктатору дають 100 доларів, і він може вибрати, скільки відправити чи зберегти для себе, між віком і тим, скільки грошей учасники вирішили зберегти, була позитивна кореляція. Я думаю, що ви не можете зробити причинну причину з …

3
Чому б не використати «звичайні рівняння», щоб знайти прості найменші коефіцієнти квадратів?
Я побачив цей список тут і не міг повірити, що існує стільки способів вирішити найменші квадрати. «Нормальні рівняння» на Вікіпедії , здавалося, досить прямим α^β^=y¯−β^x¯,=∑ni=1(xi−x¯)(yi−y¯)∑ni=1(xi−x¯)2α^=y¯−β^x¯,β^=∑i=1n(xi−x¯)(yi−y¯)∑i=1n(xi−x¯)2 {\displaystyle {\begin{aligned}{\hat {\alpha }}&={\bar {y}}-{\hat {\beta }}\,{\bar {x}},\\{\hat {\beta }}&={\frac {\sum _{i=1}^{n}(x_{i}-{\bar {x}})(y_{i}-{\bar {y}})}{\sum _{i=1}^{n}(x_{i}-{\bar {x}})^{2}}}\end{aligned}}} То чому б просто не використовувати їх? Я припускав, …

3
Чим відрізняється "статистичний експеримент" від "статистичної моделі"?
Я стежу за AW van der Vaart, асимптотичною статистикою (1998). Він розповідає про статистичні експерименти, стверджуючи, що вони відрізняються від статистичної моделі, але не визначає жодного. Моє запитання: Що таке (1) статистичний експеримент, (2) статистична модель та (3), що є ключовим інгредієнтом, який завжди відрізнятиме статистичний експеримент від будь-якої статистичної …

7
Чи повинен "нормальний розподіл" мати середній = середній = режим?
Я вела дискусію зі своїм професором статистики на рівні випускників про "нормальні розподіли". Я стверджую, що для дійсного отримання нормального розподілу необхідно мати середній = середній = режим, всі дані повинні міститись під кривою дзвону та ідеально симетрично навколо середнього. Тому технічно практично немає нормальних розподілів у реальних дослідженнях, і …

1
Тест: Повідомте класифікатора за його межею рішення
Нижче наведено 6 меж рішення. Межі рішення - фіолетові лінії. Точки та хрестики - це два різних набори даних. Ми повинні вирішити, який з них: Лінійний SVM Кернелізоване SVM (Поліномне ядро ​​порядку 2) Перцепрон Логістична регресія Нейронна мережа (1 прихований шар з 10 випрямленими лінійними одиницями) Нейронна мережа (1 прихований …

1
Чи існує байєсова інтерпретація лінійної регресії з одночасною регуляризацією L1 та L2 (також пружна сітка)?
Добре відомо, що лінійна регресія з покаранням еквівалентна знаходженню оцінки ПДЧ, заданої Гауссовим попереднім коефіцієнтом. Аналогічно, використання штрафу l 1 еквівалентно використанню розподілу Лапласа як попереднього.л2л2l^2л1л1l^1 Не рідкість використання деякої зваженої комбінації регуляризації та l 2 . Чи можемо ми сказати, що це еквівалентно деякому попередньому розподілу коефіцієнтів (інтуїтивно, здається, …

1
Коли максимальна ймовірність та метод моментів дають однакові оцінки?
Мені було задано це питання на днях і ніколи раніше його не розглядали. Моя інтуїція випливає з переваг кожного оцінювача. Максимальна ймовірність є переважно тоді, коли ми впевнені в процесі генерації даних, оскільки, на відміну від методу моментів, він використовує знання всього розподілу. Оскільки оцінювачі MoM використовують лише інформацію, що …

6
Чи можна довіряти вагомому результату t-тесту, якщо розмір вибірки невеликий?
Якщо результат мого одностороннього t-тесту є значним, але розмір вибірки невеликий (наприклад, нижче 20 або більше), чи можу я все-таки довіряти цьому результату? Якщо ні, то як мені поводитися та / або тлумачити цей результат?

2
Чому саме бета-регресія не може мати справу з 0 і 1 у змінній відповіді?
Бета-регресія (тобто GLM з бета-розподілом і, як правило, функцією посилання logit) часто рекомендується мати справу з змінною, яка залежить від відповіді, приймаючи значення між 0 і 1, такі як дроби, коефіцієнти або ймовірності: Регресія для результату (відношення або частка) між 0 і 1 . Однак завжди стверджується, що бета-регресію не …

2
Розподіл вибірки з двох незалежних популяцій Бернуллі
Припустимо, що у нас є вибірки двох незалежних випадкових величин Бернуллі, Ber(θ1)Ber(θ1)\mathrm{Ber}(\theta_1) і Ber(θ2)Ber(θ2)\mathrm{Ber}(\theta_2) . Як ми доводимо, що (X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2−−−−−−−−−−−−−−√→dN(0,1)(X¯1−X¯2)−(θ1−θ2)θ1(1−θ1)n1+θ2(1−θ2)n2→dN(0,1)\frac{(\bar X_1-\bar X_2)-(\theta_1-\theta_2)}{\sqrt{\frac{\theta_1(1-\theta_1)}{n_1}+\frac{\theta_2(1-\theta_2)}{n_2}}}\xrightarrow{d} \mathcal N(0,1)? Припустимо, що n1≠n2n1≠n2n_1\neq n_2 .

4
Що ґрунтується на визначенні граніту "Графік" та "Віскі"?
Стандартне визначення викиду для ділянки Box і бакенбард точки за межами діапазону , де я Q R = Q 3 - Q 1 і Q 1 є перший квартал і Q 3 - третій квартал даних.{Q1−1.5IQR,Q3+1.5IQR}{Q1−1.5IQR,Q3+1.5IQR}\left\{Q1-1.5IQR,Q3+1.5IQR\right\}IQR=Q3−Q1IQR=Q3−Q1IQR= Q3-Q1Q1Q1Q1Q3Q3Q3 Що є основою для цього визначення? Маючи велику кількість балів, навіть абсолютно нормальний …

3
Як я можу моделювати фліпси до досягнення N успіхів?
Ми з вами вирішили пограти в гру, де ми по черзі гортаємо монету. Перший гравець, який перевернув 10 головок, виграє гру. Природно, є аргумент про те, хто повинен йти першим. Симулятори цієї гри показують, що гравець, який перевертає спочатку, виграє на 6% більше, ніж той, хто перевертає другий (перший гравець …

3
Ефективно створюйте точки між одиничним колом та одиницею квадрата
Я б хотів генерувати зразки з блакитної області, визначеної тут: Наївним рішенням є використання відбору проб відхилення в одиничному квадраті, але це забезпечує лише ефективність (~ 21,4%).1−π/41−π/41-\pi/4 Чи є якийсь спосіб я можу зробити вибірку більш ефективно?

6
Чи є приклад, коли MLE виробляє упереджену оцінку середнього?
Чи можете ви навести приклад оцінки MLE середнього значення, яке є упередженим? Я не шукаю прикладу, який загалом порушує оцінювачі MLE, порушуючи умови регулярності. Усі приклади, які я бачу в Інтернеті, відносяться до дисперсії, і я не можу знайти щось, що стосується середнього. EDIT @MichaelHardy подав приклад, коли ми отримуємо …

1
Чому р-значення часто вище в пропорційній моделі небезпеки Кокса, ніж у логістичній регресії?
Я дізнався про модель пропорційної небезпеки Кокса. У мене є великий досвід фитинга моделі логістичної регресії, і так , щоб побудувати інтуїції я порівнюють моделі FIT , використовуючи coxphз R «виживання» з логістичної регресійної моделі FIT , використовуючи glmз family="binomial". Якщо я запускаю код: library(survival) s = Surv(time=lung$time, event=lung$status - …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.