Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Якщо кілька порівнянь є «запланованими», чи все-таки потрібно виправляти декілька порівнянь?
Я переглядаю статтю, яка виконала> 15 окремих тестів на площі 2x2 Chi. Я припустив, що їх потрібно виправити для кількох порівнянь, але вони відповіли, сказавши, що всі порівняння були заплановані, а тому це не потрібно. Я вважаю, що це не повинно бути правильним, але я не можу знайти жодних ресурсів, …

5
Приклад, де має значення принцип правдоподібності * насправді *?
Чи є приклад, коли два різних тести, що захищаються, з пропорційною ймовірністю призвели б до помітно різних (і однаково захищаються) висновків, наприклад, де значення p є порядком величин, але потужність до альтернатив аналогічна? Усі приклади, які я бачу, є дуже нерозумними, порівнюючи двочлен з негативним двочленним, де р-значення першого становить …

1
Чи є інтуїтивне пояснення, чому логістична регресія не буде працювати для ідеального випадку розлуки? І чому додавання регуляризації виправить це?
У нас є багато хороших дискусій про ідеальне розділення в логістичній регресії. Такі як, Логістична регресія в R призвели до ідеального роз'єднання (феномен Хока-Доннера). А тепер що? і логістична регресійна модель не збігається . Я особисто все ще вважаю, що це не інтуїтивно, чому це буде проблема і чому додавання …

1
Гайки, спричинені використанням ступінчастої регресії
Я добре знаю проблеми поетапного / вперед / назад вибору в регресійних моделях. Є численні випадки, коли дослідники заперечують методи та вказують на кращі альтернативи. Мені було цікаво, чи є історії, які існують там, де статистичний аналіз: застосував ступінчату регресію; на основі кінцевої моделі зробили кілька важливих висновків висновок був …

6
Заповнення кореляційної матриці 3x3: два коефіцієнти з трьох наведених
Мене це питання задали в інтерв'ю. Скажімо, у нас є кореляційна матриця форми ⎡⎣⎢10,60,80,61γ0,8γ1⎤⎦⎥[10,60,80,61γ0,8γ1]\begin{bmatrix}1&0.6&0.8\\0.6&1&\gamma\\0.8&\gamma&1\end{bmatrix} Мене попросили знайти значення гамми, враховуючи цю кореляційну матрицю. Я думав, що я можу зробити щось із власними значеннями, оскільки вони повинні бути більшими або дорівнювати 0. (Матриця повинна бути позитивною напівфінішною) - але я не …

1
Чи можна довіряти адаптивній MCMC?
Я читаю про адаптивну MCMC (див., Наприклад, Розділ 4 Посібника Ланцюга Маркова Монте-Карло , ред. Брукс та ін., 2011; а також Andrieu & Thoms, 2008 ). Основний результат Робертса та Розенталя (2007) полягає в тому, що якщо схема адаптації задовольняє зникаючу умову адаптації (плюс деякі інші технічні характеристики), адаптивна MCMC …

2
Доведення того, що F-статистика слідує за F-розподілом
У світлі цього питання: Доказ того, що коефіцієнти в моделі OLS відповідають t-розподілу з (nk) ступенем свободи Я хотів би зрозуміти, чому F=(TSS−RSS)/(p−1)RSS/(n−p),F=(TSS−RSS)/(p−1)RSS/(n−p), F = \frac{(\text{TSS}-\text{RSS})/(p-1)}{\text{RSS}/(n-p)}, де - кількість параметрів моделі та кількість спостережень, а загальна дисперсія, залишкова дисперсія, слід розподілу .pppnnnTSSTSSTSSRSSRSSRSSFp−1,n−pFp−1,n−pF_{p-1,n-p} Я мушу визнати, що навіть не намагався довести …

3
Правильна статистика в робочому середовищі?
Я не впевнений, куди належить це питання: «Перевірена перевірка» або «Робоче місце». Але моє запитання нечітко пов'язане зі статистикою. Це запитання (або, мабуть, питання) виникло під час моєї роботи «стажистом із науки про дані». Я будував цю лінійну регресійну модель і вивчав залишковий графік. Я побачив чітку ознаку гетерокедастичності. Я …
20 careers 

5
Покладіть штамп, поки він не приземлиться на будь-яке число, окрім 4. Яка ймовірність результату> 4?
Гравець отримує справедливу, шестигранну штамп. Щоб виграти, вона повинна прокатати число, що перевищує 4 (тобто 5 або 6). Якщо вона закатає 4, вона повинна прокататися знову. Які шанси на виграш? Я думаю, що ймовірність виграти може бути виражена рекурсивно як:П( Ш)П(W)P(W) П( Ш) = Р( r = 5 ∪ r …

5
Припущення множинної регресії: чим припущення про нормальність відрізняється від припущення про постійну дисперсію?
Я читав, що це умови використання моделі множинної регресії: залишки моделі майже нормальні, мінливість залишків майже постійна залишки незалежні, і кожна змінна лінійно пов'язана з результатом. Чим 1 і 2 відрізняються? Ви можете побачити його прямо тут: Отже, наведений вище графік говорить про те, що залишкове значення, яке знаходиться на …

1
Гаусові процеси у вейвлет-домені: що таке коваріація?
Я читав Maraun та ін. , "Нестаціонарні процеси Гаусса у вейвлет-домені: синтез, оцінка та значне тестування" (2007), який визначає клас нестаціонарних GP, який може бути визначений множниками у вейвлет-домені. Реалізація одного такого GP - це: де - білий шум, - безперервне вейвлет-перетворення відносно вейвлет , - множник (якийсь подібний на …

1
Доведення коефіцієнтів усадки за допомогою регресії хребта за допомогою "спектрального розкладання"
Я зрозумів, як регресія хребта зменшує коефіцієнти до нуля геометрично. Більше того, я знаю, як довести це в спеціальній "Ортонормічній справі", але мене бентежить, як це працює в загальному випадку за допомогою "Спектральної декомпозиції".

3
Щоб максимум шансів правильно відгадати результат відгортання монети, чи слід завжди вибирати найбільш ймовірний результат?
Це не домашнє завдання. Мені цікаво зрозуміти, чи правильна моя логіка з цією простою статистикою. Скажімо, у мене є двостороння монета, де ймовірність перевернути голову а ймовірність перевернути хвіст - . Припустимо, всі фліпи мають незалежні ймовірності. Скажімо, я хочу максимально збільшити свої шанси передбачити, чи буде монета головою чи …

9
Як ми можемо знати, що ймовірність кочення 1 і 2 дорівнює 1/18?
З мого першого класу ймовірностей я цікавився наступним. Розрахунок ймовірностей зазвичай вводиться через відношення "сприятливих подій" до загальних можливих подій. У випадку закочування двох 6-сторонніх кісток кількість можливих подій становить , як показано в таблиці нижче.363636 1234561( 1 , 1 )( 2 , 1 )( 3 , 1 )( 4 …
20 probability  dice 

3
Чому AUC = 1 рівний класифікатор неправильно класифікував половину зразків?
Я використовую класифікатор, який повертає ймовірності. Для обчислення AUC я використовую pROC R-пакет. Вихідні ймовірності з класифікатора: probs=c(0.9865780, 0.9996340, 0.9516880, 0.9337157, 0.9778576, 0.8140116, 0.8971550, 0.8967585, 0.6322902, 0.7497237) probsпоказує ймовірність перебування в класі '1'. Як показано, класифікатор класифікував усі вибірки до класу '1'. Справжній вектор етикетки: truel=c(1, 1, 1, 1, 1, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.