Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Чи зміщення є властивістю оцінювача чи конкретних оцінок?
Як приклад, я часто зустрічаю студентів, які знають, що спостережуване є упередженим оцінювачем населення . Потім, пишучи свої звіти, вони говорять про такі речі:R2R2R^2R2R2R^2 "Я обчислив спостережувані та скориговані , і вони були досить схожими, що передбачає лише невелику кількість зміщення в отриманому нами значення спостережуваного ".R2R2R^2R2R2R^2R2R2R^2 Я розумію, що, …

2
Регрес: чому тест нормальність загальних залишків, а залишки зумовлюють
Я розумію, що в лінійній регресії помилки вважаються нормально розподіленими, що залежать від прогнозованого значення y. Тоді ми розглядаємо залишки як своєрідний проксі для помилок. Це часто рекомендується для створення виведення , як це: . Однак я не розумію, у чому сенс отримання залишків для кожної точки даних та об'єднання …

1
Чи нейронні мережі зазвичай потребують певного часу, щоб "піднятися" під час тренувань?
Я намагаюся навчити глибоку нейронну мережу для класифікації, використовуючи зворотне поширення. Зокрема, я використовую звивисту нейронну мережу для класифікації зображень, використовуючи бібліотеку потоків тензорів. Під час тренувань я відчуваю якусь дивну поведінку, і мені просто цікаво, чи це типово, чи я можу робити щось не так. Отже, моя конволюційна нейронна …

2
жиро-пальцевий розподіл
Коротке запитання: чи існує розподіл жиру на пальці? Я впевнений, що якщо він існує, то він має іншу назву. Я не знаю, як сформулювати це як аналітичну функцію. Чи можете ви мені допомогти або знайти існуючу версію, або почати розробляти її в чомусь більш чистому, ніж гігантське моделювання? Це розподіл …

2
Матриця зворотної коваріації проти матриці коваріації в PCA
Чи має значення PCA, якщо ми вибираємо основні компоненти матриці зворотної коваріації АБО, якщо ми відкидаємо власні вектори матриці коваріації, що відповідають великим власним значенням? Це пов’язано з обговоренням у цій публікації .

3
Яку регресійну модель найбільш доцільно використати для підрахунку даних?
Я намагаюся трохи заглибитись у статистику, але я щось застряг. Мої дані такі: Year Number_of_genes 1990 1 1991 1 1993 3 1995 4 Тепер я хочу побудувати регресійну модель, щоб можна було передбачити кількість генів за будь-який рік на основі даних. Я робив це з лінійною регресією до цих пір, …

3
D Коена для t-тесту залежного зразка
Швидке запитання: Я бачив, як Коен розраховував два різні способи для тестування залежних зразків (наприклад, в рамках зразків, що перевіряють ефективність ліків із термінами до / після). Використовуючи стандартне відхилення оцінки зміни в знаменнику рівняння для d Коена. Використовуючи стандартне відхилення попереднього тесту в знаменнику рівняння для d Коена. Я …

1
Запобігання відбору зразків важливої ​​важливості Pareto (PSIS-LOO) не виходить з ладу
Нещодавно я почав використовувати випробування з виборкою важливістю Pareto важливої ​​вибіркової перехресної перевірки (PSIS-LOO), описаної в цих роботах: Vehtari, A., & Gelman, A. (2015). Парето вирівнював важливість вибірки. додрук arXiv ( посилання ). Vehtari, A., Gelman, A., & Gabry, J. (2016). Практичне оцінювання байесівської моделі з використанням перехресної валідації "відключення" …

3
У CLT, чому
Нехай - незалежні спостереження з розподілу, що має середнє значення та дисперсію , коли , тоX1,...,XnX1,...,XnX_1,...,X_nμμ\muσ2&lt;∞σ2&lt;∞\sigma^2 < \inftyn→∞n→∞n \rightarrow \infty n−−√X¯n−μσ→N(0,1).nX¯n−μσ→N(0,1).\sqrt{n}\frac{\bar{X}_n-\mu}{\sigma} \rightarrow N(0,1). Чому це означає, що X¯n∼N(μ,σ2n)?X¯n∼N(μ,σ2n)?\bar{X}_n \sim N\left(\mu, \frac{\sigma^2}{n}\right)?

1
Моделювання автокорельованих двійкових часових рядів
Які звичні підходи до моделювання бінарних часових рядів? Чи є папір чи текстова книга, де це обробляється? Я думаю про бінарний процес із сильним автокореляцією. Щось на зразок ознаки процесу AR (1), що починається з нуля. Скажіть і з білим шумом . Тоді двійковий часовий ряд визначений Y_t = \ …

3
Перевірка асоціації для нормально розподіленого DV за напрямками незалежних змінних?
Чи є тест гіпотези про те, чи нормально розподілена залежна змінна асоціюється з напрямною розподіленою змінною? Наприклад, якщо час доби є пояснювальною змінною (а припустимо, що такі речі, як день тижня, місяць року тощо, не мають значення), - це як врахувати той факт, що 11 вечора на 22 години випереджає …

1
Чи коли-небудь гарна ідея надати «частковий кредит» (постійний результат) у навчанні логістичної регресії?
Я треную логістичну регресію, щоб передбачити, які бігуни, швидше за все, закінчать виснажливу гонку на витривалість. Дуже мало бігунів завершують цю гонку, тому у мене важкий класовий дисбаланс і невеликий зразок успіхів (можливо, кілька десятків). Я відчуваю, що міг би отримати якийсь гарний "сигнал" від десятків бігунів, які ледь не …

3
Випадки використання RBF SVM (проти логістичної регресії та випадкового лісу)
Підтримка векторних машин з радіально-базовим функціональним ядром є класифікатором, що контролюється загальним призначенням. Хоча я знаю теоретичні основи цих СВМ та їхніх сильних моментів, я не знаю випадків, коли вони є кращим методом. Отже, чи існує клас проблем, за допомогою яких RBF SVM перевершує інші методи ML? (Або з точки …

2
Чому в статистичній літературі не наголошується на помилках типу II?
Я бачив багато випадків, коли помилки типу I обліковуються (позначаються альфа-значенням) у різних наукових статтях. Я рідко зустрічав, що дослідник враховує потужність або помилку типу II. Помилки типу II можуть бути великою справою? Ми випадково відкинули альтернативну гіпотезу, коли вона була насправді помилковою. Чому значення альфа так наголошуються замість значень …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.