Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Оцінка регресії L1 середня, тоді як оцінки регресії L2 означають?
Тож мені було задано питання, за якими центральними заходами L1 (тобто ласо) та L2 (тобто регресія хребта) оцінювали. Відповідь L1 = середня, а L2 = середня. Чи існує якийсь тип інтуїтивного міркування на це? Або це потрібно визначати алгебраїчно? Якщо так, то як мені це робити?

2
У якому порядку слід робити лінійну регресійну діагностику?
При лінійному регресійному аналізі ми аналізуємо чужих людей, досліджуємо мультиколінеарність, тестуємо гетеросцедастику. Питання: Чи є наказ застосувати їх? Я маю на увазі, чи треба нам спочатку проаналізувати людей, а потім вивчити мультиколінеарність? Або назад? Чи є щодо цього правило?

2
Як включити термін взаємодії в GAM?
Наступний код оцінює схожість двох часових рядів: set.seed(10) RandData <- rnorm(8760*2) America <- rep(c('NewYork','Miami'),each=8760) Date = seq(from=as.POSIXct("1991-01-01 00:00"), to=as.POSIXct("1991-12-31 23:00"), length=8760) DatNew <- data.frame(Loc = America, Doy = as.numeric(format(Date,format = "%j")), Tod = as.numeric(format(Date,format = "%H")), Temp = RandData, DecTime = rep(seq(1, length(RandData)/2) / (length(RandData)/2), 2)) require(mgcv) mod1 <- gam(Temp …

5
Наскільки надійним є тест незалежних зразків, коли розподіли зразків не є нормальними?
Я читав, що t -test є "досить надійним", коли розподіли зразків відходять від нормальності. Звичайно, важливим є розподіл вибірки різниць. У мене є дані для двох груп. Одна з груп сильно перекошена залежною змінною. Розмір вибірки досить малий для обох груп (n = 33 в одній і 45 в іншій). …

4
Чим відрізняється математична статистика від статистики?
У чому різниця математичної статистики та статистики? Я читав це : Статистика - це вивчення збору, організації, аналізу та інтерпретації даних. У ньому розглядаються всі аспекти цього, включаючи планування збору даних з точки зору проектування опитувань та експериментів. І це : Математична статистика - це вивчення статистики з математичної точки …

3
Як зробити логістичну регресію в R, коли результат є дробовим (співвідношення двох рахунків)?
Я переглядаю статтю з наступним біологічним експериментом. Пристрій використовується для піддавання клітинам різної кількості напруги зсуву рідини. Оскільки сильні напруги зсуву прикладаються до клітин, більше їх починає відшаровуватися від субстрату. На кожному рівні напруги зсуву вони підраховують клітини, які залишаються приєднаними, і оскільки вони знають загальну кількість комірок, які були …

3
Кореляція між двома часовими рядами
Який найпростіший спосіб / метод обчислити кореляцію між двома часовими рядами, які мають однаковий розмір? Я думав про множення і , і додавання множення. Отже, якщо це єдине число було позитивним, чи можна сказати, що ці два ряди співвідносяться? Я можу припустити кілька прикладів, коли лінійно інший часовий ряд, що …

1
Хто винайшов перехресну перевірку k-кратної?
Я шукаю посилання на документ, де було введено перехресне підтвердження k-кратної (а не просто гарне академічне посилання на предмет). Можливо, це занадто далеко в туманах часу, щоб однозначно визначити найперший документ, тому будь-які ранні статті, де ідея була використана, могли б зацікавити. Найдавніші мені відомі П. А. Лахенбрух та М. …

3
Перевірка обґрунтованості: наскільки низьким може бути показник p?
Я використовую тест ranksum для порівняння медіани двох зразків ( ) та виявили , що вони значно відрізняються з: . Чи варто мені підозрювати таке невелике -значення чи слід віднести його до високої статистичної потужності, пов'язаної з наявністю дуже великої вибірки? Чи є така річ, як підозріло низький -значення?p pn …

3
Чи можна аналізувати невипадкові вибірки за допомогою стандартних статистичних тестів?
Багато клінічних досліджень засновані на невипадкових зразках. Однак більшість стандартних тестів (наприклад, t-тести, ANOVA, лінійна регресія, логістична регресія) засновані на припущенні, що вибірки містять "випадкові числа". Чи достовірні результати, якщо ці випадкові зразки аналізували стандартними тестами? Дякую.

4
Оцінка максимальної вірогідності ЕМ для розподілу Вейбулла
Примітка: я публікую запитання колишнього мого студента, який не може самостійно опублікувати з технічних причин. З огляду на зразок з розподілу Weibull з pdf є корисне відсутність змінної подання і, отже, пов'язаний з ним алгоритм EM (очікування-максимізація), який можна використовувати для пошуку MLE з , а не з використанням прямого …

4
Чи є у вас глобальне бачення цих методів аналізу?
Зараз я працюю над проектом, де мені в основному потрібно, як і ми, щоб зрозуміти, як результат пов'язаний з введенням x . Особливість тут полягає в тому, що дані ( y , x ) надаються мені по одному фрагменту, тому я хочу оновлювати свій аналіз кожен раз, коли я отримую …

2
Чому lme та aov повертають різні результати для повторних заходів ANOVA в R?
Я намагаюся перейти від використання ezпакету до lmeповторних заходів ANOVA (оскільки, я сподіваюся, я зможу використовувати власні контрасти на с lme). Дотримуючись поради з цього допису в блозі, я зміг налаштувати ту саму модель, використовуючи як aov(так і ezза запитом) та lme. Однак, хоча у прикладі, наведеному в цій публікації, …

4
Який взаємозв'язок між регресією та лінійним дискримінантним аналізом (LDA)?
Чи існує взаємозв'язок між регресією та лінійним дискримінантним аналізом (LDA)? У чому їх схожість та відмінності? Чи має якусь різницю, якщо є два класи або більше двох класів?

5
Чому впливає упередженість, коли клінічне випробування припиняється на ранній стадії?
Проміжний аналіз являє собою аналіз даних в одному або декількох тимчасових точках до офіційного закриття дослідження з метою, наприклад, можливе завершення дослідження рано. За словами Піантадосі, С. ( Клінічні випробування - методологічна перспектива ): " Оцінка ефекту від лікування буде упередженою, коли випробування припиняється на ранній стадії. Чим раніше рішення, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.