Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Як Карл Пірсон придумав статистику хі-квадрата?
Як Пірсон придумав наступну статистику Pearson-хі-квадрата в 1900 році? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} що K∼χ2K∼χ2 K \sim \chi^2 Чи мав він на увазі чи-квадрат і розробив метрику (підхід знизу вгору), або він розробив статистику і пізніше довів, що вона відповідає розподілу chi-квадрата (зверху вниз)?KKK Я хочу знати, чому …

1
Класифікатори машинного навчання big-O або складності
Для оцінки ефективності нового алгоритму класифікатора я намагаюся порівняти точність та складність (big-O у навчанні та класифікації). З машинного навчання: огляд я отримую повний список контрольованих класифікаторів, а також таблицю точності між алгоритмами і 44 тестові проблеми з репозиції даних UCI . Однак я не можу знайти огляд, папір або …

3
Як обчислити перекриття між емпіричними щільністю ймовірності?
Я шукаю метод обчислення площі перекриття між двома оцінками щільності ядра в R, як міру подібності між двома вибірками. Щоб уточнити, у наступному прикладі мені потрібно було б кількісно визначити область пурпурної області, що перекривається: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) …

4
Чи означає "кореляція" також нахил в регресійному аналізі?
Я читаю статтю, і автор написав: Вплив A, B, C на Y вивчали за допомогою багаторазового регресійного аналізу. A, B, C були введені в рівняння регресії з Y як залежної змінної. Аналіз дисперсії представлений у таблиці 3. Вплив B на Y був значним, а B корелює .27 з Y. Англійська …

1
Яка різниця між коефіцієнтами регресії та частковими коефіцієнтами регресії?
Я читав в Абді (2003), що Коли незалежні змінні є ортогональними попарно, ефект кожної з них у регресії оцінюється шляхом обчислення нахилу регресії між цією незалежною змінною та залежною змінною. У цьому випадку (тобто, ортогональність IV) коефіцієнти часткової регресії дорівнюють коефіцієнтам регресії. У всіх інших випадках коефіцієнт регресії буде відрізнятися …

3
Навчання, тестування, перевірка проблеми аналізу виживання
Я переглядав різні теми тут, але не думаю, що на моє точне запитання відповіли. У мене є набір даних ~ 50 000 студентів та їх час до відмови. Я буду виконувати пропорційну регресію небезпек із великою кількістю потенційних коваріатів. Я також збираюся здійснити логістичну регресію при відмові / перебуванні. Основною …

1
Функції витрат для контекстних бандитів
Я використовую vowpal wabbit для вирішення контекстно-бандитської проблеми . Я показую рекламу користувачам, і я маю досить небагато інформації про контекст, у якому відображається реклама (наприклад, хто такий користувач, на якому веб-сайті вони перебувають тощо). Це, здається, є досить класичною контекстуальною бандитською проблемою, як описав Джон Ленгфорд . У моїй …

3
Найкраще програмне забезпечення для візуалізації даних з відкритим кодом для використання з PowerPoint
Яке найкраще програмне забезпечення для візуалізації даних з відкритим кодом? Мені потрібно наступне: Можна імпортувати дані з Microsoft Excel (також було б добре імпортувати дані з баз даних Oracle, але це не обов'язково). Діаграми, згенеровані програмним забезпеченням, можна експортувати в Microsoft PowerPoint (зі мною добре копіювати та вставляти). Відкритий код …

2
Розподіл згортки квадратних нормальних та чи-квадратних змінних?
наступна проблема виникла нещодавно під час аналізу даних. Якщо випадкова величина X слідує за нормальним розподілом, а Y слідує за розподілом χ2nχn2\chi^2_n (з n dof), як розподіляється Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2 ? До цих пір я придумав pdf з Y2Y2Y^2 : ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& \frac{\partial F(\sqrt{x})}{\partial x} \\ &=& …

1
Тест на різницю між двома емпіричними дискретними розподілами
У мене є дані тесту, де у мене є кілька великих зразків з дискретних розподілів, які я використовую як емпіричні розподіли. Я хочу перевірити, чи є розподіли насправді різними, і чим різняться засоби у тих розподілах, які насправді різні. Оскільки вони є дискретними розподілами, я розумію, що тест Колмогорова-Смірнова недійсний …

1
Чи можна рекомендувати книгу Бернхема-Андерсона про багатомодельний висновок?
Як мотивована нещодавньою зміною статистики вибору моделі за замовчуванням у пакеті прогнозу R з AIC на AICc, мені цікаво, чи останній дійсно застосуємо там, де є перша. У мене є низка запитань з цього приводу, і ось перше. Я знаю, що замінювати AIC на AICc скрізь - це те, що …

4
Доведіть еквівалентність наступних двох формул кореляції Спірмена
З вікіпедії співвідношення рейтингів Спірмена обчислюється шляхом перетворення змінних XiXiX_i і YiYiY_i в ранжирувані змінні xixix_i і yiyiy_i , а потім обчислення співвідношення Пірсона між ранжированими змінними: Однак у статті йдеться про те, що якщо між змінними XiXiX_i та немає зв’язків YiYiY_i, наведена вище формула еквівалентна де di=yi−xidi=yi−xid_i = y_i …

1
Тест на коефіцієнт ймовірності - lmer R - Невкладені моделі
Зараз я переглядаю деяку роботу і натрапив на таке, що мені здається неправильним. Дві змішані моделі встановлені (в R) за допомогою lmer. Моделі не вкладені і порівнюються за тестами співвідношення ймовірності. Коротше кажучи, ось відтворювальний приклад того, що я маю: set.seed(105) Resp = rnorm(100) A = factor(rep(1:5,each=20)) B = factor(rep(1:2,times=50)) …

4
З точки зору ймовірності Баєса, чому 95-відсотковий інтервал достовірності не містить справжнього параметра з 95% -ною ймовірністю?
На сторінці Вікіпедії про довірчі інтервали : ... якщо довірчі інтервали побудовані через безліч окремих аналізів даних повторних (і, можливо, різних) експериментів, частка таких інтервалів, які містять справжнє значення параметра, буде відповідати рівню довіри ... І з тієї ж сторінки: Інтервал довіри не передбачає, що справжнє значення параметра має особливу …

3
Оцінка n в проблемі збирача купонів
Залежно від проблеми з колекціонером купонів , ви не знаєте кількості талонів і повинні визначати це на основі даних. Я буду називати це проблемою файлів cookie: Враховуючи невідому кількість чітких повідомлень cookie , оцініть , відбираючи файли cookie по одному та підраховуючи, скільки разів з’являється кожна статка. Визначте також кількість …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.