Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Створення індексу якості з декількох змінних для впорядкування ранжування
У мене є чотири числові змінні. Усі вони є мірами якості ґрунту. Чим вище змінна, тим вище якість. Діапазон для всіх них різний: Var1 від 1 до 10 Var2 від 1000 до 2000 Var3 від 150 до 300 Var4 від 0 до 5 Мені потрібно поєднати чотири змінні в єдиний …

4
Як забезпечити властивості коваріаційної матриці при встановленні багатоваріантної нормальної моделі з максимальною ймовірністю?
Припустимо, у мене є така модель yi=f(xi,θ)+εiyi=f(xi,θ)+εiy_i=f(x_i,\theta)+\varepsilon_i де yi∈RKyi∈RKy_i\in \mathbb{R}^K , xixix_i - вектор пояснювальних змінних, θθ\theta - параметри нелінійної функції fff і εi∼N(0,Σ)εi∼N(0,Σ)\varepsilon_i\sim N(0,\Sigma) , де ΣΣ\Sigma природно - матриця K×KK×KK\times K Мета звичайна для оцінки θθ\theta і ΣΣ\Sigma . Очевидним вибором є метод максимальної ймовірності. Вхід правдоподібності для …

2
Генеративні та дискримінаційні моделі (в баєсівському контексті)
Які відмінності між генеративною та дискримінаційною (дискримінантною) моделлю (в контексті байєсівського навчання та умовиводу)? і що це стосується прогнозування, теорії рішень або непідконтрольного навчання?

2
Марков Процес про лише в залежності від попереднього стану
Я просто хотів би, щоб хтось підтвердив моє розуміння або якщо я щось пропускаю. Визначення марківського процесу говорить, що наступний крок залежить лише від поточного стану, а попередніх станів немає. Отже, скажімо, у нас був простір стану a, b, c, d, і ми йдемо від a-> b-> c-> d. Це …

6
Теорія графів - аналіз та візуалізація
Я не впевнений, що тема вступає в цікавий інтерес. Ти скажи мені. Я повинен вивчити графік (з теорії графа ), тобто. У мене є певна кількість точок, які пов'язані. У мене є таблиця з усіма крапками, і крапки, від яких залежить кожна. (У мене є ще одна таблиця з наслідками) …

5
Чи можна довіряти результатам ANOVA для нерозподіленого DV?
Я проаналізував експеримент із повторними заходами ANOVA. ANOVA - це 3x2x2x2x3 з 2 коефіцієнтами між суб'єктами та 3 в межах (N = 189). Коефіцієнт помилок - залежна змінна. Розподіл частоти помилок має перекос 3,64 і куртоз 15,75. Перекос і куртоз є результатом 90% частоти помилок, тобто 0. Читання попередніх тем …

1
Корекція тестування декількох гіпотез з Benjamini-Hochberg, p-значеннями або q-значеннями?
З огляду на перелік p-значень, отриманих незалежними тестами, відсортований у порядку зростання, можна використовувати процедуру Бенджаміні-Гохберга для корекції багаторазового тестування . Для кожного p-значення процедура Бенджаміні-Хохберга дозволяє обчислити показник помилкового виявлення (FDR) для кожного з p-значень. Тобто, при кожній "позиції" у відсортованому списку p-значень воно скаже вам, яка частка цих …

3
Об'єктивна оцінка матриці коваріації для множинні цензуровані дані
Хімічні аналізи зразків навколишнього середовища часто цензуруються нижче за межами звітності або різними межами виявлення / кількості. Останні можуть варіюватися, як правило, пропорційно значенням інших змінних. Наприклад, зразок з високою концентрацією одного з'єднання, можливо, повинен бути розведений для аналізу, в результаті чого пропорційна інфляція меж цензури для всіх інших сполук, …

6
Групуйте різниці за п’ятибальним елементом Likert
Виходячи з цього питання : Уявіть, що ви хочете перевірити на відмінності в центральній тенденції між двома групами (наприклад, чоловіки та жінки) на 5-бальному елементі Likert (наприклад, задоволення життям: Незадоволений задоволеним). Я думаю, що t-тест був би досить точним для більшості цілей, але тест завантаження різниць між груповими засобами часто …

9
Як я можу зрозуміти, який тип розподілу представляє ці дані про час відгуку на ping?
Я взяв вибірковий процес у реальному світі, час пінг-мережі. "Час у зворотній час" вимірюється в мілісекундах. Результати наведені в гістограмі: Часи пінг мають мінімальне значення, але довгий верхній хвіст. Хочу знати, що це статистичний розподіл, і як оцінити його параметри. Незважаючи на те, що розподіл не є нормальним розподілом, я …

1
Загальні статистичні тести як лінійні моделі
(ОНОВЛЕННЯ: Я заглибився в це глибше і опублікував результати тут ) Список названих статистичних тестів величезний. Багато із загальних випробувань покладатися на умовиводи від простих лінійних моделей, наприклад, один-зразок Т-тест тільки у = β + ε , який перевіряється на нуль моделі у = μ + ε то , що …

4
На 50% 100% вище, ніж на 25%, або на 25% вище, ніж на 25%?
Якщо у мене є два значення A і B, обидва виражені у відсотках від C, і я хочу виразити різницю величин між A і B у відсотках D, чи правильніше виразити D у відсотках C, або у відсотках від B (чи справді A)? 50 безробітних, очевидно, на 50% більше, ніж …

3
Як термін помилки регресії коли-небудь можна співвіднести із пояснювальними змінними?
У першому реченні цієї сторінки вікі стверджується, що "В економетрії проблема ендогенності виникає, коли пояснювальна змінна співвідноситься з терміном помилки. 1 " Моє запитання: як це може статися? Чи не вибрано бета-регресію таким чином, щоб термін помилки був ортогональним для стовпчика простору матриці проектування?
22 regression 


9
Як визначити впевненість прогнозу нейронної мережі?
Щоб проілюструвати моє запитання, припустимо, що у мене є навчальний набір, де вхід має ступінь шуму, але вихід, наприклад, не має; # Training data [1.02, 1.95, 2.01, 3.06] : [1.0] [2.03, 4.11, 5.92, 8.00] : [2.0] [10.01, 11.02, 11.96, 12.04] : [1.0] [2.99, 6.06, 9.01, 12.10] : [3.0] тут вихід …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.