Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

6
Використання p-значення для обчислення вірогідності гіпотези; що ще потрібно?
Питання: Одне поширене нерозуміння p-значень полягає в тому, що вони представляють вірогідність того, що нульова гіпотеза є істинною. Я знаю, що це неправильно, і я знаю, що значення p представляють лише ймовірність знаходження вибірки настільки екстремальної, як ця, враховуючи, що нульова гіпотеза є істинною. Однак, інтуїтивно, треба мати можливість вивести …

4
Як інтерпретувати криву виживання моделі Кокса?
Як ви інтерпретуєте криву виживання з пропорційною моделлю небезпеки Кокса? У цьому прикладі іграшки, припустимо, ми маємо коксову пропорційну модель небезпеки для ageзмінної kidneyданих та генеруємо криву виживання. library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() Наприклад, на час 200200200, яке твердження вірно? або обидва помиляються? Заява 1: у …

1
Яке практичне значення альфа в GLM для сімейства гамма?
Я підганяю кілька моделей форми .. glm(DV ~ I(1/IV), family = Gamma(link = "log") .. і шукаю способи порівняння отриманих моделей для різних змінних. Мені цікаво, чи має значення альфа будь-яке практичне використання? Для трьох графіків нижче значення альфа - 17,85, 9,03 та 6,27. Чи містять ці значення будь-яку інформацію, …

1
Як можливе сприймання, що не додає до сотні?
Я читав цей документ про аквапоніку, і деякі статистичні дані не мали сенсу стосовно перелічених відсотків. Який метод дозволив би існувати цим відсоткам? Найпоширенішими водними тваринами на відсоток були тилапія (69%), декоративні риби (43%), соми (25%), інші водні тварини (18%), окунь (16%), синюха (15%), форель ( 10%) і бас (7%). …

3
PCA занадто повільний, коли обидва n, p великі: Альтернативи?
Налаштування проблеми У мене є точки даних (зображення) високого розміру (4096), які я намагаюся візуалізувати у 2D. З цією метою я використовую t-sne таким чином, як у наведеному нижче прикладі коду Карпаті . Документація scikit-learn рекомендує використовувати PCA, щоб спочатку зменшити розмірність даних: Настійно рекомендується використовувати інший метод зменшення розмірності …

1
Нормально розподілені помилки та центральна гранична теорема
У Вступній економетрії Вулдріджа є цитата: Аргумент, що виправдовує нормальний розподіл помилок, зазвичай працює приблизно так: тому що ууu - це сукупність безлічі різних спостережуваних факторів, що впливають ууy, можна зробити висновок про центральну граничну теорему, щоб зробити висновок про це ууu має приблизний нормальний розподіл. Ця цитата стосується одного …


2
Статистичні умовиводи при неправильній специфікації моделі
У мене є загальне методологічне запитання. На це можна було відповісти і раніше, але я не в змозі знайти відповідну тему. Я буду вдячний вказівниками на можливі дублікати. ( Ось чудовий, але без відповіді. Це також схоже за духом, навіть з відповіддю, але остання занадто специфічна з моєї точки зору. …

1
Ймовірність незалежного процесу Пуассона наздогнати інший
Я раніше це питання задавав по-іншому на інших змінах стак-так, тому вибачте за дещо репост. Я запитав свого професора та пару аспірантів про, без остаточної відповіді. Я спершу викладу проблему, потім моє потенційне рішення та проблему з моїм рішенням, так що шкода стіни тексту. Проблема: Припустимо два незалежні процеси Пуассона …

1
Як я можу виділити шумні патчі у часовій серії?
У мене дуже багато даних часових рядів - рівень води та швидкість проти часу. Це результат моделювання гідравлічної моделі. У рамках процесу огляду, щоб підтвердити, що модель працює так, як очікувалося, я повинен будувати кожен часовий ряд, щоб упевнитися у відсутності "коливань" у даних (див. Приклад незначних коливань нижче). Використання …

4
Тренування нейронної мережі до регресії завжди передбачає середнє значення
Я треную просту конвертну нейронну мережу для регресії, де завдання передбачити (x, y) розташування коробки на зображенні, наприклад: На виході мережі є два вузли, один для x і один для y. Решта мережі - це стандартна звивиста нейронна мережа. Втрата - це стандартна середня квадратична помилка між передбачуваною позицією коробки …

2
Який найкращий спосіб оцінити середній ефект лікування при поздовжньому дослідженні?
У поздовжньому дослідженні результати одиниць неодноразово вимірюються в точках часу із загальною кількістю фіксованих випадків вимірювання (фіксований = вимірювання на одиницях проводяться одночасно).Yя тYitY_{it}iiiтttмmm Одиниці випадково призначаються або для лікування, , або контрольної групи, . Я хочу оцінити та протестувати середній ефект від лікування, тобто де очікування приймаються за часом …

1
Чому в роботах рідко повідомляється про те, який тип квадратів використовується в результатах Anova?
Зважаючи на мій короткий досвід статистики, здається, що тип сум квадратів (тип I, II, III, IV ...), що використовуються для отримання результатів ANOVA, може суттєво змінити результати тестів (особливо моделей із взаємодією та відсутніми дані). Однак я ще не бачив жодної статті, яка б про це повідомляла. Чому це так? …

1
Нижче, ніж очікувалося, охоплення вибірки важливості за допомогою моделювання
Я намагався відповісти на питання Оцінка інтеграла Важливість методу відбору проб в R . В основному користувачеві потрібно провести розрахунок ∫π0f(x)dx=∫π01cos(x)2+x2dx∫0πf(x)dx=∫0π1cos⁡(x)2+x2dx\int_{0}^{\pi}f(x)dx=\int_{0}^{\pi}\frac{1}{\cos(x)^2+x^2}dx використання експоненціального розподілу як розподілу важливості q(x)=λ exp−λxq(x)=λ exp−λxq(x)=\lambda\ \exp^{-\lambda x} і знайдіть значення що дає кращу наближення до інтегралу (це ). Я переробка проблеми в якості оцінки середнього …

2
Коли використовувати модель суміші Гаусса?
Я новачок у використанні GMM. Мені не вдалося знайти відповідної допомоги в Інтернеті. Чи може хто-небудь, будь ласка, надати мені правильний ресурс на тему "Як вирішити, чи використання GMM відповідає моїй проблемі?" або у випадку проблем із класифікацією "Як вирішити, чи потрібно використовувати класифікацію SVM чи класифікацію GMM?"

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.