Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як підібрати модель суміші для кластеризації
У мене є дві змінні - X і Y, і мені потрібно зробити кластер максимальним (і оптимальним) = 5. Давайте ідеальний сюжет змінних такий: Я хотів би зробити з цього 5 кластерів. Щось на зразок цього: Тому я думаю, що це суміш з 5 кластерами. Кожен кластер має центральну точку …

2
P-значення, що дорівнює 0 в перестановковому тесті
У мене є два набори даних, і я хотів би знати, чи вони значно відрізняються чи ні (це походить від " Дві групи значно відрізняються? Тест для використання "). Я вирішив використати тест на перестановку, зробивши наступне в R: permutation.test <- function(coding, lncrna) { coding <- coding[,1] # dataset1 lncrna …

1
Регресія в налаштуваннях
Я намагаюся зрозуміти, чи варто йти на регресію хребта , LASSO , регресію основного компонента (PCR) або часткові найменші квадрати (PLS) у ситуації, коли існує велика кількість змінних / ознак ( ) та менша кількість зразків ( n < p ), і моя мета - передбачення.pppn<pn<pn np>10np>10np>10n Змінні ( і …

4
Наскільки дивним є скупчення літальних аварій?
Оригінальне запитання (25.07.14): Чи має сенс ця цитата ЗМІ, чи існує кращий статистичний спосіб перегляду пластика останніх авіакатастроф? Однак Барнетт також звертає увагу на теорію розподілу Пуассона, з якої випливає, що короткі проміжки між аваріями насправді є більш вірогідними, ніж довгі. "Припустимо, що в середньому трапляється одна смертельна аварія на …

1
Чи є сенс виконувати односхилий тест Колмогорова-Смірнова?
Чи є сенс і чи можливо виконати односхилий тест KS? Якою була б нульова гіпотеза такого тесту? Або тест KS по суті є двосхилим тестом? Я отримав би вигоду з відповіді, яка допомогла мені зрозуміти розподіл D (я працюю за документом Массі 1951 року, і вважаю опис складним, наприклад, і …

3
Мій розподіл нормальний; Тест Колмогорова-Смірнова не погоджується
У мене проблема з нормальністю деяких даних, які я маю: я зробив тест Колмогорова, який говорить, що це не нормально для p = .0000, я не розумію: хиткість мого розподілу = -. 497, і куртоз = -0,024 Ось сюжет мого розповсюдження, який виглядає дуже нормально ... (У мене є три …

3
Прогнозування дисперсії гетеросептичних даних
Я намагаюся зробити регресію на гетеросептичних даних, де я намагаюся передбачити відхилення помилок, а також середні значення з точки зору лінійної моделі. Щось на зразок цього: y(x,t)ξ(x,t)y¯(x,t)σ(x,t)=y¯(x,t)+ξ(x,t),∼N(0,σ(x,t)),=y0+ax+bt,=σ0+cx+dt.y(x,t)=y¯(x,t)+ξ(x,t),ξ(x,t)∼N(0,σ(x,t)),y¯(x,t)=y0+ax+bt,σ(x,t)=σ0+cx+dt.\begin{align}\\ y\left(x,t\right) &= \bar{y}\left(x,t\right)+\xi\left(x,t\right),\\ \xi\left(x,t\right) &\sim N\left(0,\sigma\left(x,t\right)\right),\\ \bar{y}\left(x,t\right) &= y_{0}+ax+bt,\\ \sigma\left(x,t\right) &= \sigma_{0}+cx+dt. \end{align} y(x,t)y(x,t)y(x,t)xxxttty¯(x,t)y¯(x,t)\bar{y}(x,t)xxxtttξ(x,t)ξ(x,t)\xi(x,t)x,tx,tx,txxxttt y¯y¯\bar{y} σσ\sigmay0,a,b,σ0,cy0,a,b,σ0,cy_0, a, b, \sigma_0, cddd

3
Пропозиції щодо чутливого до навчання часу в умовах сильно незбалансованого середовища
У мене є набір даних з кількома мільйонами рядків і ~ 100 стовпців. Я хотів би виявити близько 1% прикладів у наборі даних, які належать до загального класу. У мене мінімальне обмеження точності, але через дуже асиметричну вартість я не надто захоплююсь будь-яким особливим відкликанням (до тих пір, поки мені …

1
Тезаурус для статистики та термінів машинного навчання
Чи існує довідковий тезаурус для статистики та термінів машинного навчання? Я знаю, що статті Вікіпедії часто містять синоніми, але я хотів би мати простий тезаурус, який я міг би легко пройти (проти повної енциклопедії), щоб переконатися, що знаю всі жаргони.

2
Регресія хребта - байєсова інтерпретація
Я чув, що регресія хребта може бути отримана як середнє значення заднього розподілу, якщо попередній адекватно обраний. Чи є інтуїція, що обмеження, встановлені на коефіцієнти регресії за попередніми (наприклад, стандартні нормальні розподіли навколо 0), ідентичні / замінюють штраф, встановлений на квадратному розмірі коефіцієнтів? Чи повинен попередній бути гауссом, щоб дотримуватися …

1
Зменшення Джині та домішка Джині у дитячих вузлах
Я працюю над мірою важливості функції Джині для випадкових лісів. Тому мені потрібно обчислити зменшення домішки вузла Джіні. Ось як я це роблю, що призводить до конфлікту з визначенням, що говорить про те, що я десь повинен помилятися ... :) Для двійкового дерева та, враховуючи ймовірність лівих і правих дітей, …

1
Що означає пояснити дисперсію?
Зокрема, мені цікаво, чому у нас є ця концепція Множина R (яку я можу зрозуміти як співвідношення між спостережуваними та прогнозованими балами при множинній регресії), а потім окрема концепція R-квадрата, яка є просто квадратом або Р. Мені було повідомлено, що R-квадрат - це зміна відсоткової зміни, а R - ні, …

3
SVM для незбалансованих даних
Я хочу спробувати використовувати векторні машини підтримки (SVM) у своєму наборі даних. Перш ніж спробувати проблему, мене попередили, що SVM не справляються з надзвичайно незбалансованими даними. У моєму випадку я можу мати 95-98% 0 і 2-5% 1. Я намагався знайти ресурси, які говорили про використання SVM на рідкісних / незбалансованих …

6
Як виявити поляризовані думки користувачів (високі та низькі рейтинги зірок)
Якщо у мене є система оцінок зірок, де користувачі можуть висловити перевагу товару чи предмету, як я можу статистично визначити, якщо голоси сильно «розділені». Тобто, навіть якщо середній показник для кожного продукту становить 3 з 5, як я можу виявити, що це розділення 1-5 проти консенсусу 3, використовуючи лише дані …

3
Чому ніхто не використовує байєсовський багаточленний класичний наївний Байєс?
Так, у (непідконтрольному) текстовому моделюванні, латентне розподілення Діріхле (LDA) є баєсовою версією ймовірнісного латентного семантичного аналізу (PLSA). По суті, LDA = PLSA + Діріхле перед своїми параметрами. Я розумію, що LDA тепер є контрольним алгоритмом і реалізується в різних пакетах, тоді як PLSA більше не слід використовувати. Але в (під …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.