Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
ANOVA з незалежними спостереженнями
Вибачте за докладний фон цього питання: Іноді під час дослідження поведінки тварин експериментатора цікавить кількість часу, який випробуваний проводить у різних, заздалегідь визначених зонах, у тестовому апараті. Я часто бачив подібні дані, що аналізуються за допомогою ANOVA; однак я ніколи не був повністю переконаний у справедливості таких аналізів, враховуючи, що …
11 anova 

1
Які хороші рамки для вибору методу?
Я розглядав теоретичні рамки вибору методу (зауважте: не вибір моделі) і знайшов дуже мало систематизованих, математично мотивованих робіт. Під «вибором методу» я маю на увазі основу для виокремлення відповідного (або кращого, оптимального) методу щодо проблеми чи типу проблеми. Я знайшов, що це суттєва робота, що стосується конкретних методів та їх …

1
Як я можу адаптувати ANOVA для двійкових даних?
У мене є чотири конкуруючі моделі, які я використовую для прогнозування бінарної змінної результату (скажімо, статус зайнятості після закінчення навчання, 1 = працевлаштований, 0 = не зайнятий) для n предметів. Природним показником продуктивності моделі є показник враження, який становить відсоток правильних прогнозів для кожної з моделей. Мені здається, що я …

3
Чи існує стандартна методика налагодження програм MCMC?
Налагодження програм MCMC, як відомо, важко. Складність виникає через кілька питань, серед яких є: (а) Циклічність алгоритму Ітеративно ми намалюємо параметри, що обумовлюються всіма іншими параметрами. Таким чином, якщо реалізація не працює належним чином, важко виділити помилку, оскільки проблема може бути в будь-якому місці ітеративного пробника. (b) Правильна відповідь не …
11 mcmc 

4
Чи відрізняється Пророк від Facebook від лінійної регресії?
Тож, що я читав про пророка Facebook, це те, що він в основному розбиває часові ряди на тренди та сезонність. Наприклад, модель добавки буде записана у вигляді: у( t ) = g( t ) + s ( t ) + h ( t ) + eту(т)=г(т)+с(т)+год(т)+ет y(t) = g(t) + …

2
Чи має значення напрямок причинності між приладом і змінною?
Стандартна схема інструментальної змінної з точки зору причинності ( ->): Z -> X -> Y Де Z - інструмент, X - ендогенна змінна, а Y - відповідь. Чи можливо, що наступні відносини: Z <- X ->Y Z <-> X ->Y також чинні? Хоча співвідношення між інструментом та змінною задовольняється, як …

3
Чи означає, що центрування зменшує коваріацію?
Якщо припустити, що у мене є дві незалежні випадкові величини, і я хочу максимально зменшити коваріацію між ними, не втрачаючи занадто багато "сигналу", чи означає центринг допомогу? Я десь читав, що середнє центрування зменшує кореляцію на значний фактор, тому я думаю, що це повинно зробити те ж саме для коваріації.


4
Достатні та необхідні умови для нульового власного значення кореляційної матриці
Враховуючи випадкової величини , з розподілом ймовірності , кореляційна матриця є позитивною , тобто її власними значеннями є позитивними або нульовими.nnnXiXiX_iP(X1,…,Xn)P(X1,…,Xn)P(X_1,\ldots,X_n)Cij=E[XiXj]−E[Xi]E[Xj]Cij=E[XiXj]−E[Xi]E[Xj]C_{ij}=E[X_i X_j]-E[X_i]E[X_j] Мене цікавлять умови на , необхідні та / або достатні, щоб мав нульові власні значення. Наприклад, достатньою умовою є те, що випадкові величини не є незалежними: для деяких …

2
Створюйте рівномірний шум із кулі p-норми ( )
Я намагаюся написати функцію, яка генерує рівномірно розподілений шум, який походить від кулі p-норми розмірів:nnn ||x||p≤r||x||p≤r\begin{equation} ||x||_p \leq r \end{equation} Я знайшов можливі рішення для кіл ( ) ( http://mathworld.wolfram.com/DiskPointPicking.html ), проте у мене виникають проблеми з розширенням цього значення для різних значень .pp=2p=2p = 2ppp Я спробував це зробити, …
11 simulation  noise 


2
Чому існують рекомендації щодо використання Jeffreys або льотчиків на основі ентропії для пробників MCMC?
На своїй вікі-сторінці розробники компанії Stan заявляють: Деякі принципи, які нам не подобаються: інваріантність, Джефріс, ентропія Натомість я бачу багато нормальних рекомендацій щодо розповсюдження. Поки я використовував байєсівські методи, які не покладалися на вибірку, і я був щасливий, що зрозумів, чому був хорошим вибором для біноміальних ймовірностей.θ∼Beta(α=12,β=12)θ∼Beta(α=12,β=12)\theta \sim \text{Beta}\left(\alpha=\frac{1}{2},\beta=\frac{1}{2}\right)
11 bayesian  mcmc  prior  pymc  stan 

3
Методи ініціалізації кластеризації K-засобів
Мене цікавить сучасний стан вибору початкових насінин (центрів кластерів) для K-засобів. Гуглінг призводить до двох популярних варіантів: випадковий відбір початкових насіння, і, використовуючи техніку відбору KMeans ++: Артур та Васильвіцький 2006 k-засоби ++: Переваги дбайливого висіву насіння Чи є якісь багатообіцяючі методи, про які хтось тут знає, які можуть бути …

1
Чому неправильно трактувати SVM як ймовірність класифікації?
Я розумію, що SVM полягає в тому, що він дуже схожий на логістичну регресію (LR), тобто зважена сума ознак передається сигмоїдної функції, щоб отримати ймовірність приналежності до класу, але замість перехресної ентропії (логістичної) втрати функція, тренування виконується за допомогою втрати шарніра. Перевага використання втрати шарніру полягає в тому, що можна …

3
Критерій зупинки для Nelder Mead
Я намагаюся реалізувати алгоритм Nelder-Mead для оптимізації функції. Сторінка вікіпедії про Нелдера-Мід напрочуд чітка щодо всього алгоритму, за винятком критерію його зупинки. Там це сумно говорить: Перевірте на конвергенцію [потрібне уточнення] . Я сам випробував кілька критеріїв: Зупиніться, якщо де малий і де - -та вершина симплекса, впорядкована від низької …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.