Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Найкращий метод створення графіків зростання
Мені потрібно створити діаграми (подібні до діаграм зростання) для дітей віком від 5 до 15 років (лише 5,6,7 тощо; немає дробових значень, як 2,6 років) для змінної стану здоров'я, яка є негативною, безперервною та в діапазон 50-150 (з кількома значеннями поза цим діапазоном). Мені потрібно створити криві 90-го, 95-го та …

3
Аналіз серій разів проти машинного навчання?
Просто загальне питання. Якщо у вас є дані часових рядів, коли краще використовувати методи часових рядів (ака, ARCH, GARCH тощо) над машинними / статистичними методами навчання (KNN, регресія)? Якщо є подібне запитання, яке існує на перекваліфікованій, будь ласка, вкажіть мене на це - подивився і не зміг його знайти.

1
Випадкові лісові ймовірнісні прогнози проти більшості голосів
Здається, Scikit використовує ймовірнісне прогнозування замість більшості голосів для методики моделювання агрегації без пояснення того, чому (1.9.2.1. Випадкові ліси). Чи є чітке пояснення чому? Далі є хороша стаття чи огляд статей для різних методів агрегації моделей, які можна використовувати для випадкового розпалювання лісу? Дякую!

4
Чому б не перетворити log-перетворення всіх змінних, які не представляють основного інтересу?
Книги та дискусії часто говорять про те, що при зіткненні з проблемами (яких існує декілька) з передбачувачем, журнал-трансформація - це можливість. Тепер я розумію, що це залежить від розподілів, а нормальність у прогнозах не є припущенням регресу; але трансформація журналу робить дані більш уніфікованими, менше впливає на людей, що переживають …

2
Як визначити прогнозованість часових рядів?
Одне з важливих питань, з яким стикаються синоптики, - чи можна прогнозувати дану серію чи ні? Я натрапив на статтю " Ентропія як первісний показник передбачуваності " Пітера Катта, яка використовує приблизну ентропію (ApEn) як відносну міру для визначення певного часового ряду. У статті йдеться про: "Менші значення ApEn вказують …

2
Вихід Scikit SVM у багатокласовій класифікації завжди дає однакову мітку
На даний момент я використовую Scikit learn із таким кодом: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') а потім підходять і прогнозують набір даних із 7 різними мітками. Я отримав дивний вихід. Незалежно від того, для якої техніки перехресної перевірки я використовую передбачувану мітку в наборі перевірки, завжди буде …

3
Як витягнути інформацію з матриці розсипання, коли у вас великий N, дискретні дані та багато змінних?
Я граю з набором даних про рак молочної залози і створив розсип усіх атрибутів, щоб зрозуміти, які з них мають найбільший вплив на прогнозування класу malignant(синій) benign(червоний). Я розумію, що рядок являє собою вісь x, а стовпець являє собою вісь y, але я не бачу, які спостереження я можу зробити …

2
Регресія з оберненою незалежною змінною
Припустимо, у мене є вектор залежних змінних і вектор незалежної змінної. Коли побудовано проти , я бачу, що між ними існує лінійна залежність (тенденція до зростання). Тепер це також означає, що між і існує лінійна тенденція до зниження .Y N X Y 1NNNYYYNNNХXXYYY YX1Х1X\frac{1}{X}YYYХXX Тепер, якщо я запускаю регресію: і …

1
Узгодженість 2SLS з бінарною ендогенною змінною
Я прочитав, що оцінювач 2SLS все ще відповідає навіть бінарній ендогенній змінній ( http://www.stata.com/statalist/archive/2004-07/msg00699.html ). На першому етапі замість лінійної моделі буде запущена модель лікування. Чи є якісь офіційні докази, що свідчать про те, що 2SLS все ще відповідає, навіть коли 1-й етап є моделлю probit або logit? А що …

1
bayesglm (arm) проти MCMCpack
Як bayesglm()(в пакеті R-R), так і різні функції в пакеті MCMCpack спрямовані на те, щоб зробити байєсівську оцінку узагальнених лінійних моделей, але я не впевнений, що вони насправді обчислюють одне і те ж. Функції MCMCpack використовують ланцюг Маркова Монте-Карло для отримання (залежного) зразка із спільного заднього для параметрів моделі. bayesglm(), …

1
Плутати у візуальному поясненні власних векторів: як візуально різні набори даних мають однакові власні вектори?
Багато підручників зі статистикою дають інтуїтивну ілюстрацію того, що являють собою власні вектори матриці коваріації: Вектори u і z утворюють власні вектори (ну, ейенакси). Це має сенс. Але одне, що мене бентежить, - це те, що ми отримуємо власні вектори з кореляційної матриці, а не з необроблених даних. Крім того, …

1
Максимальний оцінювач вірогідності для мінімуму експоненціальних розподілів
Я застряг у тому, як вирішити цю проблему. Отже, у нас є дві послідовності випадкових змінних, та для . Тепер і це незалежні експоненціальні розподіли з параметрами і . Однак замість того, щоб спостерігати і , ми замість та спостерігаємо .XiXiX_i я = 1 , . . . , n …

2
Залишкова діагностика та однорідність дисперсій у лінійній змішаній моделі
Перш ніж задавати це питання, я здійснив пошук на нашому сайті і знайшов багато подібних питань (наприклад, тут , тут і тут ). Але я вважаю, що на ці пов’язані питання недостатньо відповіли чи обговорили, тому я хотів би знову поставити це питання. Я вважаю, що має бути велика кількість …

3
K - означає косинусну схожість проти евклідової відстані (LSA)
Я використовую латентний семантичний аналіз для представлення корпусу документів у просторі нижчих розмірів. Я хочу класифікувати ці документи на дві групи за допомогою k-засобів. Кілька років тому я робив це, використовуючи gensim Python і писав власний алгоритм k-означає. Я визначив центроїди кластера за евклідовою відстані, але потім згрупував кожен документ …

2
Приклад двох * корельованих * нормальних змінних, сума яких не є нормальною
Я знаю кілька приємних прикладів пар корельованих випадкових змінних, які гранично нормальні, але не є спільно нормальними. Дивіться цей відповідь на Діліп Sarwate , і цей по кардиналу . Мені також відомий приклад двох нормальних випадкових величин, сума яких не є нормальною. Дивіться цей відповідь на Macro . Але в …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.