Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як я можу отримати значну загальну ANOVA, але немає значних парних відмінностей від процедури Tukey?
Я виступав з R ANOVA і отримав значні відмінності. Однак, перевіряючи, які пари суттєво відрізнялися за допомогою процедури Tukey, я не отримав жодної з них. Як це можливо? Ось код: fit5_snow<- lm(Response ~ Stimulus, data=audio_snow) anova(fit5_snow) > anova(fit5_snow) Analysis of Variance Table Response: Response Df Sum Sq Mean Sq F …

2
Як лінійний дискримінантний аналіз зменшує розміри?
Є слова з "Елементи статистичного навчання" на сторінці 91: K-центроїди в p-мірному вхідному просторі охоплюють не більше K-1 розмірного підпростору, і якщо p набагато більший за K, це буде значним зниженням розмірності. У мене є два питання: Чому K-центроїди в p-мірному вхідному просторі охоплюють щонайбільше K-1 розмірне підпростір? Як розташовані …

2
Як обчислити недоумкування утримування за допомогою латентного розподілу Діріхле?
Мене бентежить питання про те, як обчислити здивування зразка затримки, коли роблять приховане розподілення Діріхле (LDA). Документи на тему бризнуть над нею, змушуючи мене думати, що я пропускаю щось очевидне ... Здивування сприймається як хороший показник ефективності для LDA. Ідея полягає в тому, щоб ви зберігали зразок проведення, навчали свій …

4
Використання зміщення у біноміальній моделі для обліку збільшення кількості пацієнтів
Два пов'язаних з мене питання. У мене є кадр даних, який містить кількість пацієнтів в одному стовпчику (діапазон 10 - 17 пацієнтів) та 0 та 1, які показують, чи трапився інцидент того дня. Я використовую біноміальну модель, щоб регресувати ймовірність інциденту на кількості пацієнтів. Однак я хотів би пристосуватися до …


5
Які надійні методи кореляції використовуються?
Я планую зробити симуляційне дослідження, де я порівнюю ефективність декількох надійних методів кореляції з різними розподілами (косою, з атрибутами тощо). Під міцним , я маю на увазі ідеальний випадок бути стійким проти: а) перекошених розподілів, б) переживачів та в) важких хвостів. Поряд із співвідношенням Пірсона як базової лінії, я думав …

1
Як слід розраховувати стандартні помилки для оцінок моделі змішаних ефектів?
Зокрема, як слід обчислювати стандартні похибки фіксованих ефектів у лінійній моделі змішаних ефектів (у частістському розумінні)? Мене припускають вважати, що типові оцінки ( ), такі як представлені у Laird and Ware [1982], дадуть SE тим, що недооцінюються за розміром, оскільки оцінювані компоненти дисперсії трактуються так, ніби вони є справжніми значеннями.V …

2
Змінна важливість від GLMNET
Я розглядаю використання ласо як методу вибору функцій та підгонки прогнозної моделі з бінарною ціллю. Нижче наведено якийсь код, з яким я грав, щоб спробувати метод з регульованою логістичною регресією. Моє запитання: я отримую групу "значущих" змінних, але чи можу я класифікувати їх для оцінки відносної важливості кожної? Чи можна …

2
Глибоке навчання проти дерев рішень та прискорення методів
Я шукаю статті чи тексти, які порівнюють та обговорюють (емпірично чи теоретично): Подвоєння і дерев рішень алгоритми , такі як випадкових лісів або AdaBoost і GentleBoost стосовно до дерев рішень. з Методи глибокого навчання, такі як машини з обмеженим Больцманом , ієрархічна часова пам’ять , конволюційні нейронні мережі тощо. Більш …

4
Чим байєсівська рамка краще тлумачиться, коли ми зазвичай використовуємо неінформативні або суб'єктивні пріори?
Часто стверджується, що байєсівська рамка має велику перевагу в інтерпретації (над частотою), оскільки вона обчислює ймовірність параметра, заданого даними - замість як у частістські рамки. Все йде нормально.p ( x | θ )p ( θ | x )p(θ|x)p(\theta|x)p ( x | θ )p(x|θ)p(x|\theta) Але, ціле рівняння засноване на: p ( …



3
Чи є спосіб максимально / мінімізувати власну функцію в R?
Я намагаюся мінімізувати власну функцію. Він повинен прийняти п'ять параметрів і набір даних і робити всілякі обчислення, виробляючи єдине число як вихід. Я хочу знайти комбінацію з п'яти вхідних параметрів, яка дає найменший вихід моєї функції.
18 r  optimization 

5
Широка масштабна класифікація тексту
Я хочу зробити класифікацію моїх текстових даних. У мене 300 classes200 навчальних документів на заняття (так 60000 documents in total), і це, ймовірно, призведе до дуже високих розмірних даних (ми можемо шукати розміри, що перевищують 1 мільйон ). Я хотів би виконати наступні кроки в трубопроводі (просто щоб ви зрозуміли, …

3
Обчислювальний відсотковий ранг в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 3 роки тому . Як я можу додати нову змінну в кадр даних, який буде відсотковим рангом однієї зі змінних? Я можу це зробити в Excel …
18 r  quantiles 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.