Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як зробити узагальнену лінійну модель з декількома залежними змінними в R?
У мене є шість залежних змінних (кількість даних) та кілька незалежних змінних, я бачу, що в MMR сценарій йде так: my.model <- lm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ IV1 + IV2 + ... + IVn) Але, оскільки мої дані налічуються, я хочу використовувати узагальнену лінійну модель, і я спробував це: my.model <- glm(cbind(DV1,DV2,DV3,DV4,DV5,DV6) ~ …

3
Порівняння двох результатів точності класифікатора за статистичною значимістю з t-тестом
Хочу порівняти точність двох класифікаторів за статистичною значимістю. Обидва класифікатори виконуються в одному наборі даних. Це змушує мене вважати, що я повинен використовувати тестовий тест з одного зразка з того, що я читав . Наприклад: Classifier 1: 51% accuracy Classifier 2: 64% accuracy Dataset size: 78,000 Це правильний тест для …

4
Середньосуперечні терміни помилки моделі
Це основне питання щодо моделей Box-Jenkins MA. Як я розумію, модель MA - це в основному лінійна регресія значень часових рядів проти попередніх термінів помилки . Тобто спостереження спочатку регресується проти його попередніх значень а потім одне або більше значень використовуються як терміни помилки для MA модель.е т , . …

1
Вхідні параметри для використання прихованого розподілу Діріхле
Під час використання моделювання тем (Latent Dirichlet Allocation) кількість тем є вхідним параметром, який потрібно вказати користувачеві. Мені здається, що ми також повинні запропонувати збірку наборів тем кандидатів, проти яких повинен діяти процес Діріхле? Чи правильно я розумію? На практиці, як налаштувати такий тип набору кандидатів?

4
Підтвердження розподілу залишків за лінійною регресією
Припустимо, ми провели просту лінійну регресію y=β0+β1x+uy=β0+β1x+uy=\beta_0+\beta_1x+u , зберегли залишки ui^ui^\hat{u_i} та намалюємо гістограму розподілу залишків. Якщо ми отримаємо щось, схоже на звичне розповсюдження, чи можемо ми припустити, що наш термін помилки має такий розподіл? Скажіть, якщо ми з'ясували, що залишки нагадують нормальний розподіл, чи є сенс вважати нормальність терміна …

5
Швидкий метод пошуку найкращих метапараметрів SVM (це швидше, ніж пошук в сітці)
Я використовую моделі SVM для короткострокового прогнозування забруднювачів повітря. Для підготовки нової моделі мені потрібно знайти відповідні метапараметри для моделі SVM (я маю на увазі C, гамма тощо). Документація Libsvm (і багато інших книг, які я прочитав) пропонує використовувати пошук по сітці, щоб знайти ці параметри - тому я в …

1
Інтервал довіри на основі завантажувальної програми
Під час вивчення інтервалу довіри на основі завантажувальної програми я одного разу прочитав таке твердження: Якщо розподіл завантажувальної стрічки скасовано праворуч, довірчий інтервал на основі завантажувальної стрічки включає корекцію, щоб перемістити кінцеві точки ще далі праворуч; це може здатися протиінтуїтивним, але це правильна дія. Я намагаюся зрозуміти логіку, що лежить …

3
Максимальне значення коефіцієнта варіації для обмеженого набору даних
У ході дискусії після нещодавнього запитання про те, чи може стандартне відхилення перевищувати середнє, одне питання було порушено коротко, але ніколи не було повністю відповіді. Тому я прошу це тут. Розглянемо набір негативних чисел де для . Не потрібно, щоб були чіткими, тобто набір міг бути мультисетом. Середнє значення та …

3
Коефіцієнти, залежні від часу в R - як це зробити?
Оновлення : Вибачте за інше оновлення, але я знайшов можливі рішення з дробовими поліномами та конкуруючим пакетом ризиків, з яким мені потрібна допомога. Проблема Я не можу знайти простий спосіб зробити залежний від часу аналіз коефіцієнтів в Р. Я хочу, щоб я міг взяти свій коефіцієнт змінних і зробити це …

5
Чи завжди середньовизначна випадкова величина завжди дорівнює інтегралу її квантильної функції?
Я щойно помітив, що інтегруючи квантильну функцію уніваріантної випадкової змінної (зворотний cdf) від p = 0 до p = 1, створюється середнє значення змінної. Я не чув про подібні стосунки раніше, тому мені цікаво: чи завжди це так? Якщо так, то ці стосунки широко відомі? Ось приклад в python: from …


2
Яка різниця між "тестуванням гіпотези" та "тестом на значимість"?
Чи є різниця між фразами "перевірка гіпотези" та "перевірка значимості" чи вони однакові? Після детальної відповіді від @Micheal Lew, у мене є одна плутанина, що сьогодні гіпотеза (наприклад, t-тест для тестування середнього) є прикладом або "тестування на значимість", або "тестування гіпотез"? Або це поєднання обох? Як би ви їх диференціювали …

2
Як ви записуєте пост-спеціальні результати Tukey?
Який правильний спосіб написати пост-пост результату Tukey? Є кілька прикладів з різними результатами? Скажімо, у вас північ, південь, схід і захід. North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 SD=3.6 std …

1
Властивості логістичних регресій
Ми працюємо з деякими логістичними регресіями, і ми зрозуміли, що середня оцінена ймовірність завжди дорівнює частці одиниць у вибірці; тобто середнє значення пристосованих значень дорівнює середньому зразка. Хтось може мені пояснити причину чи дати мені посилання, де я можу знайти цю демонстрацію?

4
"Нормалізація" змінних для SVD / PCA
Припустимо , що ми маємо NNN вимірних величин, (a1,a2,…,aN)(a1,a2,…,aN)(a_1, a_2, \ldots, a_N) , ми робимо ряд M>NM>NM > N вимірювань, а потім хочете виконати сингулярне розкладання за результатами , щоб знайти осі самої високої дисперсії для MMM точок у NNN -вимірному просторі. ( Примітка: припустить , що кошти я вже …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.