Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Чому звичайні найменші квадрати працюють краще, ніж пуассонова регресія?
Я намагаюся вписати регресію, щоб пояснити кількість вбивств у кожному районі міста. Хоча я знаю, що мої дані слідують за розповсюдженням Пуассона, я намагався встановити OLS так: log(y+1)=α+βX+ϵlog(y+1)=α+βX+ϵlog(y+1) = \alpha + \beta X + \epsilon Потім я також спробував (звичайно!) Регресію Пуассона. Проблема полягає в тому, що я маю кращі …

4
Чи слід вважати, що в статистиці
Я вивчаю статистику і часто натрапляю на формули, що містять, logі я завжди плутаюся, якщо мені слід тлумачити це як стандартне значенняlog , тобто базу 10, або якщо в статистиці цей символ log зазвичай вважається природним журналом ln. Зокрема, я вивчаю оцінку частоти хорошого Тюрінга як приклад, але моє питання …

4
Порівняння двох гістограм за допомогою відстані Chi-Square
Я хочу порівняти два образи облич. Я підрахував їхні LBP-гістограми. Тому зараз мені потрібно порівняти ці дві гістограми і отримати щось, що дозволить сказати, наскільки ці гістограми рівні (0 - 100%). Існує багато способів вирішення цього завдання, але автори методу LBP підкреслюють (Опис обличчя з локальними бінарними візерунками: Застосування до …

1
Метод другого моменту, броунівський рух?
Нехай - це стандартний броунівський рух. Нехай позначає подію і нехай де позначає функцію індикатора. Чи існує такий, що для для всіх ? Я підозрюю, що відповідь - так; Я спробував возитися з методом другого моменту, але не дуже. Чи можна це показати методом другого моменту? Або я повинен спробувати …

2
Швидкість, обчислювальні витрати PCA, LASSO, еластична сітка
Я намагаюся порівняти складну обчислювальну складність / швидкість оцінки трьох груп методів лінійної регресії, як це відмічено у Hastie et al. "Елементи статистичного навчання" (2-е видання), глава 3: Вибір підмножини Методи усадки Методи з використанням похідних напрямків введення (PCR, PLS) Порівняння може бути дуже приблизним, просто щоб дати деяку думку. …


1
Парадокс у виборі моделі (AIC, BIC, пояснити чи передбачити?)
Прочитавши Галіт Шмулі «Пояснити або передбачити» (2010), мене спантеличить очевидне протиріччя. Є три приміщення, Вибір моделі на основі AIC проти BIC (кінець стор. 300 - початок стор. 301): просто кажучи, AIC слід використовувати для вибору моделі, призначеної для прогнозування, тоді як BIC слід використовувати для вибору моделі для пояснення . …

4
Чому розділення даних на навчальний і тестовий набір недостатньо
Я знаю, що для отримання продуктивності класифікатора я повинен розділити дані на навчальний / тестовий набір. Але читаючи це : Оцінюючи різні параметри ("гіперпараметри") для оцінювачів, таких як настройка C, яку необхідно встановити вручну для SVM, все ще існує ризик перевиконання тестового набору, оскільки параметри можна налаштувати до тих пір, …

3
Хороший приклад, коли серія без одиничного кореня не є нерухомою?
Я кілька разів бачив, як люди відкидають нуль у розширеному тесті Діккі-Фуллера , а потім стверджують, що він показує, що їх серія є нерухомою (на жаль, я не можу показати джерела цих тверджень, але я думаю, що подібні твердження існують тут і там у той чи інший журнал). Я стверджую, …

1
Чит-лист ANOVA Алфавітний суп та еквіваленти регресії
Чи можу я отримати допомогу у виконанні цієї попередньої (триває) спроби отримати підшипники на еквівалентах ANOVA та REGRESSION? Я намагаюся узгодити поняття, номенклатуру та синтаксис цих двох методологій. Є багато повідомлень на цьому сайті , про їх спільності, наприклад , цього або цього , але це все-таки добре мати швидкий …

5
Що таке розмір ефекту… і чому він навіть корисний?
У мене є інформація про статистику на вступному рівні для випускників (припустимо, я знаю математичну статистику та ймовірність на рівні бакалаврату (наприклад, Wackerly et al., Ross’s Probability) і маю деякі знання з теорії вимірювань). Нещодавно я розпочав роботу з експериментального проектування та статистичної звітності зі статистики освіти, і був розміщений …

2
Осмислення незалежного компонентного аналізу
Я бачив і насолоджувався питанням Ознайомлення з аналізом основних компонентів , і тепер у мене є те саме питання для незалежного аналізу компонентів. Я хочу сказати, що я хочу поставити вичерпне запитання про інтуїтивні способи розуміння ICA? Я хочу це зрозуміти . Я хочу досягти мети цього. Я хочу відчути …
18 intuition  ica 

2
У моделі Пуассона, яка різниця між використанням часу як коваріату чи зміщення?
Нещодавно я виявив, як моделювати експозиції з часом, використовуючи журнал (наприклад) часу як зміщення в регресії Пуассона. Я зрозумів, що зміщення відповідає тому, що час є коваріатним з коефіцієнтом 1. Я хотів би краще зрозуміти різницю між використанням часу як зміщення або як нормального коваріату (тому оцінюючи коефіцієнт). У якій …

2
У чому проблема з емпіричними пріорами?
У літературі я іноді натрапляю на зауваження, що вибір теоретиків, які залежать від самих даних (наприклад, Zellners g-prior), можна піддавати критиці з теоретичної точки зору. Де саме проблема, якщо попередній не обраний незалежно від даних?

1
Як повідомляється про матрицю плутанини при перехресній валідації K-кратної?
Припустимо, я роблю K-кратну перехресну перевірку з K = 10 разів. Буде одна матриця плутанини для кожної складки. Звітуючи про результати, я повинен обчислити, що є середньою матрицею плутанини, або просто підсумовувати матриці плутанини?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.