Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Залишкова стандартна різниця похибок між оптимальним та glm
Я намагаюся відтворити optimрезультати з простої лінійної регресії, забезпеченої glmабо навіть nlsR-функціями. Оцінки параметрів однакові, але оцінка залишкової дисперсії та стандартні похибки інших параметрів не однакові, особливо коли розмір вибірки невеликий. Я припускаю, що це пов'язано з різницею в тому, як обчислюється залишкова стандартна помилка між максимальною ймовірністю та найменшим …


3
Інтуїція за рівнем небезпеки
Мене плутає рівняння, яке служить визначенням рівня небезпеки. Я розумію, що таке рівень небезпеки, але я просто не бачу, як рівняння виражає цю інтуїцію. Якщо - випадкова величина, яка представляє момент часу смерті когось на часовому інтервалі . Тоді рівень небезпеки:xxx[0,T][0,T][0,T] h(x)=f(x)1−F(x)h(x)=f(x)1−F(x)h(x)=\frac{f(x)}{1-F(x)} Там , де не представляє собою ймовірність смерті …

2
Динамічний вигляд систем теореми центральної межі?
(Спочатку розміщено на MSE.) Я бачив, як багато евристичних дискусій класичної теореми про центральну межу говорять про нормальний розподіл (або будь-який із стабільних розподілів) як про «атрактор» у просторі ймовірностей щільності. Наприклад, розгляньте ці пропозиції у верхній частині звернення Вікіпедії : У більш загальному використанні центральною граничною теоремою є будь-яка …

2
Чому F-тест настільки чутливий для припущення про нормальність?
Чому F -тест різниці дисперсій настільки чутливий до припущення про нормальний розподіл навіть для великих NNN ? Я спробував здійснити пошук в Інтернеті та відвідав бібліотеку, але жодна з них не дала хороших відповідей. Там сказано, що тест дуже чутливий до порушення припущення про нормальний розподіл, але я не розумію, …

5
До 5-бальної шкали Лікерта додано 6-й варіант відповіді ("я не знаю"). Чи втрачаються дані?
Мені потрібно трохи допомогти в пошкодженні даних з анкети. Один з моїх колег застосував анкету, але ненавмисно, замість того, щоб використати оригінальну 5-бальну шкалу Лікерта (категорично не погоджуюсь із сильною згодою), він вставив 6-ю відповідь у шкалу. І, що ще гірше, шостий варіант відповіді… “Я не знаю”. Проблема полягає у …

1
Хтось, окрім Егона Пірсона, звертався до папери Госсета 1904 року?
Хтось окрім Егона Пірсона звертався до доповіді Вільяма Сілі Госсета 1904 р. "Застосування" Закону про помилку "до роботи пивоварні"? Я думаю, що це властивість Гіннеса, але, враховуючи його історичне значення, було б дуже цікаво прочитати, якби хтось знав, як це зробити.

2
Найсучасніший досвід загального навчання за даними 69 року
Я намагаюся зрозуміти контекст відомої книги Міньського та Паперта «Перцептрони» 1969 року, настільки критичного для нейронних мереж. Наскільки я знаю, інших загальних алгоритмів навчання під контролем не було, окрім персептрон: дерева рішень почали стати корисними лише наприкінці 70-х, випадкові ліси та СВМ - 90-ті. Здається, що метод джекніфа був уже …

1
Caret - Повторна перехресна перевірка K-кратної та вкладеної K-кратної перехресної перевірки, повторена n-разів
Пакет caret - це блискуча бібліотека R для побудови декількох моделей машинного навчання, має декілька функцій для побудови моделі та оцінки. Для налаштування параметрів та навчання моделей, пакет caret пропонує «повторний cv» як один із методів. Як хороша практика, налаштування параметрів може бути здійснено з використанням вкладеної перехресної перевірки K-кратного, …

2
"Всі ці точки даних походять з одного розподілу". Як перевірити?
Я відчуваю, що я бачив цю тему, яку обговорювали тут раніше, але не зміг знайти нічого конкретного. Потім знову я також не дуже впевнений, що шукати. У мене є одномірний набір упорядкованих даних. Я гіпотезую, що всі точки в множині виведені з одного розподілу. Як я можу перевірити цю гіпотезу? …

1
Чи слід використовувати повторну перехресну перевірку для оцінки прогнозних моделей?
Я зіткнувся з цією статтею Гітти Ванвінккелен та Хендріка Блокеля в 2012 році, ставлячи під сумнів корисність повторної перехресної перевірки, яка стала популярною методикою зменшення дисперсії перехресної перевірки. Автори продемонстрували, що при повторній перехресній валідації зменшується дисперсія прогнозування моделі, оскільки один і той же набір даних вибірки перепробовується, середнє значення …

2
Чому його називають «стандартним» відхиленням?
У мене є просте - і, можливо, очевидно тривіальне - питання: чому стандартне відхилення називається саме так, " стандартним "? Це тому, що воно стандартизує порівняння наборів даних та результатів щодо їх розповсюдження? Пошук на Stack Exchange не викликає цього питання, а також пошук Google з етимології терміна не дає …

2
Чому регресія хребта не скоротить деякі коефіцієнти до нуля, як ласо?
При поясненні регресії LASSO часто використовується діаграма алмазу і кола. Кажуть, що оскільки форма обмеження в LASSO є алмазом, отримане рішення з найменшими квадратами може торкатися кута алмазу таким чином, що це призводить до усадки деякої змінної. Однак при регресії хребта, оскільки це коло, він часто не торкнеться осі. Я …

1
При множинній лінійній регресії чому графік прогнозованих точок не лежить у прямій?
Я використовую численні лінійні регресії для опису зв’язків між Y і X1, X2. З теорії я зрозумів, що множинна регресія передбачає лінійні зв’язки між Y і кожним з X (Y і X1, Y і X2). Я не використовую жодної трансформації X. Отже, я отримав модель з R = 0,45 і …

3
Двоступеневі моделі: різниця між моделями Гекмана (для вирішення відбору вибірки) та інструментальними змінними (для боротьби з ендогенністю)
Я намагаюся обміняти різницю між відбором вибірки та ендогенністю, і в свою чергу, чим моделі Гекмана (для вирішення відбору вибірки) відрізняються від інструментальних змінних регресій (для боротьби з ендогенністю). Чи правильно сказати, що відбір вибірки - це специфічна форма ендогенності, де ендогенна змінна - це ймовірність лікування? Крім того, мені …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.