Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Гарна практика для статистичного аналізу в бізнес-середовищі
(Хоча я усвідомлюю, що мова йде не лише про статистику, а про поширення статистики в діловому середовищі, тому я припускаю, що вона все ще знаходиться в межах теми резюме) Короткий фон: Наше ділове середовище (і я підозрюю, що в інших середовищах) підтримує функцію, яка спеціалізується на статистичному аналізі та дослідженнях. …

2
U-тест Манна-Вітні: довірчий інтервал для розміру ефекту
Згідно з Фріцем, Моррісом та Ріхлером (2011; див. Нижче), може бути обчислений як розмір ефекту для U-тесту Манна-Вітні, використовуючи формулу Це зручно мене, як я повідомляю також і в інших випадках. Я хотів би повідомити про довірчий інтервал для на додаток до міри розміру ефекту.r = zrrr rrr=zN−−√r=zN r = …

1
R: нормальність тесту залишків лінійної моделі - які залишки використовувати
Я хотів би зробити W тест Шапіро Вілка і тест Колмогорова-Смірнова на залишки лінійної моделі, щоб перевірити їх нормальність. Мені було просто цікаво, які залишки слід використовувати для цього - залишки сировини, залишки Пірсона, залишки в студії або стандартизовані залишки? Для W тесту Shapiro-Wilk W виявляється, що результати для залишків …

5
Як я можу найкраще боротися з ефектами маркерів з різним рівнем щедрості в оцінюванні студентських робіт?
Близько 600 студентів мають оцінку за обширною оцінкою, яку можна припустити, що вона має хорошу надійність / достовірність. Оцінка оцінюється з 100, і це тест з множинним вибором, позначений комп'ютером. Ці 600 студентів також мають бали за другою, другорядною оцінкою. У цій другій частині оцінювання вони розділені на 11 когорт …

1
Неправильний висновок, коли спостереження не є незалежними
З елементарної статистики я дізнався, що для загальної лінійної моделі, щоб умовиводи були дійсними, спостереження повинні бути незалежними. Якщо відбувається кластеризація, незалежність може більше не приводити до недійсного висновку, якщо це не враховується. Один із способів обліку такої кластеризації - це використання змішаних моделей. Я хотів би знайти приклад набору …

2
Чи можна за допомогою пакету caret отримати матриці плутанини для конкретних порогових значень?
Я отримав модель логістичної регресії (через train) для бінарного відповіді, і я отримав логістичну матрицю сплутаності через confusionMatrixв caret. Це дає мені матрицю плутанини логістичної моделі, хоча я не впевнений, який поріг використовується для її отримання. Як отримати матрицю плутанини для конкретних порогових значень, використовуючи confusionMatrixв caret?

2
Приклад непослідовного оцінювача максимальної вірогідності
Я читаю коментар до статті, і автор стверджує, що іноді, хоча оцінювачі (знайдені за ML або максимальною квазіімовірністю) можуть бути невідповідними, потужність коефіцієнта ймовірності або тесту квазівірогідності все ж може сходитися до 1, оскільки кількість спостережуваних даних має тенденцію до нескінченності (консистенція тесту). Як і коли це відбувається? Чи знаєте …

1
Чому б не завжди використовувати ансамблеве навчання?
Мені здається, що ансамблеве навчання завжди дасть кращі показники прогнозування, ніж лише одна гіпотеза навчання. То чому б ми не використовували їх постійно? Моя здогадка, можливо, через обчислювальні обмеження? (навіть тоді ми використовуємо слабкі предиктори, тому я не знаю).

1
Як перевірити, чи відповідає розподіл закону про владу?
У мене є дані про те, скільки користувачів публікує скільки питань. Наприклад, [UserCount, QuestionCount] [2, 100] [9, 10] [3, 80] ... ... Це означає, що кожен користувач опублікував 100 запитань, 9 користувачів - 10 питань тощо. Отже, як я можу визначити, чи відповідає UserCount, QuestionCountрозподіл закону про владу? Я знайшов …

4
Чим перехресна перевірка відрізняється від прослуховування даних?
Я щойно закінчив "Вступ до статистичного навчання" . Мені було цікаво, чи відрізняється використання перехресної перевірки для пошуку найкращих параметрів настройки для різних методів машинного навчання, ніж провірка даних? Ми неодноразово перевіряємо, яке значення параметра налаштування призводить до найкращого прогнозного результату в тестовому наборі. Що робити, якщо параметр настройки, до …

1
Чому lm () R повертає різні оцінки коефіцієнта, ніж мій підручник?
Фон Я намагаюся зрозуміти перший приклад в курсі пристосування моделей (тому це може здатися смішно простим). Я зробив обчислення вручну, і вони відповідають прикладу, але коли я повторюю їх у R, коефіцієнти моделі вимкнено. Я вважав, що різниця може бути пов’язана з підручником із застосуванням дисперсії сукупності ( ), тоді …
13 r  regression  self-study  lm 

2
Чи коли-небудь є причина не використовувати ортогональні многочлени під час регресії?
Взагалі мені цікаво, чи краще коли-небудь не використовувати ортогональні поліноми під час регресії із змінними вищого порядку. Зокрема, мені цікаво використання R: Якщо poly()з raw = FALSEвиробляє те ж значення, що і підігнаного poly()з raw = TRUE, і polyз raw = FALSEвирішуєте деякі з проблем , пов'язаних з поліноміальними регрессиями, …

2
Дискретна рівномірна випадкова величина (?), Приймаючи всі раціональні значення в закритому інтервалі
У мене просто була (інтелектуальна) атака паніки. Безперервна випадкова величина, яка слідує за рівномірною в замкнутому інтервалі : комфортно знайоме статистичне поняття. U( а , б )U(a,b)U(a,b) Безперервний рівномірний обертів, що має підтримку подовжених колій (наполовину чи цілих): не належним, а базовим байєсівським поняттям для неналежної попередньої, корисної та застосовної. …

3
Модельні припущення щодо регресії найменших часткових квадратів (PLS)
Я намагаюся знайти інформацію щодо припущень регресії PLS (одиночний ). Мене особливо цікавить порівняння припущень щодо ПЛС щодо регресії OLS. yyy Я читав / проглядав велику кількість літератури на тему PLS; документи Уолда (Сванте та Германа), Абді та багатьох інших, але не знайшли задовільного джерела. Wold та ін. (2001) PLS-регресія: …

1
MLE параметра розташування в розподілі Коші
Після центрування два вимірювання x і −x можна вважати незалежними спостереженнями з розподілу Коші з функцією щільності ймовірності: 1f( x : θ ) =f(x:θ)=f(x :\theta) = ,-∞&lt;x&lt;∞1π( 1 + ( х - θ )2)1π(1+(x−θ)2)1\over\pi (1+(x-\theta)^2) , - ∞ &lt; x &lt; ∞,−∞&lt;x&lt;∞, -∞ < x < ∞ Покажіть, що якщо …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.