Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Різниця між випробувальним рейтингом Вілкоксона та тестом з рейтингом Вілкоксона
Мені було цікаво, в чому полягає теоретична різниця між тестом Ранко-Сум Вілкоксона та Тестом підписаного рангу Вілкоксона з використанням парних спостережень. Я знаю, що тест Wilcoxon Rank-Sum дозволяє проводити різну кількість спостережень у двох різних зразках, тоді як тест підписаного рейтингу для парних зразків цього не дозволяє, однак на мою …

5
Що навчитися після Casella & Berger?
Я чистий студент з математики, малий досвід прикладної математики. З минулої осені я відвідував заняття з книги Casella & Berger, і закінчив сотні (230+) сторінок проблем із фізичними вправами в книзі. Зараз я перебуваю в главі 10. Однак, оскільки я не користувався статистикою або не планував стати статистикою, я не …



3
Що означає "всі інші рівні" при множинній регресії?
Коли ми робимо кілька регресій і кажемо, що ми дивимось на середню зміну змінної yyy для зміни змінної xxx , тримаючи всі інші змінні постійними, за яких значень ми тримаємо інші змінні постійними? Їхнє значення? Нуль? Будь-яке значення? Я схильний думати, що це має будь-яку цінність; просто шукаю роз'яснення. Якби …

3
Переваги використання QQ-графіків над гістограмами
У цьому коментарі Нік Кокс написав: Об’єднання в класи - це древній метод. Незважаючи на те, що гістограми можуть бути корисними, сучасне статистичне програмне забезпечення дозволяє легко, а також доцільно пристосувати розподіли до вихідних даних. Binning просто викидає деталі, які є вирішальними при визначенні того, які розподіли правдоподібні. Контекст цього …

2
Чому PCA даних за допомогою SVD даних?
Це питання стосується ефективного способу обчислення основних компонентів. Багато текстів на лінійній PCA пропонують використовувати сингулярне розкладання значення випадкових даних . Тобто, якщо ми маємо дані і хочемо замінити змінні (її стовпці ) основними компонентами, ми робимо SVD: , сингулярні значення (квадратні корені власних значень), що займають основну діагональ , …

4
Z-оцінка методу Стоуффера: що робити, якщо підсумовувати замість ?
Я виконую незалежних статистичних тестів з однаковою нульовою гіпотезою і хотів би об'єднати результати в одну -значну величину. Схоже, існує два "прийнятих" методу: метод Фішера та метод Стоуффера .рNNNppp Моє запитання стосується методу Стоуффера. Для кожного окремого тесту я отримую z-бал . Під нульовою гіпотезою, кожен з них розподіляються зі …

5
Що саме робить непараметричний тест & Що ви робите з результатами?
У мене є відчуття, що це, можливо, просили в іншому місці, але не дуже з типом базового опису, який мені потрібен. Я знаю, що непараметричні покладаються на медіану замість середнього для порівняння ... чогось. Я також вважаю, що він покладається на "ступінь свободи" (?) Замість стандартного відхилення. Виправте мене, якщо …

2
Наступні кроки після "Байєсового розуму та машинного навчання"
Зараз я переживаю «Байєсівське розум і машинне навчання» Девіда Барбера, і це надзвичайно добре написана та захоплююча книга для вивчення основ. Тож питання до того, хто це вже зробив. Який наступний набір книг я повинен пройти після того, як я отримаю достатнє знання з більшістю концепцій Барбер?

3
Чому використовується алгоритм максимізації очікування?
З того, що я мало знаю, алгоритм ЕМ може бути використаний для пошуку максимальної ймовірності, коли встановлення на нуль часткових похідних стосовно параметрів вірогідності дає набір рівнянь, які неможливо вирішити аналітично. Але чи потрібен алгоритм ЕМ замість того, щоб використовувати якусь чисельну техніку, щоб спробувати знайти максимум ймовірності щодо обмеження …

3
Чи важливо статистикам вивчити машинне навчання?
Чи машинне навчання є важливим предметом для ознайомлення з будь-яким статистиком? Здається, машинне навчання - це статистика. Чому програми статистики (для студентів та аспірантів) не вимагають машинного навчання?

1
Чи є причина віддати перевагу конкретній мірі мультиколінеарності?
Працюючи з багатьма вхідними змінними, ми часто стурбовані мультиколінеарністю . Існує ряд заходів мультиколінеарності, які використовуються для виявлення, продумування та / або спілкування мультиколінеарності. Деякі поширені рекомендації: Множинний для конкретної змінної R2jRj2R^2_j Допуск для певної змінної 1 - R2j1-Rj21-R^2_j Коефіцієнт інфляції дисперсії для певної змінної VIF = 1толерантністьVIF=1толерантність\text{VIF}=\frac{1}{\text{tolerance}} Номер умови …

2
Як реально працює завантажувальна програма в R?
Я заглядав у завантажувальний пакет у R, і, хоча знайшов чимало хороших праймерів, як ним користуватися, я ще не знайшов нічого, що б точно описувало, що відбувається "поза кадром". Наприклад, у цьому прикладі посібник показує, як використовувати стандартні коефіцієнти регресії як вихідну точку для регресії завантажувальної стрічки, але не пояснює, …

5
R 'randomForest не може обробити більше 32 рівнів. Що таке вирішення?
R-пакет randomForest R не може обробляти коефіцієнт з більш ніж 32 рівнями. Коли йому задано більше 32 рівнів, він видає повідомлення про помилку: Не може працювати з категоричними прогнозами з більш ніж 32 категоріями. Але у мене є кілька факторів. Деякі з них мають рівні 1000+, а деякі - 100+. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.