Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Створення єдиного індексу з декількох основних компонентів або факторів, збережених у PCA / FA
Я використовую аналіз основних компонентів (PCA) для створення індексу, необхідного для мого дослідження. Моє питання - як я повинен створити єдиний індекс, використовуючи збережені основні компоненти, обчислені за допомогою PCA. Наприклад, я вирішив зберегти 3 основні компоненти після використання PCA, і я обчислив бали для цих 3 основних компонентів. Які …

1
Переваги Box-Muller перед зворотним методом CDF для імітації нормального розподілу?
Для моделювання нормального розподілу з набору рівномірних змінних існує кілька методик: Алгоритм Box-Muller , в якому один відбирає дві незалежні рівномірні змінні на (0,1)(0,1)(0,1) і перетворює їх у два незалежні стандартні нормальні розподіли за допомогою: Z0=−2lnU1−−−−−−√cos(2πU0)Z1=−2lnU1−−−−−−√sin(2πU0)Z0=−2lnU1cos(2πU0)Z1=−2lnU1sin(2πU0) Z_0 = \sqrt{-2\text{ln}U_1}\text{cos}(2\pi U_0)\\ Z_1 = \sqrt{-2\text{ln}U_1}\text{sin}(2\pi U_0) метод CDF , де можна прирівняти …

2
Середнє абсолютне відхилення (MAD) та SD різних розподілів
Для нормально розподілених даних стандартне відхилення та середнє абсолютне відхилення пов'язані між собою:σσ\sigmaМАДМАД\text{MAD} σ= Φ- 1( 3 / 4 ) ⋅ MAD ≈ 1,4826 ⋅ MAD ,σ=Φ-1(3/4)⋅МАД≈1,4826⋅МАД,\sigma=\Phi^{-1}(3/4)\cdot \text{MAD}\approx1.4826\cdot\text{MAD}, де - функція кумулятивного розподілу для стандартного нормального розподілу.Φ ( )Φ()\Phi() Чи є подібне відношення до інших дистрибутивів?

6
У чому полягає проблема після тестування?
Мій професор-статистик так говорить, всі книги, які я дивлюся, заявляють про це: пост-спеціальні випробування ненаукові. Ви повинні спочатку вивести гіпотезу з теорії, а потім зібрати дані та проаналізувати їх. Але я дійсно не розумію, в чому проблема. Припустимо, я бачу показники продажів різних кольорів автомобілів і формую гіпотезу, що з …
15 post-hoc 

1
2SLS, але пробіт другої стадії
Я намагаюся використовувати інструментальний аналіз змінних, щоб визначити причинність із спостережуваними даними. Я зіткнувся з двоступеневою регресією найменших квадратів (2SLS), яка, ймовірно, вирішить питання ендогенності в моєму дослідженні. Однак я хотів би, щоб перший етап був OLS, а другий етап був пробітом у межах 2SLS. На основі свого читання та …

2
"Змінна манекена" проти "змінної індикатора" для номінальних / категоричних даних
"Змінна манекен" та "змінна індикатора" - це мітки, що часто використовуються для опису належності до категорії з кодуванням 0/1; зазвичай 0: Не є членом категорії, 1: Член категорії. 26.11.2014 швидкий пошук на scilar.google.com (із додаються цитатами) виявляє, що "фіктивна змінна" використовується приблизно в 318000 статтях, а "змінна показник" використовується приблизно …

3
Що означає тестування гіпотези Байєса в рамках теорії висновку та прийняття рішень?
В основному моє вивчення полягає в машинному навчанні, і я намагався дізнатися, що означає тестування Байєсової гіпотези. Я добре з байєсівською інтерпретацією ймовірності, і мені це добре знайоме в контексті імовірнісних графічних моделей. Однак мене бентежить те, що означає слово "Гіпотеза" в контексті статистичного висновку. Я думаю, що в основному …

1
Очікувана кількість чітких кольорів при малюванні без заміни
Розглянемо урну, що містить NNN кульок PPP різних кольорів, при цьому pipip_i - частка кульок кольору iii серед NNN кульок ( ∑ipi=1∑ipi=1\sum_i p_i = 1 ). Я малюю кульок з урни без заміни і дивлюся на кількість різних кольорів серед кульок, які були намальовані. Яке очікування як функції залежно від …

3
Як згладжується Кнайсер-Ней, як обробляються невидимі слова?
З того, що я бачив, формула згладжування (другого порядку) Кнайзера-Нея так чи інакше подається як P2KN(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn)PKN2(wn|wn−1)=max{C(wn−1,wn)−D,0}∑w′C(wn−1,w′)+λ(wn−1)×Pcont(wn) \begin{align} P^2_{KN}(w_n|w_{n-1}) &= \frac{\max \left\{ C\left(w_{n-1}, w_n\right) - D, 0\right\}}{\sum_{w'} C\left(w_{n-1}, w'\right)} + \lambda(w_{n-1}) \times P_{cont}(w_n) \end{align} з нормуючим коефіцієнтом λ(wn−1)λ(wn−1)\lambda(w_{n-1}) заданим як λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙)λ(wn−1)=D∑w′C(wn−1,w′)×N1+(wn−1∙) \begin{align} \lambda(w_{n-1}) &= \frac{D}{\sum_{w'} C\left(w_{n-1}, w'\right)} \times N_{1+}\left(w_{n-1}\bullet\right) \end{align} і …

4
Як розвинути інтуїцію за умовною ймовірністю?
У відео лекціях з Гарвардської статистики 110: Курс ймовірності, який можна знайти на iTunes та YouTube, я зіткнувся з цією проблемою. Я спробував узагальнити це тут: Припустимо, нам подають випадкову руку з двома картками зі стандартної колоди. Яка ймовірність того, що обидві карти є тузами, враховуючи, що у нас є …

4
Фіксований ефект проти випадкового ефекту, коли всі можливості включені в модель змішаних ефектів
У моделі змішаних ефектів рекомендується використовувати фіксований ефект для оцінки параметра, якщо всі можливі рівні включені (наприклад, і самці, і жінки). Далі рекомендується використовувати випадковий ефект для обліку змінної, якщо включені рівні - це лише випадкова вибірка з популяції (зарахували пацієнтів із Всесвіту можливих пацієнтів) і ви хочете оцінити середнє …

2
Моделювання креслень з рівномірного розподілу за допомогою малюнків із звичайного розподілу
Нещодавно я придбав ресурс для інтерв'ю з науковими даними, в якому одним із питань ймовірності було таке: З огляду на малюнки із звичайного розподілу з відомими параметрами, як можна імітувати малюнки з рівномірного розподілу? Мій оригінальний процес думки полягав у тому, що для дискретної випадкової величини ми могли розбити нормальний …

11
Відображення трьох фрагментів інформації на графіку
Примітка: зараз додається 50 балів вихідних даних. Я хочу відобразити, скільки я проробив, і скільки сторінок я закінчив протягом тижня, розбиваючись по днях, і я зробив так, як показано нижче: У мене люди говорили, що вони не можуть зрозуміти графіки, але я не маю уявлення, як ще я можу їх …

2
Виведення нормалізуючого перетворення для ГЛМ
\newcommand{\E}{\mathbb{E}} Як A(⋅)=∫duV1/3(μ)A(⋅)=∫duV1/3(μ)A(\cdot) = \displaystyle\int\frac{du}{V^{1/3}(\mu)} нормалізує перетворення для експонентної сім'ї похідне? Більш конкретно : я спробував виконати ескіз розширення Тейлора на сторінці 3, слайд 1 тут, але у мене є кілька питань. З XXX з експоненціальної родини, перетворення h(X)h(X)h(X) та κiκi\kappa _i що позначає купілятор ithithi^{th} , слайди стверджують, що: …

1
Чи слід використовувати t-тест на сильно перекошених даних? Наукові докази, будь ласка?
У мене є зразки з дуже перекошеного (схожого на експоненціальний розподіл) набору даних про участь користувачів (наприклад: кількість повідомлень), які мають різні розміри (але не менше 200), і я хочу порівняти їх середнє значення. Для цього я використовую двопробні непарні т-тести (і t-тести з коефіцієнтом Вельча, коли зразки мали різні …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.