Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як обчислити середню тривалість прихильності вегетаріанства, коли ми маємо лише дані опитування про поточних вегетаріанців?
Було обстежено випадкову вибірку популяції. Їх запитали, чи їдять вони вегетаріанську дієту. Якщо вони відповіли "так", їх також попросили вказати, як довго вони їдять вегетаріанську дієту без перешкод. Я хочу використовувати ці дані для обчислення середньої тривалості прихильності до вегетаріанства. Іншими словами, коли хтось стає вегетаріанцем, я хочу знати, що …

2
Косисть логарифму випадкової величини гамма
Розглянемо гамма-випадкову змінну X∼Γ(α,θ)X∼Γ(α,θ)X\sim\Gamma(\alpha, \theta) . Існують чіткі формули для середини, дисперсії та косості: E[X]Var[X]Skewness[X]=αθ=αθ2=1/α⋅E[X]2=2/α−−√E[X]=αθVar⁡[X]=αθ2=1/α⋅E[X]2Skewness⁡[X]=2/α\begin{align} \mathbb E[X]&=\alpha\theta\\ \operatorname{Var}[X]&=\alpha\theta^2=1/\alpha\cdot\mathbb E[X]^2\\ \operatorname{Skewness}[X]&=2/\sqrt{\alpha} \end{align} Розглянемо тепер випадкову змінну, перетворену журналом Y=log(X)Y=log⁡(X)Y=\log(X) . Вікіпедія дає формули для середнього та дисперсійного: E[Y]Var[Y]=ψ(α)+log(θ)=ψ1(α)E[Y]=ψ(α)+log⁡(θ)Var⁡[Y]=ψ1(α)\begin{align} \mathbb E[Y]&=\psi(\alpha)+\log(\theta)\\ \operatorname{Var}[Y]&=\psi_1(\alpha)\\ \end{align} за допомогою функцій digamma та trigamma, які визначаються як …

1
Чи є приватний лідер Kaggle хорошим прогнозувачем ефективності виграшної моделі поза зразком?
Хоча результати приватного тестового набору не можуть бути використані для подальшого вдосконалення моделі, чи не є вибір моделі з величезної кількості моделей на основі результатів приватного тестового набору? Чи не вдалося б ви, лише через цей процес, прилаштуватись до приватного тестового набору? Відповідно до "Псевдоматематики та фінансового шарлатанізму: Вплив перенапруження …

1
Походження позначень у стилі Вілкінсона, таких як (1 | id) для випадкових ефектів у формулах змішаних моделей в R
Модельні формули в R, такі як y ~ x + a*b + c:d засновані на так званих позначеннях Вілкінсона : Wilkinson and Rogers 1973, Symbolic Description of Factorial Model for Analysis of Variance . У цьому документі не було обговорено позначень для змішаних моделей (які, можливо, тоді не існували). Отже, …

4
Що означає «як»?
Я читав статтю і побачив таке речення: Для даного мартингале, якщо він має верхню або нижню межу, мартингейл повинен сходитися (як). Оскільки ймовірність завжди негативна, 0 - нижня межа. Що означає "як"? Це звичайне використання? Я здогадуюсь "асимптотично", але я хотів би це підтвердити.

4
Що вважається хорошою втратою журналу?
Я намагаюсь краще зрозуміти втрату журналу та як це працює, але я не можу знайти, що я вказую номер втрати журналу в якийсь контекст. Якщо моя модель має втрату журналу 0,5, це добре? Що вважається хорошою та поганою оцінкою? Як змінюються ці пороги?

7
Чому перекошені дані не бажані для моделювання?
У більшості випадків, коли люди говорять про змінні перетворення (як для змін прогнозованого, так і для відповіді), вони обговорюють способи лікування нескінченності даних (наприклад, перетворення журналу, перетворення коробки та Кокса тощо). Що я не в змозі зрозуміти, чому усунення косості вважається такою поширеною найкращою практикою? Як косоокість впливає на ефективність …

3
Що таке нульова модель в регресії і як вона пов'язана з нульовою гіпотезою?
Що таке нульова модель в регресії та яка взаємозв'язок між нульовою моделлю та нульовою гіпотезою? Наскільки я розумію, чи означає це? Використовуючи "середню змінну відповіді" для прогнозування змінної безперервної відповіді? Використовуючи "розподіл міток" для прогнозування дискретних змінних відповідей? Якщо це так, то, здається, відсутні відсутні зв'язки між нульовою гіпотезою.

5
Як методи ансамблю перевершують усі їх складові?
Я трохи розгублений щодо ансамблевого навчання. Коротше кажучи, він запускає k моделі і отримує середнє значення цих моделей k. Як можна гарантувати, що середнє значення k-моделей було б краще, ніж будь-яка з моделей? Я розумію, що упередженість "розширюється" або "усереднюється". Однак що робити, якщо в ансамблі є дві моделі (тобто …

4
Чи завжди дві стандартні нормальні випадкові величини завжди незалежні?
Я дізнався, що стандартний нормальний розподіл унікальний, оскільки середнє значення та дисперсія фіксовані на 0 та 1 відповідно. За цим фактом мені цікаво, чи будь-які дві стандартні випадкові величини повинні бути незалежними.

1
Максимальний зазор між зразками, взятими без заміни, з дискретного рівномірного розподілу
Ця проблема пов'язана з дослідженнями моєї лабораторії з роботизованого покриття: Довільно намалюйте чисел із безлічі без заміни та сортуйте числа у порядку зростання. .nnn{1,2,…,m}{1,2,…,m}\{1,2,\ldots,m\}1≤n≤m1≤n≤m1\le n\le m З цього відсортованого списку чисел генерують різницю між послідовними числами та межами: . Це дає прогалини.{a(1),a(2),…,a(n)}{a(1),a(2),…,a(n)}\{a_{(1)},a_{(2)},…,a_{(n)}\}g={a(1),a(2)−a(1),…,a(n)−a(n−1),m+1−a(n)}g={a(1),a(2)−a(1),…,a(n)−a(n−1),m+1−a(n)}g = \{a_{(1)},a_{(2)}−a_{(1)},\ldots,a_{(n)}−a_{(n-1)},m+1-a_{(n)}\}n+1n+1n+1 Який розподіл максимального проміжку? P(max(g)=k)=P(k;m,n)=?P(max(g)=k)=P(k;m,n)=?P(\max(g) = …

1
Які теорії причинності я повинен знати?
Які теоретичні підходи до причинності я повинен знати як прикладний статистик / економетрик? Я знаю (дуже небагато) Причинно-наслідкова модель Неймана – Рубіна (і Рой , Хаавелмо тощо) Робота Перла про причинність Причинність Грейнджера (хоча і менш орієнтована на лікування) Які поняття я пропускаю або мені слід знати? Пов'язане: Які теорії …

1
Тензори в літературі з нейронної мережі: яке найпростіше визначення там?
У літературі з нейронної мережі часто ми зустрічаємо слово "тензор". Чи відрізняється він від вектора? А з матриці? Чи є у вас якийсь конкретний приклад, який уточнює його визначення? Я трохи розгублений щодо його визначення. Вікіпедія не допомагає, і іноді у мене складається враження, що її визначення залежить від конкретного …

2
Випадки сучасного використання машин з обмеженим застосуванням Больцмана (МБР)?
Передумови: Багато сучасних досліджень за останні чотири роки (пост alexnet ), схоже, віддалилися від використання генеративного пошуку для нейронних мереж для досягнення найсучасніших результатів класифікації. Наприклад, серед найпопулярніших результатів для списку сюди входять лише 2 статті з 50 найкращих, як видається, використовуються генеративні моделі, обидві з яких - ОРМ. В …

1
Зворотна регресія хребта: задавши матрицю відповіді та коефіцієнти регресії, знайдіть відповідні предиктори
Розглянемо стандартну проблему регресії OLS : У мене є матриці \ Y і \ X, і я хочу знайти \ B, щоб мінімізувати L = \ | \ Y- \ X \ B \ | ^ 2. Рішення задається \ hat \ B = \ argmin_ \ B \ {L …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.