Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Чому методи регресії з найменшими квадратами та максимальною ймовірністю не є еквівалентними, коли помилки зазвичай не поширюються?
Назва говорить все це. Я розумію, що найменші квадрати та максимальна ймовірність дадуть однаковий результат для коефіцієнтів регресії, якщо помилки моделі нормально розподіляються. Але що станеться, якщо помилки нормально не поширюються? Чому ці два методи вже не рівнозначні?

1
Опуклість функції PDF та CDF стандартної нормальної випадкової змінної
Будь ласка, надайте доказ того, що опукло . Тут та є стандартними нормальними PDF та CDF відповідно.Q(x)=x2+xϕ(x)Φ(x)Q(x)=x2+xϕ(x)Φ(x)Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)}∀x>0∀x>0\forall x>0 ϕϕ\phiΦΦ\mathbf{\Phi} КРОКИ ДОПУСКІ 1) КАЛКУЛЬНИЙ МЕТОД Я спробував метод обчислення і маю формулу для другого похідного, але не в змозі показати, що він позитивний . Будь ласка, дайте мені знати, якщо вам …

5
Як виправити колишніх виявлених людей для прогнозування даних часових рядів?
Я намагаюся знайти спосіб виправлення інших людей, коли я знаходжу / виявляю їх у даних часових рядів. Деякі методи, такі як nnetar в R, дають деякі помилки для часових рядів з великими / великими залишками. Мені вже вдалося виправити пропущені значення, але люди, які переживають, все ще шкодять моїм прогнозам …

1
Інтерпретація декомпозиції часових рядів за допомогою TBATS з пакета прогнозу R
Я хотів би розкласти наступні дані часових рядів на сезонні, трендові та залишкові компоненти мереж. Дані - це погодинний профіль охолоджувальної енергії з комерційного будинку: TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) Очевидними є щоденні та щотижневі сезонні ефекти, тому ґрунтуючись на поради: Як розкласти часовий ряд з кількома сезонними компонентами? …

1
Назва для розподілу між експоненціальною та гаммою?
Щільність де - параметр, живе між експоненцією ( ) та розподіли ( ). Просто цікаво, якщо це стане прикладом більш загальної родини розподілів? Я не визнаю цього як такого.f(s)∝ss+αe−s,s>0f(s)∝ss+αe−s,s>0f(s)\propto \frac{s}{s+\alpha}e^{-s},\quad s > 0α≥0α≥0\alpha \ge 0α=0α=0\alpha=0Γ(2,1)Γ(2,1)\Gamma(2,1)α→∞α→∞\alpha \to \infty

1
Повторні заходи anova: lm vs lmer
Я намагаюся відтворити кілька тестів на взаємодію між обома lmі lmerповторними заходами (2x2x2). Причиною я хочу порівняти обидва методи в тому, що GLM SPSS для повторних заходів дає такі самі результати, як і lmпідхід, представлений тут, тому наприкінці я хочу порівняти SPSS з R-lmer. Поки що мені вдалося лише відтворити …

2
Рішення проблеми німецьких танків
Чи існує формальне математичне підтвердження того, що розв’язання німецької задачі про танк є функцією лише параметрів k (кількість спостережуваних зразків) і m (максимальне значення серед спостережуваних зразків)? Іншими словами, чи можна довести, що рішення не залежить від інших значень вибірки, окрім максимального значення?

2
Використання моделей ARMA-GARCH для імітації валютних цін
Я встановив модель ARIMA (1,1,1) -GARCH (1,1) до часового ряду цін журналу обмінних курсів AUD / USD, відібраних з однохвилинними інтервалами протягом декількох років, що дало мені більше двох млн даних, за якими можна оцінити модель. Набір даних доступний тут . Для наочності це була модель ARMA-GARCH, встановлена ​​для повернення …

5
Чому варто уникати binning за будь-яку ціну?
Тому я прочитав кілька дописів про те, чому слід уникати binning завжди . Популярна посилання на цю заяву - це посилання . Головне, що точки поповнення (або точки відрізку) є досить довільними, а також втрата інформації, що виникає, і що слід віддати перевагу сплайнам. Однак зараз я працюю з API …

1
Чи нормальне значення MLE асимптотично, коли ?
Припустимо, має pdf(X,Y)(X,Y)(X,Y) fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0fθ(x,y)=e−(x/θ+θy)1x>0,y>0,θ>0f_{\theta}(x,y)=e^{-(x/\theta+\theta y)}\mathbf1_{x>0,y>0}\quad,\,\theta>0 Тому щільність вибірки отримана з цієї сукупності, тому(X,Y)=(Xi,Yi)1≤i≤n(X,Y)=(Xi,Yi)1≤i≤n(\mathbf X,\mathbf Y)=(X_i,Y_i)_{1\le i\le n} gθ(x,y)=∏i=1nfθ(xi,yi)=exp[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0gθ(x,y)=∏i=1nfθ(xi,yi)=exp⁡[−∑i=1n(xiθ+θyi)]1x1,…,xn,y1,…,yn>0=exp⁡[−nx¯θ−θny¯]1x(1),y(1)>0,θ>0\begin{align} g_{\theta}(\mathbf x,\mathbf y)&=\prod_{i=1}^n f_{\theta}(x_i,y_i) \\&=\exp\left[{-\sum_{i=1}^n\left(\frac{x_i}{\theta}+\theta y_i\right)}\right]\mathbf1_{x_1,\ldots,x_n,y_1,\ldots,y_n>0} \\&=\exp\left[-\frac{n\bar x}{\theta}-\theta n\bar y\right]\mathbf1_{x_{(1)},y_{(1)}>0}\quad,\,\theta>0 \end{align} Оцінювач максимальної ймовірності θθ\theta може бути отриманий як θ^(X,Y)=X¯¯¯¯Y¯¯¯¯−−−√θ^(X,Y)=X¯Y¯\hat\theta(\mathbf X,\mathbf Y)=\sqrt\frac{\overline X}{\overline Y} Хочеться знати, нормальний чи поширений цей MLE нормальний …

2
Чому лема Неймана-Пірсона є лемою, а не теоремою?
Це скоріше питання історії, ніж технічне. Чому `` лема Неймана-Пірсона '' є лемою, а не теоремою? посилання на вікі: https://en.wikipedia.org/wiki/Neyman%E2%80%93Pearson_lemma NB : Питання полягає не в тому, що таке лема і як леми використовуються для доведення теореми, а в історії леми Неймана-Пірсона. Це було використано для доведення теореми, і тоді …

2
Що коли-небудь траплялося з Fuzzy Logic?
Нечітка логіка здавалася активною сферою досліджень машинного навчання та видобутку даних ще в школі (на початку 2000-х). Системи нечітких висновків, нечіткі c-засоби, нечіткі версії різних нейронних мереж та архітектури вектора підтримки машин викладалися на курсах та обговорювались на конференціях. Оскільки я знову почав звертати увагу на ML (~ 2013), Fuzzy …

4
Чи "випадкова проекція" строго кажучи не є проекцією?
Поточні реалізації алгоритму випадкової проекції зменшують розмірність зразків даних, відображаючи їх від RdRd\mathbb R^d до RkRk\mathbb R^k використовуючи матрицю проекцій d×kd×kd\times kRRR , записи якої є відповідним розподілом (наприклад, від N(0,1)N(0,1)\mathcal N(0,1) ): x′=1k√xRx′=1kxRx^\prime = \frac{1}{\sqrt k}xR Зручно, що існують теоретичні докази, що показують, що це відображення приблизно зберігає попарні …

3
Обчислення p-значень у обмежених (негативних) найменших квадратах
Я використовував Matlab для виконання обмежених найменших квадратів (звичайних найменших квадратів), і він автоматично виводить коефіцієнти, статистику тесту та p-значення. Моє запитання полягає в тому, що, виконуючи обмежені найменші квадрати (суворо негативні коефіцієнти), він виводить лише коефіцієнти, БЕЗ статистики тесту, р-значень. Чи можна обчислити ці значення для забезпечення значущості? І …

7
Уникнення соціальної дискримінації в побудові моделей
У мене є запитання, натхнені нещодавним скандалом з призовом на роботу в Амазонії, де їх звинувачували в дискримінації жінок у процесі прийняття на роботу. Більше інформації тут : Фахівці з машинного навчання Amazon.com Inc виявили велику проблему: їх новий рекрутинг не сподобався жінкам. Команда будувала комп’ютерні програми з 2014 року …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.