Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи означає опуклі впорядкування правильне хвостове домінування?
З огляду на два безперервні розподіли FXFX\mathcal{F}_X і FYFY\mathcal{F}_Y , мені незрозуміло, чи є відношення домінування опуклої між ними: (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y Має на увазі, що (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] має місце, або якщо потрібна ще якась гіпотеза, якщо має бути дотримано?(1)(1)(1) Визначення домінування опуклості. Якщо два …

2
Навіщо взагалі використовувати Дурбін-Уотсон замість тестування автокореляції?
Тест Дербіна-Уотсона тестує автокореляцію залишків у відстані 1. Але так само тестує автокореляцію на відстані 1 безпосередньо. Крім того, ви можете протестувати автокореляцію з відставанням 2,3,4, і є хороші тести на портманто на автокореляцію в декількох лагах, і ви отримаєте хороші, легко інтерпретовані графіки [наприклад, функцію acf () в R]. …

1
Розрізняють ефекти короткого та довгострокового циклу
Я прочитав у статті таке речення: Те, що є різниця між короткотерміновими та довгостроковими коефіцієнтами, є результатом нашої специфікації, яка включає відсталі ендогенні змінні. Вони виконують регресію в перших відмінностях і включають відставання залежної змінної. Тепер вони стверджують, що якщо ви подивитеся на оцінку (наприклад, дозволимо назвати цю оцінку ) …

4
Це правильно ? (породження усіченої норми, багатоваріантної-гауссової)
Якщо тобто X∈Rn, X∼N(0–,σ2I)X∈Rn, X∼N(0_,σ2I)X\in\mathbb{R}^n,~X\sim \mathcal{N}(\underline{0},\sigma^2\mathbf{I})fX(x)=1(2πσ2)n/2exp(−||x||22σ2)fX(x)=1(2πσ2)n/2exp⁡(−||x||22σ2) f_X(x) = \frac{1}{{(2\pi\sigma^2)}^{n/2}} \exp\left(-\frac{||x||^2}{2\sigma^2}\right) Я хочу аналогічну версію усіченого-нормального розподілу у багатовимірному випадку. Точніше, я хочу створити обмежене нормою (до значення ) багатофакторне гауссова st коли≥a≥a\geq aYYYfY(y)={c.fX(y), if ||y||≥a0, otherwise .fY(y)={c.fX(y), if ||y||≥a0, otherwise . f_Y(y) = \begin{cases} c.f_X(y), \text{ if } ||y||\geq a …

1
Уточнення щодо читання номограми
Далі йде номограма, створена з набору даних mtcars з пакетом rms для формули: mpg ~ wt + am + qsec Сама модель здається гарною з R2 0,85 і P &lt;0,00001 &gt; mod Linear Regression Model ols(formula = mpg ~ wt + am + qsec, data = mtcars) Model Likelihood Discrimination …

2
За винятком Дурбіна-Уотсона, які тести на гіпотезу можуть дати непереконливі результати?
Тестова статистика Дарбіна-Уотсон може лежати в безрезультатною області, де не можливо або відхилити або відкинути нульову гіпотезу (в даному випадку, нульовий автокорреляции). Які ще статистичні тести можуть дати "непереконливі" результати? Чи є загальне пояснення (махання рукою добре), чому цей набір тестів не може прийняти двійкове рішення «відхилити» / «не відхилити»? …

1
Виведення ймовірності функції для IV-пробіта
Отже, у мене є двійкова модель, де - латентна непомічена величина, а y 1 ∈ { 0 , 1 } спостерігається. y 2 визначає y 1 і z 2 , таким чином, є моїм інструментом. Отже, коротше, модель є. y ∗ 1y∗1y1∗y_1^*y1∈{0,1}y1∈{0,1}y_1 \in \{0,1\}y2y2y_2y1y1y_1z2z2z_2 Оскільки умови помилки не є незалежними, …


1
Чи є медіана "метричною" чи "топологічною" властивістю?
Прошу вибачення за незначне зловживання термінологією; Я сподіваюся, що стане зрозумілим, що я маю на увазі нижче. Розглянемо випадкову величину . Як середнє, так і медіанне можна охарактеризувати за критерієм оптимальності: середнє значення - це число яке мінімізує , а медіана - це число, яке мінімізує . У цій перспективі …
10 mean  median 

1
Випадковий ліс проти Адабоост
У розділі 7 статті " Випадкові ліси" (Брейман, 1999) автор констатує таку гіпотезу: "Адабоост - випадковий ліс". Хтось довів чи спростував це? Що було зроблено для підтвердження чи спростування цієї посади 1999 року?

4
Як уникнути терміну журналу (0) в регресії
У мене є наступні прості вектори X і Y: &gt; X [1] 1.000 0.063 0.031 0.012 0.005 0.000 &gt; Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 &gt; &gt; plot(X,Y) Я хочу зробити регресію за допомогою журналу X. Щоб уникнути отримання журналу (0), я намагаюся поставити +1 або +0.1 або …

1
Як перевірити, чи "попередній стан" впливає на "наступний стан" в R
Уявіть ситуацію: ми маємо історичні записи (20 років) про три шахти. Чи збільшує присутність срібла ймовірність знайти золото в наступному році? Як перевірити таке питання? Ось приклади даних: mine_A &lt;- c("silver","rock","gold","gold","gold","gold","gold", "rock","rock","rock","rock","silver","rock","rock", "rock","rock","rock","silver","rock","rock") mine_B &lt;- c("rock","rock","rock","rock","silver","rock","rock", "silver","gold","gold","gold","gold","gold","rock", "silver","rock","rock","rock","rock","rock") mine_C &lt;- c("rock","rock","silver","rock","rock","rock","rock", "rock","silver","rock","rock","rock","rock","silver", "gold","gold","gold","gold","gold","gold") time &lt;- seq(from = 1, to = …

4
Припустимо,
Як пропонується у назві. Припустимо, Х1, X2, … , XнX1,X2,…,XnX_1, X_2, \dotsc, X_n це безперервні iid випадкові величини з pdf fff . Розглянемо випадок, коли Х1≤ X2… ≤ XN- 1&gt; XNX1≤X2…≤XN−1&gt;XNX_1 \leq X_2 \dotsc \leq X_{N-1} > X_N , N≥ 2N≥2N \geq 2 , таким чином NNN - це коли …

2
Що таке пошук і як ви шукаєте нейронну мережу?
Я розумію, що попередня підготовка використовується для уникнення деяких проблем із звичайною підготовкою. Якщо я використовую backpropagation з, скажімо, автокодером, я знаю, що я зіткнуся з проблемами у часі, оскільки зворотне розповсюдження відбувається повільно, а також, що я можу зациклюватися на локальній оптимі і не вивчити певні функції. Я не …

1
Чи все ж PCA проводиться за допомогою ейгендекомпозиції матриці коваріації, коли розмірність більша за кількість спостережень?
У мене є матриця , що містить мій зразків у -вимірному просторі. Тепер я хочу зашифрувати власний аналіз основних компонентів (PCA) в Matlab. Я спочатку применшую до .20×10020×10020\times100XXXN=20N=20N=20D=100D=100D=100XXXX0X0X_0 Я читав з чийогось коду, що в таких сценаріях, де у нас більше вимірів, ніж спостережень, ми більше не розкладаємо власне матрицю …
10 pca 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.