Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Багатоваріантна лінійна регресія проти декількох одновимірних регресійних моделей
У налаштуваннях універсальної регресії ми намагаємося моделювати y=Xβ+noisey=Xβ+noisey = X\beta +noise де вектор спостережень і матриця проектування з провісниками. Рішення - .y∈Rny∈Rny \in \mathbb{R}^nnnnX∈Rn×mX∈Rn×mX \in \mathbb{R}^{n \times m}mmmβ0=(XTX)−1Xyβ0=(XTX)−1Xy\beta_0 = (X^TX)^{-1}Xy У налаштуваннях багатоваріантної регресії ми намагаємося моделювати Y=Xβ+noiseY=Xβ+noiseY = X\beta +noise де - матриця з спостережень та різних прихованих змінних. …

2
Чому ці таблиці регресії anova однакові?
У мене є дві регресії одного і того ж Y і трирівневого X. Загалом n = 15, з n = 5 у кожній групі або рівня X. Перша регресія трактує X як категоричну, присвоюючи змінні показники рівням 2 і 3 з рівнем один з них є еталонним. Показники / манекени …
11 regression  anova 

4
Штучні нейронні мережі РІВНІ до лінійної регресії з поліноміальними ознаками?
Я хочу покращити своє розуміння нейронних мереж та їх переваг порівняно з іншими алгоритмами машинного навчання. Я розумію, як нижче, і моє питання: Чи можете ви виправити та доповнити моє розуміння, будь ласка? :) Моє розуміння: (1) Штучні нейронні мережі = Функція, яка прогнозує вихідні значення із вхідних значень. Відповідно …

5
Показано, що Оцінювач OLS еквівалентний за шкалою?
Я не маю офіційного визначення еквівалентності шкали, але ось що Вступ до статистичного навчання говорить про це на с. 217: Стандартні найменші коефіцієнти квадратів ... еквівалентні за шкалою : множення на постійну просто призводить до масштабування оцінок коефіцієнта найменших квадратів на коефіцієнт .XjXjX_jccc1/c1/c1/c Для простоти припустимо загальну лінійну модель y=Xβ+ϵy=Xβ+ϵ\mathbf{y} …

4
Кореляція між X і XY
Якщо у мене є дві незалежні випадкові величини X і Y, яка кореляція між X і продуктом XY? Якщо це невідомо, мені було б цікаво знати хоча б те, що відбувається в конкретному випадку X і Y нормально з нульовим значенням, якщо це легше вирішити.

3
Як здійснити регуляризацію L2 до довільної точки в просторі?
Ось, що я читав у книзі Ієна Гудфеллоу « Глибоке навчання» . У контексті нейронних мереж "штраф норми параметра L2 зазвичай називають зменшенням ваги. Ця стратегія регуляризації приводить ваги ближче до початку [...]. Більш загально, ми могли б регулювати параметри, щоб бути поблизу будь-якої конкретної точки в просторі ", але …

3
Чому вірогідність фільтра Кальмана обчислюється з використанням результатів фільтрування замість плавніших результатів?
Я використовую фільтр Кальмана дуже стандартним способом. Система представлена ​​рівнянням стану та рівнянням спостереження .xt+1=Fxt+vt+1xt+1=Fxt+vt+1x_{t+1}=Fx_{t}+v_{t+1}yt=Hxt+Azt+wtyt=Hxt+Azt+wty_{t}=Hx_{t}+Az_{t}+w_{t} Підручники вчать, що після застосування фільтра Кальмана та отримання "прогнозів на крок вперед" (або "відфільтрована оцінка") ми повинні використовувати їх для обчислення ймовірності функції:x^t|t−1x^t|t−1\hat{x}_{t|t-1} fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}fyt|It−1,zt(yt|It−1,zt)=det[2π(HPt|t−1H′+R)]−12exp⁡{−12(yt−Hx^t|t−1−Azt)′(HPt|t−1H′+R)−1(yt−Hx^t|t−1−Azt)}f_{y_{t}|\mathcal{I}_{t-1},z_{t}}\left(y_{t}|\mathcal{I}_{t-1},z_{t}\right)=\det\left[2\pi\left(HP_{t|t-1}H^{\prime}+R\right)\right]^{-\frac{1}{2}}\exp\left\{ -\frac{1}{2}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)^{\prime}\left(HP_{t|t-1}H^{\prime}+R\right)^{-1}\left(y_{t}-H\hat{x}_{t|t-1}-Az_{t}\right)\right\} Моє запитання: Чому функція ймовірності обчислюється за допомогою "відфільтрованої …

2
Чи частота помилок є опуклою функцією лямбда параметра регуляризації?
Вибираючи параметр регуляризації лямбда в Ridge або Lasso, рекомендований метод полягає в тому, щоб спробувати різні значення лямбда, виміряти похибку у валідаційному наборі і, нарешті, обрати це значення лямбда, яке повертає найменшу помилку. Мені не чітко, якщо функція f (лямбда) = помилка - опукла. Може так бути? Тобто, чи може …

5
Чому ми відкидаємо нульову гіпотезу на рівні 0,05, а не на рівні 0,5 (як це робимо в Класифікації)
Тестування гіпотез схоже на проблему Класифікації. Отже, скажімо, у нас є 2 можливі мітки для спостереження (суб'єкта) - "Винні проти Невинні". Нехай невинувачений є нікчемною гіпотезою. Якщо ми розглянули проблему з точки зору Класифікації, ми би підготували Класифікатор, який би передбачив ймовірність приналежності суб'єкта в кожному з 2 класів за …

5
Як створити послідовність
Я знаю, як генерувати послідовність із середнім . Наприклад, у Matlab, якщо я хочу створити послідовність довжиною , це:0 ± 1 10000±1±1\pm 1000±1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 Однак як створити послідовність із середнім значенням , тобто з трохи кращим?0,05 1±1±1\pm 10.050.050.05111

2
Чи розділення даних на тестові та навчальні набори суто "статистика"?
Я студент фізики, який вивчає машинне навчання / науку даних, тому не маю на увазі, щоб із цим питанням виникали будь-які конфлікти :) Однак значна частина будь-якої програми з фізики в університеті - це робити лабораторії / експерименти, що означає багато даних обробка та статистичний аналіз. Однак я помічаю різку …

2
Взаємна інформація як вірогідність
Чи може взаємна інформація про спільну ентропію: 0 ≤ I( X, Y)Н( X, Y)≤ 10≤I(X,Y)H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 визначати як: "Ймовірність передачі частини інформації від X до Y"? Мені шкода, що я був таким наївним, але я ніколи не вивчав теорію інформації, і намагаюся просто зрозуміти деякі поняття …

1
Чому Netflix перейшов зі своєї п'ятизіркової системи рейтингу на систему «подобається / не подобається»?
Netflix використовував, щоб базувати свої пропозиції на рейтингах інших фільмів / шоу. Ця рейтингова система мала п'ять зірок. Тепер Netflix дозволяє користувачам подобатись / не подобатися (великі пальці вгору / великі пальці) фільми / шоу. Вони стверджують, що легше оцінювати фільми. Чи не була б ця двостороння класифікація статистично менш …

1
Байєсовий шип і плита проти пенізованих методів
Я читаю слайди Стівена Скотта про пакет BSTS R (їх можна знайти тут: слайди ). У якийсь момент, коли йдеться про включення багатьох регресорів у модель структурних часових рядів, він вводить коефіцієнти регресії ковзання та плити, і каже, що вони краще порівняно з пенізованими методами. Скаже Скотт, посилаючись на приклад …

1
Що ви робите, якщо ваші ступені свободи минають кінець ваших столів?
Ступінь свободи в моїй таблиці F не піднімається досить високо для мого великого зразка. Наприклад, якщо у мене є F з 5 і 6744 градусами свободи, як я можу знайти 5% критичне значення для ANOVA? Що робити, якщо я робив тест на чи-квадрат з великими ступенями свободи? [Питання, подібне до …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.