Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Регуляризація: чому помножити на 1 / 2м?
В неділю 3 - конспектів в класі Coursera Machine Learning Ендрю Нг , термін додається до функції вартості реалізації впорядкування: J+(θ)=J(θ)+λ2m∑j=1nθ2jJ+(θ)=J(θ)+λ2m∑j=1nθj2J^+(\theta) = J(\theta) + \frac{\lambda}{2m} \sum_{j=1}^n \theta_j^2 У конспектах лекції сказано: Ми також могли б регулювати всі наші тета-параметри в одному підсумку: м янθ 12 м [∑i = 1м(годθ(х( i …

2
WaveNet насправді не є розширеною згорткою, чи не так?
В останній роботі WaveNet автори посилаються на свою модель як зі складеними шарами розширених згортків. Вони також створюють наступні діаграми, пояснюючи різницю між "регулярними" згортками та розширеними згортками. Регулярні звивини виглядають так: Це згортання з розміром фільтра 2 та кроком 1, повторюваним у 4 шари. Потім вони показують архітектуру, використану …

2
Здивованість та крос-ентропія для n-грамових моделей
Намагаючись зрозуміти взаємозв'язок між перехресною ентропією та недоумінням. Загалом для моделі M , Perplexity (M) = 2 ^ ентропія (M) . Чи стосується ця залежність для всіх різних n-грамів, тобто уніграма, біграми тощо?

3
Чому стандартна похибка пропорції для даного n найбільша для 0,5?
Стандартна похибка пропорції буде найбільшою, вона може бути для даного N, коли пропорційна частка дорівнює 0,5, і зменшується, чим далі пропорція становить 0,5. Я бачу, чому це так, коли я дивлюсь на рівняння для стандартної похибки пропорції, але далі я не можу пояснити це. Чи є пояснення поза математичними властивостями …

3
Оцініть розбіжність Кулбека Лейблера (KL) з Монте Карло
Я хочу оцінити розбіжність KL між двома безперервними розподілами f і g. Однак я не можу записати щільність ні для f, ні для g. Я можу зробити вибірку з f та g за допомогою якогось методу (наприклад, markov chain monte carlo). Розбіжність KL від f до g визначається так DKL(f||g)=∫∞−∞f(x)log(f(x)g(x))dxDKL(f||g)=∫−∞∞f(x)log⁡(f(x)g(x))dxD_{KL}(f …


3
Вибір моделі Баєса і надійний інтервал
У мене є набір даних із трьома змінними, де всі змінні є кількісними. Нехай називаємо це , та . Я підганяю регресійну модель в байєсівській перспективі через MCMCуyyх1x1x_1х2x2x_2rjags Я зробив дослідницький аналіз, і розсіювання дозволяє припустити використання квадратичного терміна. Тоді я прилаштував дві моделіу×х2y×x2y\times x_2 (1)у=β0+β1∗х1+β2∗х2у=β0+β1∗х1+β2∗х2y=\beta_0+\beta_1*x_1+\beta_2*x_2 (2)у=β0+β1∗ x 1 +β2∗х2+β3∗х1х2+β4∗х21+β5∗х22у=β0+β1∗х1+β2∗х2+β3∗х1х2+β4∗х12+β5∗х22y=\beta_0+\beta_1*x1+\beta_2*x_2+\beta_3*x_1x_2+\beta_4*x_1^2+\beta_5*x_2^2 …

1
Чому ми не можемо використовувати для перетворень залежних змінних?
Уявіть, що ми маємо лінійну регресійну модель із залежною змінною . Знаходимо його . Тепер ми робимо ще одну регресію, але цього разу на і аналогічно знаходимо її . Мені сказали, що я не можу порівняти обидва щоб побачити, яка модель краще підходить. Чому так? Причиною мені було те, що …

1
Джеффрі до біноміальної ймовірності
Якщо я використовую Jeffreys раніше для параметра біноміальної ймовірності θθ\theta то це означає використання a θ∼beta(1/2,1/2)θ∼beta(1/2,1/2)\theta \sim beta(1/2,1/2) розповсюдження. Якщо я перетворяться на нову систему відліку ϕ=θ2ϕ=θ2\phi = \theta^2 то чітко ϕϕ\phi також не поширюється як beta(1/2,1/2)beta(1/2,1/2)beta(1/2,1/2) розповсюдження. Моє запитання в тому, в чому сенс Джеффрі інваріантний репараметеризації? Я думаю, …

1
Чи існує багатоваріантний двопробний тест Колмогорова-Смірнова?
Чи існує багатоваріантна альтернатива двопробному тесту Колмогорова-Смірнова ? Я маю на увазі тест, який можна використовувати для перевірки, коли два основні багатовимірні розподіли відрізняються.

2
Чи побудовано використання стандартного відхилення на припущенні нормального розподілу?
Мені цікаво, чи завжди стандартне відхилення будувалося на припущенні про нормальний розподіл. Іншими словами, якщо вибірка нормально не розподіляється, чи слід вважати використання стандартного відхилення помилкою?

2
K-найближчий-сусід з безперервними та бінарними змінними
У мене є набір даних із стовпцями a b c(3 атрибути). aє чисельною і безперервним в той час як bі cкатегорично кожен з двома рівнями. Я використовую метод K-Найближчих сусідів для класифікації aта bввімкнення c. Отже, щоб можна було виміряти відстані, я перетворюю свій набір даних, видаляючи bта додаючи b.level1і …

2
Що стосується факторного аналізу (або PCA), що означає завантаження факторів більше 1?
Я щойно запускав FA за допомогою косого обертання (promax), і елемент давав коефіцієнт завантаження 1,041 на один коефіцієнт (і множинні коефіцієнти -131, -.119 та .065 на інші фактори за допомогою матриці шаблону ) . І я не впевнений, що це означає, я подумав, що це може бути лише між -1 …

3
Різниця між MLE та Baum Welch щодо штуцерів HMM
У цьому популярному питанні відповідь з високою оцінкою робить MLE та Baum Welch відокремленими у підході до HMM. Для тренувальної задачі ми можемо використовувати наступні 3 алгоритми: MLE (максимальна оцінка ймовірності), навчання Вітербі (НЕ плутати з декодуванням Вітербі), Baum Welch = алгоритм вперед-назад. АЛЕ у Вікіпедії , йдеться Алгоритм Баума-Уелча …

2
Якір швидше RCNN
У роботі "Швидше RCNN", коли йдеться про анкерування, що вони означають, використовуючи "піраміди посилальних коробок" і як це робиться? Чи це просто означає, що в кожній з анкерних точок W * H * k формується обмежувальне поле? Де W = ширина, H = висота і k = кількість співвідношень сторін …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.