Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Що може бути прикладом, коли L2 є хорошою функцією втрат для обчислення задньої втрати?
Втрати L2 разом із втратами L0 та L1 - це три дуже поширені функції "втрати за замовчуванням", які використовуються при підсумовуванні задньої частини за мінімальною очікуваною втратою. Однією з причин цього є, можливо, те, що їх порівняно легко обчислити (принаймні, для 1d-розподілів), L0 призводить до режиму, L1 - медіану, а …

1
Конвергенція з алгоритму ЕМ з розподілом біваріантної суміші
У мене є змішана модель, яку я хочу знайти максимальну оцінку ймовірності заданого набору даних та набір частково спостережуваних даних . Я реалізував як E-крок (обчислення очікування заданих і поточних параметрів ), так і M-крок, щоб мінімізувати негативну ймовірність журналу з огляду на очікуване .xxxzzzzzzxxxθkθk\theta^kzzz Як я зрозумів, максимальна ймовірність …

4
Розробіть статистичний тест, щоб виділити два продукти
У мене є набір даних з опитування клієнтів, я хочу розгорнути статистичний тест, щоб побачити, чи є різниця між значущістю продукту 1 і продуктом 2. Ось набір даних відгуків клієнтів. Коефіцієнт - від дуже поганого, поганого, добре, хорошого, до дуже хорошого. customer product1 product2 1 very good very bad 2 …

1
Питання про припущення щодо нормальності t-тесту
Для t-тестів, згідно з більшістю текстів, існує припущення, що дані популяції зазвичай розподіляються. Я не бачу, чому це так. Чи не вимагає тестового тесту лише те, щоб розподіл вибірки засобів для вибірки був нормально розподілений, а не популяція? Якщо у випадку, якщо t-тест в кінцевому підсумку вимагає нормальності розподілу вибірки, …

3
R сезонний часовий ряд
Я використовую цю decomposeфункцію Rі придумую 3 компоненти мого щомісячного часового ряду (тренд, сезонний та випадковий). Якщо будувати графік або дивитись у таблицю, я чітко бачу, що на часовий ряд впливає сезонність. Однак, коли я регресую часовий ряд на 11 сезонних фіктивних змінних, всі коефіцієнти не є статистично значущими, що …

1
Які відмінності між фільтрами, засвоєними в автоенкодері та конволюційній нейронній мережі?
У CNN ми вивчимо фільтри для створення карти функцій у згортковому шарі. В Autoencoder окрему приховану одиницю кожного шару можна розглядати як фільтр. Яка різниця між фільтрами, вивченими у цих двох мережах?

2
Як журнал (p (x, y)) нормалізує точну взаємну інформацію?
Я намагаюся зрозуміти нормалізовану форму точкової взаємної інформації. npmi=pmi(x,y)log(p(x,y))npmi=pmi(x,y)log(p(x,y))npmi = \frac{pmi(x,y)}{log(p(x,y))} Чому ймовірність спільного журналу нормалізує точкову взаємну інформацію між [-1, 1]? Точна взаємна інформація: pmi=log(p(x,y)p(x)p(y))pmi=log(p(x,y)p(x)p(y))pmi = log(\frac{p(x,y)}{p(x)p(y)}) p (x, y) обмежений [0, 1], тому журнал (p (x, y)) обмежений (, 0]. Схоже, що журнал (p (x, y)) повинен якось …

1
Чи байєсівська оцінка з "рівним попереднім" збігається з максимальною оцінкою ймовірності?
У філогенетиці філогенетичні дерева часто будують за допомогою MLE або Bayesian аналізу. Часто в байєсівській оцінці використовується рівна квартира. Як я розумію, байєсівська оцінка - це ймовірність оцінки, яка містить попередній показник. Моє запитання: якщо ви використовуєте квартиру до того, чи відрізняється вона від простого аналізу ймовірності?

1
У чому полягає відмінність між статистичним тестом «Нульова гіпотеза» та будь-яким іншим тестом?
Нещодавня гаряча тема обговорення стосується журналу, що забороняє використовувати "статистичні тестові процедури з нульовою гіпотезою" (NHSTP) "зі статей, поданих до журналу. Я бачу цей термін, який використовують деякі письменники, але я не розумію, яку різницю вони намагаються зробити. Чи відрізняється NHSTP від ​​"перевірки гіпотези" чи "тесту на значимість"?

2
Зрізане середнє проти серединного
У мене є набір даних із усіма дзвінками до служби швидкої допомоги та часом реагування відділення швидкої допомоги. Вони визнали, що є деякі помилки з часом відгуку, оскільки є випадки, коли вони не починали запис (тому значення дорівнює 0) або коли вони не зупиняли годинник (тому значення може бути надзвичайно …

6
Як підготувати / побудувати функції для виявлення аномалії (дані безпеки мережі)
Моя мета - проаналізувати мережеві журнали (наприклад, Apache, syslog, аудит безпеки Active Directory тощо), використовуючи кластеризацію / виявлення аномалії для виявлення вторгнень. З журналів у мене є багато текстових полів, таких як IP-адреса, ім’я користувача, ім’я хоста, порт призначення, порт джерела тощо (загалом 15-20 полів). Я не знаю, чи є …

1
Які відмінності між різними розв'язниками R квадратичного програмування?
Я шукаю пакет, який допоможе мені вирішити деякі проблеми квадратичної оптимізації, і я бачу, що є щонайменше півдесятка різних пакетів. Відповідно до цієї сторінки: QP (Квадратичне програмування, 90C20): cplexAPI , kernlab , limSolve , LowRankQP , quadprog , Rcplex , Rmosek Деякі з них (Rmosek і cplexAPI) залежать від інших …
9 r  optimization 

1
Вибір k-значення для аналізу виявлення локального фактора (LOF)
У мене є набір тривимірних даних, і я намагаюся використовувати аналіз локального фактора Outlier, щоб визначити найбільш унікальні або дивні значення. Як можна вирішити k-значення, яке потрібно використовувати в аналізі LOF? Я розумію, що визначає значення k, і тому я не здивований, що я бачу дещо інші результати за допомогою …

1
Чи застосовує Монте-Карло == випадковий процес?
Я ніколи не мав офіційного курсу статистики, але завдяки своєму дослідженню я постійно натрапляю на статті, в яких застосовуються кілька статистичних понять. Часто я бачу опис процесу Монте-Карло, застосованого до даної ситуації, і для того, що я можу зібрати 9 із 10 разів, це зводиться до простого випадкового покоління населення …

3
Моделювання даних підрахунку, коли змінна зміщення дорівнює 0 для деяких спостережень
Я намагаюся допомогти студенту колеги. Учень спостерігав і підраховував поведінку птахів (кількість дзвінків) в експериментальній установці. Кількість дзвінків, які можна віднести до конкретної спостережуваної птиці під час кожного експерименту, не вдалося визначити, але підрахувати кількість птахів, які сприяли кількості записаних дзвінків, було можливо. Отже, моя початкова пропозиція полягала в тому, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.