Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
П'ять найкращих класифікаторів, які слід спробувати першими
Крім очевидних характеристик класифікатора, як обчислювальна вартість, очікувані типи даних функцій / міток та придатність для певних розмірів і розмірів наборів даних, які перші п’ять (або 10, 20?) класифікаторів спробувати спершу на новому наборі даних, про який ще не відомо багато (наприклад, семантика та співвідношення окремих ознак)? Зазвичай я пробую …

2
Виявлення шаблонів обману на іспиті на багато запитань
ПИТАННЯ: У мене є двійкові дані щодо іспитових питань (правильні / неправильні). Деякі люди, можливо, мали попередній доступ до набору питань та їх правильних відповідей. Я не знаю, хто, скільки чи хто. Якби не було обману, припустимо, я б моделював вірогідність правильної відповіді для пунктуiii як, деявляє собою складність питання, …

4
Статистика співпраці
Як біолог, багато дослідницьких проектів, над якими я працюю в якийсь момент, стосуються співпраці зі статистиком, будь то прості поради або для впровадження та тестування моделі моїх даних. Мої колеги зі статистики визнають, що вони співпрацюють значною мірою, оскільки процес перегляду мандатів розглядає лише документи, на яких вони є першими …
25 academia 

2
Міжрейтингова надійність для порядкових або інтервальних даних
Які методи надійності між рейтингами найбільш підходять для порядкових або інтервальних даних? Я вважаю, що "Спільна ймовірність угоди" або "Каппа" розроблені для номінальних даних. У той час як "Пірсон" та "Спірмен" можуть використовуватися, вони в основному використовуються для двох рейтингів (хоча їх можна використовувати більше двох рейтингів). Які ще заходи …

2
Як впоратися з дослідницьким аналізом даних та днопоглинанням даних у дослідженнях малих зразків?
Дослідницький аналіз даних (EDA) часто призводить до вивчення інших "слідів", які не обов'язково належать до початкового набору гіпотез. Я стикаюся з такою ситуацією у випадку досліджень з обмеженим розміром вибірки та великою кількістю даних, зібраних за допомогою різних анкетування (соціально-демографічні дані, нейропсихологічні або медичні шкали - наприклад, психічне або фізичне …

4
Питання для інтерв'ю Амеби
Мені було задано це питання під час інтерв'ю щодо торгової позиції у фірмовій торговій фірмі. Мені б дуже хотілося знати відповідь на це питання та інтуїцію, що стоїть за ним. Питання Амеби: Популяція амеб починається з 1. Після 1 періоду амеба може поділитися на 1, 2, 3 або 0 (вона …

7
Яка різниця між ймовірністю та пропорцією?
Скажіть, я їв гамбургери кожен вівторок роками. Можна сказати, що я їдаю гамбургери 14% часу, або що ймовірність того, що я з'їм гамбургер за даний тиждень, становить 14%. Які основні відмінності між ймовірностями та пропорціями? Чи є ймовірність очікуваною пропорцією? Чи вірогідні ймовірності та пропорції гарантовані?

3
Візуалізація даних реакції на предмет Likert
Які хороші способи візуалізувати набір відповідей Лікерта? Наприклад, набір предметів, які розпитують про важливість X для прийняття рішень щодо A, B, C, D, E, F & G? Чи є щось краще, ніж складені діаграми? Що слід зробити з відповідями непридатних? Як вони можуть бути представлені? Чи повинні звітні смуги відображати …

8
Як оцінити, скільки людей відвідали подію (скажімо, політичну акцію)?
Студент сьогодні запитав мене: "Звідки вони знають, скільки людей відвідали велику групову подію, наприклад," Мітинг Стюарта / Колберта "Мітинг на відновлення розуму" у Вашингтоні? " Новини повідомляють про оцінки в десятках тисяч, але які методи використовуються для отримання цих оцінок і наскільки вони надійні? Одна стаття, очевидно, базувала свою оцінку …

3
Застосування вейвлетів до алгоритмів виявлення аномалій на основі часових рядів
Я почав працювати над навчальними посібниками зі статистичних даних з Ендрю Мура (дуже рекомендується для всіх, хто вперше зайнявся цією сферою). Я почав з прочитання цього надзвичайно цікавого PDF під назвою "Вступний огляд алгоритмів виявлення аномалій на основі часових рядів", в якому Мур простежує багато методів, що використовуються при створенні …

3
Градієнт втрати петлі
Я намагаюся реалізувати базовий градієнт спуску і тестую його за допомогою функції втрати шарніра, тобто . Однак я плутаю градієнт втрат шарніра. Я під враженням, що це такlhinge=max(0,1−y x⋅w)lhinge=max(0,1−y x⋅w)l_{\text{hinge}} = \max(0,1-y\ \boldsymbol{x}\cdot\boldsymbol{w}) ∂∂wlhinge={−y x0if y x⋅w<1if y x⋅w≥1∂∂wlhinge={−y xif y x⋅w<10if y x⋅w≥1 \frac{\partial }{\partial w}l_{\text{hinge}} = \begin{cases} -y\ …

5
Шукаю певного типу пояснення ARIMA
Це може бути важко знайти, але я хотів би, щоб читати добре пояснив приклад ARIMA , що використовує мінімальну математику розширює дискусію поза побудовою моделі на використання цієї моделі для прогнозування конкретних випадків використовує графіку, а також числові результати для характеристики відповідності між прогнозованими та фактичними значеннями.

3
Чому працює тест Колмогорова-Смірнова?
Читаючи про 2-зразковий тест KS, я розумію, що саме він робить, але не розумію, чому він працює . Іншими словами, я можу виконати всі кроки для обчислення емпіричних функцій розподілу, знайти максимальну різницю між двома, щоб знайти D-статистику, обчислити критичні значення, перетворити D-статистику в p-значення тощо. Але я поняття не …

2
Я чув, що співвідношення або обертання випадкових величин часто є проблематичними, тому що не мають очікувань. Чому так?
Назва - це питання. Мені кажуть, що співвідношення та обертання випадкових величин часто є проблематичними. Мається на увазі те, що очікування часто не існує. Чи є просте, загальне пояснення цього?

6
Для опуклих проблем градієнт стохастичного градієнтного спуску (SGD) завжди вказує на глобальне екстремальне значення?
З огляду на опуклу функцію витрат, використовуючи SGD для оптимізації, ми будемо мати градієнт (вектор) в певний момент під час процесу оптимізації. Моє запитання, з огляду на точку на опуклій, чи градієнт лише вказує в тому напрямку, в якому функція швидко збільшується / зменшується, або градієнт завжди вказує на оптимальну …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.