Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Залишки для логістичної регресії та відстані Кука
Чи є якісь припущення щодо помилок для логістичної регресії, такі як постійна дисперсія термінів помилки та нормальність залишків? Також зазвичай, якщо у вас є точки, відстань Кука яких перевищує 4 / n, ви видаляєте їх? Якщо ви все-таки видалите їх, як ви можете зрозуміти, чи краще модель із вилученими точками?

1
Чи регресії з помилками студента-т марні?
Перегляньте редагування. Коли у вас є дані з важкими хвостами, регресія з помилками студента-т здається інтуїтивно зрозумілою справою. Досліджуючи цю можливість, я наткнувся на цей документ: Breusch, TS, Robertson, JC, & Welsh, AH (01 листопада 1997). Новий одяг імператора: критика багатоваріантної регресійної моделі. Statistica Neerlandica, 51, 3.) ( посилання , …

4
Ймовірність знаходження певної послідовності пар основ
Думка про вірогідність завжди змушує усвідомити, наскільки я поганий у підрахунку ... Розглянемо послідовність нnn основних літер A ,Т,С, і GA,T,C, and GA,\; T, \; C, \text{ and } G , коженрівній мірі можуть з'явитися. Яка ймовірність, що ця послідовність містить певну послідовність базових пар, що представляють інтерес довжиниr ≤ …

1
Подвоєння хвостів у двопробному тесті на перестановку
Припустимо, у нас є два зразки, і ми хочемо визначити, чи вони виведені з одного і того ж розподілу, а вибірки A, B складаються з деяких цілих чисел. Якщо ми перевіримо це за допомогою двопробного тесту перестановки, зокрема, переглянувши перестановки, де відмінності в засобах зразків такі ж екстремальні, як і …

3
Щодо використання біграмової (N-грамової) моделі для побудови функціонального вектора для текстового документа
Традиційним підходом побудови функцій для видобутку тексту є підхід із пакету слів, який можна вдосконалити, використовуючи tf-idf для налаштування вектора ознак, що характеризує даний текстовий документ. В даний час я намагаюся використовувати біграмову мовну модель або (N-грам) для побудови функціонального вектора, але не знаю, як це зробити? Чи можемо ми …

1
Різниця між граничними та умовними моделями
Гранична модель враховує кореляції всередині кожного кластера. Умовна модель також враховує кореляцію в межах кожного кластера. Мої запитання: Чи маргінальна модель моделює основні ефекти для всієї сукупності, тоді як умовна модель моделює основні ефекти в кластері та в цілій популяції? Інтерпретація коефіцієнтів граничної моделі в основному така ж, як "звичайна …

3
Кластеризація розподілів
У мене є кілька розподілів (10 малюнків на малюнку нижче). Насправді це гістограми: на осі x є 70 значень, що є розмірами деяких частинок у розчині, і для кожного значення x відповідне значення y - це частка частинок, розмір яких становить приблизно значення x. Я б хотів згрупувати ці дистрибутиви. …
10 clustering 

1
Як обчислити довірчий інтервал для прогнозування часових рядів?
У мене є часовий ряд (скажімо, - ), і мені потрібно передбачити наступний зразок (скажімо, ), використовуючи модель наприклад нейронна мережа або множинна лінійна регресія. На час n я маю всю вибірку від до , і мені потрібно передбачити ; в момент мене є всі вибірки від до , і …

2
Кореляція між дихотомічною та безперервною змінною
Я намагаюся знайти співвідношення між дихотомічною та суцільною змінною. З моєї основної роботи з цього питання я виявив, що я повинен використовувати незалежний t-тест, і передумовою цього є те, що розподіл змінної має бути нормальним. Я провів тест Колмогорова-Смірнова для перевірки нормальності і виявив, що суцільна змінна є ненормальною і …

3
Інтернет-матеріал для вивчення аналізу часових рядів
Моє запитання, чи є якісь хороші онлайн-матеріали для вивчення цього. Щось добре знайомить речі, особливо моделі ARMA та пов'язану з ними математику. Редагувати: Я шукаю щось із найвищого рівня на бакалавраті. Щось подібне до вступу Броквеля та Девіса в часові ряди та прогнозування

2
Стабільність моделі в перехресній валідації регресійних моделей
З огляду на множину перехресних перевірок логістичної регресії та отримані множинні оцінки кожного коефіцієнта регресії, як слід вимірювати, чи є прогноктор (чи набір предикторів) стійким та значущим на основі коефіцієнтів (ів) регресії ? Чи відрізняється це від лінійної регресії?

1
Тест на пропорції та двійковий класифікатор
У мене є прототип машини для виготовлення деталей. У першому тесті машина виробляє деталей, і двійковий класифікатор повідомляє мені, що частини несправні ( , зазвичай і ), а частини хороші.d 1 d 1 < N 1 d 1 / N 1 < 0,01 N 1 ≈ 10 4 N 1 …

2
Як можна групувати рядки за загальними темами?
Я намагаюся згрупувати, наприклад, рядки про програмування з іншими рядками про програмування, рядки про фізику з іншими рядками про фізику тощо, для широкого кола тем. Незважаючи на яскравий теоретичний лінгвістичний аспект проблеми, я хочу реально зробити це за допомогою програмування / програмного забезпечення. Епізод: Зважаючи на велику кількість рядків, як …

3
Яка ймовірність, що n людей зі списку m людей опиняються у випадковому відборі x людей зі списку y людей?
Якщо я вибираю 232 особи з пулу з 363 людей без заміни, яка ймовірність того, що 2 із списку з 12 конкретних людей будуть в цьому відборі? Це випадковий розіграш для ультра-гонки, де було 233 учасники на 232 місця. Існує аргумент про те, чи був відбір упередженим щодо певної групи …

2
Як вибрати найкращу трансформацію для досягнення лінійності?
Я хочу зробити декілька лінійних регресій, а потім передбачити нові значення з невеликою екстраполяцією. У мене є змінна відповідь у діапазоні від -2 до +7 та три предиктори (діапазони приблизно +10 - +200). Розподіл майже нормальний. Але взаємозв'язок між відповіддю та предикторами не є лінійним, на графіках я бачу криві. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.