Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Яка найкраща книга про узагальнені лінійні моделі для новачків?
Я все ще досить нова в узагальнених лінійних моделях, і я борюся з великою кількістю позначень у більшості текстів GLM, які я зібрав. Чи є надзвичайно популярні книги GLM, які краще піддаються читанню?

2
Як вибрати правильний алгоритм оптимізації?
Мені потрібно знайти мінімум функції. Читаючи документи на http://docs.scipy.org/doc/scipy/reference/optimize.html я бачу, що існує кілька алгоритмів, які роблять те саме, тобто знаходять мінімум. Як я можу знати, яку вибрати? деякі з перелічених алгоритмів Мінімізуйте функцію, використовуючи алгоритм простого спуску. Мінімізуйте функцію за допомогою алгоритму BFGS. Мінімізуйте функцію за допомогою нелінійного алгоритму …

3
Чи додає більше змінних до багатовимірної регресії зміни коефіцієнтів існуючих змінних?
Скажімо, у мене є багатовимірна (кілька незалежних змінних) регресії, яка складається з 3 змінних. Кожна з цих змінних має заданий коефіцієнт. Якщо я вирішу ввести 4-ту змінну і повторити регресію, чи зміняться коефіцієнти трьох вихідних змінних? Більш широко: в регресії багатовимірної (декількох незалежних змінних) коефіцієнт даної змінної впливає на коефіцієнт …

1
Чи можна перетворити коваріаційну матрицю в невизначеність для змінних?
У мене є GPS-пристрій, який видає вимірювання шуму за допомогою матриці коваріації ΣΣ\Sigma : Σ=⎡⎣⎢σxxσyxσxzσxyσyyσyzσxzσyzσzz⎤⎦⎥Σ=[σxxσxyσxzσyxσyyσyzσxzσyzσzz]\Sigma = \left[\begin{matrix} \sigma_{xx} & \sigma_{xy} & \sigma_{xz} \\ \sigma_{yx} & \sigma_{yy} & \sigma_{yz} \\ \sigma_{xz} & \sigma_{yz} & \sigma_{zz} \end{matrix}\right] (там також задіяно, але давайте ігноруємо це на секунду.)ttt Припустимо, я хочу сказати комусь іншому, …

5
Як означає розподіл вибірки на вибірку, приблизно, означає сукупність?
Я намагаюся вивчити статистику, бо вважаю, що вона настільки поширена, що забороняє мені вчитися чомусь, якщо я не розумію її належним чином. У мене виникають проблеми з розумінням цього поняття розподілу вибірки засобів вибірки. Я не можу зрозуміти, як це пояснили деякі книги та сайти. Я думаю, що я розумію, …

3
Використання пакету R прогнозу з відсутніми значеннями та / або нерегулярними часовими рядами
Мене вражає forecastпакет R , а також, наприклад, zooпакет для нерегулярних часових рядів та інтерполяції відсутніх значень. Мій додаток знаходиться в області прогнозування трафіку кол-центру, тому дані про вихідні (майже) завжди відсутні, що може бути чудово оброблено zoo. Також деякі дискретні точки можуть бути відсутніми, я просто використовую R NAдля …

2
Перехресна перевірка PCA та k-кратна в упаковці каре в R
Я щойно переглянув лекцію з курсу машинного навчання на курсі. У розділі, де професор обговорює PCA для попередньої обробки даних у контрольованих навчальних програмах, він каже, що PCA слід виконувати лише на навчальних даних, а потім відображення використовується для перетворення перехресних перевірок і тестових наборів. Дивіться також PCA та розділ …

2
Коли хтось каже, що залишкове відхилення / df повинно бути ~ 1 для моделі Пуассона, наскільки приблизним є приблизний?
Я часто бачив поради щодо перевірки того, чи підходить модель Пуассона надмірно розсіяною, що включає ділення залишкового відхилення на ступінь свободи. Отримане співвідношення має бути «приблизно 1». Питання полягає в тому, про який діапазон ми говоримо для "приблизного" - що таке співвідношення, яке повинно запускати тривогу для розгляду альтернативних форм …

5
Який вплив має підвищення навчальних даних на загальну точність системи?
Чи може хтось підсумувати для мене можливі приклади, при яких ситуаціях збільшення даних про тренінг покращує загальну систему? Коли ми виявимо, що додавання більшої кількості даних про навчання може призвести до надмірних даних і не дати належної точності даних тесту? Це дуже неспецифічне запитання, але якщо ви хочете відповісти на …

2
Тест на IID відбір проб
Як би ви перевірили чи перевірили, чи є вибірка IID (незалежна та ідентично розподілена)? Зауважте, що я не маю на увазі гауссових та ідентично розподілених, просто IID. І ідея, яка мені спадає на думку, полягає в тому, щоб неодноразово розділити вибірку на дві під зразки однакового розміру, виконати тест Колмогорова-Смірнова …

3
Чи є загальний метод моделювання даних із формули чи аналізу?
По-новому моделювання даних з експериментальної рамки даних проектування. З акцентом на R (хоча інше мовне рішення було б чудово). Розробляючи експеримент або опитування, моделювання даних та проведення аналізу цих модельованих даних може забезпечити надзвичайне уявлення про переваги та недоліки конструкції. Такий підхід також може бути важливим для розуміння та правильного …

3
Як би ви пояснили узагальнені лінійні моделі людям, які не мають статистичного походження?
Мені завжди важко пояснити статистичні прийоми аудиторії, яка не має статистичної інформації. Якби я хотів пояснити, що таке ГЛМ для такої аудиторії (не викидаючи статистичний жаргон), що було б найкращим чи найефективнішим способом? Я зазвичай пояснюю GLM трьома частинами - (1) випадковою складовою, яка є змінною відповіді, (2) систематичною складовою, …

2
Який розподіл найчастіше використовується для моделювання часу відгуку сервера?
У мене є сервлет-додаток, в якому я вимірюю час, необхідний для виконання кожного запиту до цього сервлета. Я вже обчислюю просту статистику, як середнє та максимальне; Однак я хотів би зробити ще більш складний аналіз, і для цього я вважаю, що мені потрібно правильно моделювати ці часи реакції. Безумовно, я …

4
Які хороші набори даних для ілюстрації окремих аспектів статистичного аналізу?
Я усвідомлюю, що це суб'єктивно, але я думав, що було б непогано поговорити про наші улюблені набори даних та те, що, на нашу думку, робить їх цікавими. Існує велика кількість даних, і що з усіма API (наприклад, Datamob ) поряд з класичними наборами даних (наприклад, R дані ), я думаю, …
16 dataset 

2
Пуассон або квазі-пуассон в регресії з даними підрахунку і перевищенням?
У мене є дані про підрахунок (аналіз попиту / пропозиції з підрахунком кількості клієнтів, залежно від - можливо - багатьох факторів). Я спробував лінійну регресію з нормальними помилками, але мій QQ-графік не дуже хороший. Я спробував перетворення журналу відповіді: ще раз, поганий QQ-графік. Тому зараз я намагаюся регресувати з помилками …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.