Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


5
Яку мову програмування ви рекомендуєте для прототипування проблеми машинного навчання?
Зараз працюю в Octave, але через погану документацію прогрес дуже повільний. Яку мову легко вивчити та використовувати та добре задокументовану для вирішення проблем машинного навчання? Я шукаю прототип на невеликому наборі даних (тисячі прикладів), тому швидкість не важлива. EDIT: Я розробляю систему рекомендацій. Отже, мені цікаво використовувати регульовану лінійну регресію, …

1
Чи можу я використовувати парний t-тест, коли зразки нормально розподіляються, але різниця їх немає?
У мене є дані експерименту, коли я застосував два різних режими лікування в однакових початкових умовах, даючи ціле число від 0 до 500 у кожному випадку як результат. Я хочу використовувати парний t-тест, щоб визначити, чи суттєво відрізняються ефекти, отримані двома методами лікування. Результати для кожної групи лікування зазвичай розподіляються, …

1
Що таке хороший показник ступеня порушення нормальності та які описові мітки можуть бути додані до цього показника?
Контекст: У попередньому запитанні @Robbie запитав у дослідженні, в якому було проведено близько 600 випадків, чому тести на нормальність пропонували значну нестандартність, але сюжети пропонували нормальний розподіл . Кілька людей підкреслили, що тести на значущість не є дуже корисними. З невеликими зразками такі тести не мають великої сили для виявлення …

2
Як я можу встановити нульовий нагнітаний пуассон в JAGS?
Я намагаюся створити нульову завищену модель пуассона в R та JAGS. Я новачок у JAGS, і мені потрібні поради, як це зробити. Я намагався із наступним, де y [i] - спостерігається змінна model { for (i in 1:I) { y.null[i] <- 0 y.pois[i] ~ dpois(mu[i]) pro[i] <- ilogit(theta[i]) x[i] ~ …

5
Чому б усі тести на нормальність відкидали нульову гіпотезу?
Тест Колгоморова-Смірнова, тест Шапіро та ін .... всі відкидають гіпотезу про те, що розподіл є нормальним. Але коли я будую нормальні кванти та гістограми, дані явно нормальні. Може тому, що потужність тестів висока? Розмір вибірки становить близько 650. Чи не повинен хоча б один із цих тестів не відкинути нульову …

1
Надійний кластерний метод для змішаних даних в R
Я шукаю кластеризувати невеликий набір даних (64 спостереження 4-х інтервальних змінних та одна категоріальна трифакторна змінна). Зараз я зовсім новачок у кластерному аналізі, але знаю, що з часів, коли ієрархічна кластеризація або k-засоби були єдиними доступними варіантами, був значний прогрес. Зокрема, видається, що доступні нові методи кластеризації на основі моделей, …

5
Як ефективно обчислити ядро ​​Гаусса в numpy [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 3 роки тому . У мене є nummy масив з m стовпцями та n рядками, стовпці мають розміри та рядки даних. Тепер мені потрібно обчислити значення …

3
Оцінка параметрів просторового процесу
Мені надається сітка позитивних цілих значень. Ці цифри представляють інтенсивність, яка повинна відповідати силі віри людини, що займає місце розташування сітки (вище значення, що вказує на більшу віру). Людина взагалі матиме вплив на декілька комірок сітки.n × nн×нn\times n Я вважаю, що схема інтенсивності повинна "виглядати гауссова", оскільки там буде …

5
Як зробити гарну шкалу інтенсивності кольорів?
Я аж ніяк не хороший у статистиці, але думаю, що прийшов у потрібне місце. Моє запитання просте: Моя проблема полягає в порівнянні чисельності населення декількох штатів у невеликій країні, але деякі штати мають населення 3000 000, а деякі населення 2 000. Я малюю це на карті, і "інтенсивність" кольору залежить …

4
Як виконати PCA для даних дуже високої розмірності?
Щоб виконати аналіз основних компонентів (PCA), ви повинні відняти засоби кожного стовпця з даних, обчислити матрицю коефіцієнтів кореляції, а потім знайти власні вектори та власні значення. Ну, швидше, це те, що я зробив для його реалізації в Python, за винятком того, що він працює лише з невеликими матрицями, оскільки метод …
12 pca  python 

5
Чи можна обчислити середнє гармонійне відхилення?
Чи можна обчислити середнє гармонійне відхилення? Я розумію, що середнє арифметичне може бути обчислене середнє відхилення, але якщо ви маєте середнє гармонічне значення, то як обчислюєте стандартне відхилення чи CV?

1
Чи повинен пошук у сітці SVM показувати область високої точності з низькою точністю навколо?
У мене є 12 позитивних навчальних наборів (ракові клітини, які лікуються лікарськими засобами з кожним із 12 різних механізмів дії). Для кожного з цих позитивних навчальних наборів я хотів би навчити підтримуючу векторну машину, щоб відрізнити її від негативного набору рівних розмірів, відібраного з експерименту. Кожен набір має від 1000 …
12 svm 

4
Як взяти багато зразків з 10 з великого списку, без загальної заміни
У мене є великий набір даних (20 000 точок даних), з яких я хочу взяти повторні зразки з 10 точок даних. Однак, як тільки я вибрав ці 10 точок даних, я хочу, щоб вони більше не вибиралися. Я намагався використовувати цю sampleфункцію, але, схоже, не існує можливості вибірки без заміни …
12 r  sample 

1
Статистика на основі фрактальної математики
Шукаю книги / підручники зі статистики на основі фрактальної математики. Я знаю, що це не дуже відома область, і досить складно знайти хорошу літературу. Будь-які пропозиції вітаються (книги, підручники, матеріали в Інтернеті).

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.