Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Звідки беруться повні умови в вибірці Гіббса?
Алгоритми MCMC, такі як відбір проб Metropolis-Hastings та Gibbs, є способами відбору проб із спільних заднього розподілу. Я думаю, що я розумію і можу легко реалізувати мегаполіси - ви просто якось вибираєте початкові точки і «прогулюєте простір параметрів» випадковим чином, керуючись задньою щільністю та щільністю пропозицій. Вибірка Гіббса здається дуже …
15 bayesian  mcmc  gibbs 

2
VIF, індекс стану та власні значення
Наразі я оцінюю багатоколірність у своїх наборах даних. Які порогові значення VIF та індекс стану нижче / вище говорять про проблему? VIF: Я чув, що VIF - це проблема.≥ 10≥10\geq 10 Після видалення двох проблемних змінних, VIF становить для кожної змінної. Чи потребують змінних більше лікування чи цей VIF здається …

2
Показати середній замість медіани у boxplot [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 5 місяців тому . При побудові графіки коробки з пітон-матплотлібом рядки на півдорозі ділянки є медіаною розподілу. Чи є можливість замість цього рядка в середньому. Або …


2
Випадкові числа та багатоядерний пакет
Під час програмування в R я кілька разів використовував багатоядерний пакет. Однак я ніколи не бачив твердження про те, як це обробляє випадкові числа. Коли я використовую openMP з C, я обережно використовую правильний паралельний RNG, але з R я припускаю, що трапляється щось розумне. Чи може хтось підтвердити, що …

4
Статистична подібність часових рядів
Припустимо, у них є часовий ряд, з якого можна проводити різні вимірювання, такі як період, максимум, мінімум, середній рівень тощо, а потім використовувати їх для створення синусоїди з однаковими атрибутами, чи є якісь статистичні підходи, які можна використати кількісно наскільки тісно відповідають фактичні дані передбачуваній моделі? Кількість точок даних у …

4
Порівнюючи моделі змішаного ефекту з однаковою кількістю ступенів свободи
У мене є експеримент, який я спробую тут абстрагувати. Уявіть, що я кидаю три білі камені перед вами і прошу вас зробити судження про їхню позицію. Я фіксую різноманітні властивості каменів і вашу відповідь. Я роблю це над низкою предметів. Я генерую дві моделі. Одне полягає в тому, що найближчий …

3
Хтось із вас використовує електронну таблицю Документів Google, щоб вести та ділитися своєю статистичною роботою з іншими?
Я знаю, що більшість із вас, напевно, відчувають, що Google Документи все ще є примітивним інструментом. Це не Matlab або R і навіть не Excel. Тим не менш, я здивований силою цього веб-програмного забезпечення, яке просто використовує функціональні можливості браузера (і сумісне з багатьма браузерами, які працюють дуже по-різному). Майк …

5
Хороший спосіб графічно показати багато даних
Я працюю над проектом, який включає 14 змінних та 345 000 спостережень за даними про житло (такі речі, як рік побудови, квадратні метри, продана ціна, графство проживання тощо). Мене хвилює намагання знайти хороші графічні прийоми та бібліотеки R, які містять приємні методики побудови графіків. Я вже бачу, що в ggplot …

10
Огляд програмних засобів для пошуку даних
Хоча я пройшов підготовку інженера, я вважаю, що мене все більше цікавить пошук даних. Зараз я намагаюся далі дослідити поле. Зокрема, я хотів би зрозуміти різні категорії програмних засобів, які існують та які інструменти помітні в кожній категорії та чому. (Зверніть увагу, що я не сказав "найкращі" інструменти, лише помітні, …

4
Шукаю хорошого вступного лікування мета-аналізу
Колега (не статистик) стикається з метааналізами в роботах, які він рецензує в медичних журналах, і шукає хорошого вступного рівня, щоб він міг себе освоїти. Будь-які рекомендації? Вибране? Книги, монографії, статті нетехнічного опитування все було б добре. (Так, він знайомий із записом у Вікіпедії та іншими матеріалами, доступними для пошуку в …

5
Усадка Джеймса-Штейна "в дикій природі"?
Мене сприймає ідея усадки Джеймса-Штейна (тобто, що нелінійна функція одного спостереження за вектором, можливо, незалежних нормалей може бути кращим оцінником засобів випадкових величин, де «краще» вимірюється квадратичною помилкою ). Однак я ніколи не бачив цього в прикладній роботі. Ясно, що я недостатньо добре читаю. Чи є класичні приклади, коли Джеймс-Штейн …

9
Які книги надають огляд обчислювальної статистики, як це стосується інформатики?
Як інженер програмного забезпечення мене цікавлять такі теми, як статистичні алгоритми, обмін даними, машинне навчання, байєсівські мережі, алгоритми класифікації, нейронні мережі, ланцюги Маркова, методи Монте-Карло та генерація випадкових чисел. Мені особисто не було приємно працювати з будь-якою з цих методик, але мені довелося працювати з програмним забезпеченням, яке під кришкою …

5
Застосування методів машинного навчання в невеликих вибіркових клінічних дослідженнях
Що ви думаєте про застосування методів машинного навчання, як-от випадкові ліси чи санкціоновані регресії (з покаранням L1 або L2, або їх комбінація) у невеликих вибіркових клінічних дослідженнях, коли метою є виділення цікавих прогнозів у контексті класифікації? Це не питання щодо вибору моделі, а також не питання про те, як знайти …


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.