Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


3
Аналіз часових ліній
Я провожу дослідження взаємозв'язку між порядком народження людини та пізнішим ризиком ожиріння, використовуючи дані кількох однорічних народжень (наприклад, http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/ ). Ключовим завданням є те, що порядок народження пов'язаний з іншими ознаками, такими як вік матері, кількість молодших та / або старших братів та сестер та відстань від народження, які також …
10 timelines 

3
Присвоєння міток класу кластерам k-означає
У мене дуже основне питання щодо кластеризації. Після того як я знайшов k кластери з їхніми центроїдами, як мені перейти до інтерпретації класів точок даних, які я кластеризував (присвоюючи значні мітки класу кожному кластеру). Я не кажу про валідацію знайдених кластерів. Чи можна це зробити за допомогою невеликого міченого набору …
10 k-means 

3
Як візуалізувати байєсовську користь пристосованості для логістичної регресії
Для проблеми байєсівської логістичної регресії я створив задній прогнозний розподіл. Я беру вибірку з прогнозного розподілу і отримую тисячі зразків (0,1) за кожне маю спостереження. Візуалізація корисності придатності є менш ніж цікавою, наприклад: Цей сюжет показує 10 000 зразків + спостережна точка даної точки (шлях зліва може виділити червону лінію: …

3
Яка перевага імпутації над побудовою кількох моделей у регресії?
Цікаво, чи хтось міг би дати деяке уявлення про те, чому імпутація відсутніх даних краще, ніж просто побудова різних моделей для випадків із відсутніми даними. Особливо у випадку [узагальнених] лінійних моделей (я, можливо, бачу, що в нелінійних випадках все по-іншому) Припустимо, у нас є основна лінійна модель: Y= β1Х1+ β2Х2+ …

1
Статистика машинного навчання, документи для початку?
У мене є досвід в галузі комп’ютерного програмування та теорії елементарних чисел, але немає реального навчання статистиці, і нещодавно "виявив", що дивовижний світ цілого спектру методів - це насправді статистичний світ. Здається, що матричні факторизації, заповнення матриці, високі розмірні тензори, вбудовування, оцінка щільності, байесівські умовиводи, розділи Маркова, обчислення власного вектора, …

4
Як перевірити, чи добре моя регресійна модель
Один із способів знайти точність моделі логістичної регресії за допомогою 'glm' - це знайти графік AUC. Як перевірити те саме для регресійної моделі, знайденої з змінною безперервної відповіді (family = 'gaussian')? Які методи використовуються для перевірки того, наскільки моя модель регресії відповідає даним?

2
Оцінка щільності ядра на асиметричних розподілах
Нехай - спостереження, отримані з невідомого (але, безумовно, асиметричного) розподілу ймовірностей.{ х1, … , ХN}{х1,…,хN}\{x_1,\ldots,x_N\} Я хотів би знайти розподіл ймовірностей за допомогою підходу KDE: Однак я спробував використовувати ядро ​​Гаусса, але воно було погано, оскільки воно симетричне. Таким чином, я бачив, що деякі роботи щодо ядер Gamma та Beta …


1
Інтерпретація графіків умовної щільності
Я хотів би знати, як правильно інтерпретувати графіки умовної щільності. Я вставив два нижче , що я створив в R з cdplot. Наприклад, чи вірогідність результату дорівнює 1, коли Var 1 дорівнює 150 приблизно 80%? Темно-сіра область - це та, яка умовна ймовірність Resultбуття дорівнює 1, правда? З cdplotдокументації: cdplot …

3
З огляду на монету з невідомим зміщенням, ефективно генеруйте змінні з справедливої ​​монети
З огляду на монету з невідомим зміщенням ppp , як я можу генерувати змінні - якомога ефективніше - які розподіляються Бернуллі з вірогідністю 0,5? Тобто, використовуючи мінімальну кількість фліпів на генеровану змінну.

3
Серйозна поглиблена проблема ймовірностей гортання монет
Скажімо, я роблю 10 000 фліп монети. Мені хотілося б знати ймовірність того, скільки обертів потрібно, щоб отримати 4 і більше поспіль головок поспіль. Підрахунок буде працювати наступним чином, ви вважаєте, що один наступний раунд фліп - це лише голови (4 голови і більше). Коли хвостик вдарить і розірве смугу …

3
Обмеження методів ансамблю на основі дерев у малих n, великих p задачах?
Методи ансамблю на основі дерев, такі як "Випадковий ліс" та наступні похідні (наприклад, умовний ліс), усі вони вважають корисними у так званих "малих n , великих p " проблемах для визначення відносної змінної важливості. Дійсно, це так і є, але моє питання полягає в тому, наскільки далеко можна взяти цю …

3
Побудуйте дерево ймовірностей шляху для подорожей через веб-сайт
В даний час я роблю аналіз на веб-сайті, який вимагає створити схему дерева рішень, яка показує ймовірний маршрут, який люди проходять, коли вони приходять на веб-сайт. Я маю справу з тим, data.frameякий показує шляхи всіх клієнтів до сайту, починаючи з домашньої сторінки. Наприклад, клієнт може піти таким шляхом: Homepage - …

2
Яка різниця між лінійною регресією, перетвореною логітом, логістичною регресією та логістичною змішаною моделлю?
Припустимо, у мене є 10 учнів, які намагаються вирішити 20 задач з математики. Проблеми оцінюються правильними або неправильними (у лонгдатах), а результативність кожного учня може бути узагальнена за допомогою міри точності (у підданих). Моделі 1, 2 і 4 нижче, здається, дають різні результати, але я розумію, що вони роблять те …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.