Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Переобладнання лінійних класифікаторів
Сьогодні наш професор на уроці заявив, що "переобладнати лінійними класифікаторами неможливо". Я вважаю, що це неправильно, оскільки навіть лінійні класифікатори можуть бути чутливими до людей, що перебувають у навчальному наборі - візьмімо, наприклад, жорсткий запас підтримки Vector Machine: Один єдиний шумний точок даних може змінити, який гіперплан буде використовуватися для …

2
Як статистично перевірити, чи моя мережа (графік) є мережею "малого світу" чи ні?
Малої світова мережа являє собою тип математичного графа , в якому більшість вузлів не є сусідами одного з одним, але більшість вузлів можуть бути досягнуті з будь-яким іншим невеликим числом стрибків або кроків. Зокрема, мережа малого світу визначається як мережа, де типова відстань L між двома випадковими обраними вузлами (кількість …

2
Змінна масштабу як даних підрахунку - правильна чи ні?
У цьому документі (у вільному доступі через центральний PubMed) автори використовують негативну біноміальну регресію для моделювання оцінки на 10-елементному інструменті екранування, набраному 0-40. Ця процедура передбачає підрахунок даних, що тут явно не так. Мені б хотілося вашої думки про те, чи прийнятний такий підхід, оскільки я іноді використовую той же …

1
При повторній параметризації функції ймовірності достатньо просто підключити перетворену змінну замість зміни формули змінних?
Припустимо, що я намагаюся повторно параметризувати функцію вірогідності, яка розподілена експоненціально. Якщо моя оригінальна функція вірогідності: р (у∣ θ ) = θ e- θ уp(y∣θ)=θe−θy p(y \mid \theta) = \theta e^{-\theta y} і я хотів би повторно параметризувати його за допомогою , оскільки не є випадковою змінною, а параметром, достатньо …

2
RMSE (Помилка кореневого середнього квадрату) для логістичних моделей
У мене виникає питання щодо обґрунтованості використання RMSE (Root Mean Squared Error) для порівняння різних логістичних моделей. Відповідь є 0або, 1і прогнози є ймовірністю між 0- 1? Чи справедливий спосіб, застосований нижче, і для двійкових відповідей? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, family = "binomial", type.measure …

4
Зважаючи на n рівномірно розподілених r.v's, що PDF за один rv ділиться на суму всіх n r.v's?
Мене цікавить такий тип випадків: є безперервні випадкові змінні, що мають значення n, які повинні дорівнювати 1. Який тоді буде PDF для будь-якої окремої такої змінної? Отже, якщо , то мене цікавить розподіл для , де і розподілені рівномірно. Середнє значення, звичайно, у цьому прикладі становить , оскільки середнє значення …
10 uniform 

1
Які методи існують для налаштування гіперпараметрів ядра графіку SVM?
У мене є деякі дані, які існують на графіку . Вершини належать до одного з двох класів y i ∈ { - 1 , 1 } , і мені цікаво навчати SVM для розмежування двох класів. Одним відповідним ядром для цього є дифузійне ядро , K = exp ( - …

1
Яка дисперсія цього оцінювача
Я хочу оцінити середнє значення функції f, тобто де і незалежні випадкові величини. У мене є зразки f, але не iid: Є зразки для і для кожного є зразки з :EX,Y[f(X,Y)]EX,Y[f(X,Y)]E_{X,Y}[f(X,Y)]XXXYYYY1,Y2,…YnY1,Y2,…YnY_1,Y_2,\dots Y_nYiYiY_ininin_iXXXXi,1,Xi,2,…,Xi,niXi,1,Xi,2,…,Xi,niX_{i,1},X_{i,2},\dots, X_{i,n_i} Отже, у мене є зразкиf(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X1,1,Y1)…f(X1,n1,Y1)…f(Xi,j,Yi)…f(Xn,nn,Yn)f(X_{1,1},Y_1) \dots f(X_{1,n_1},Y_1 ) \dots f(X_{i,j},Y_i) \dots f(X_{n,n_n},Y_n) Для оцінки середнього значення я …

2
Пакет R для комбінування р-значень за методом Фішера чи Стоуфера
Чи існує пакет R (або навіть основна функція R), який реалізує метод Фішера або Штуффера для поєднання p-значень? Кодування цього має бути майже тривіальним, але я б краще скористався пакетом (і цитую його). Приклад коду в цьому запитанні: метод Фішера для розчісування p-значень - а як щодо нижнього хвоста?

2
Різниця між усередненням даних, що підходять, та розміщенням даних, а потім усередненням
Якщо є, між пристосуванням рядка до декількох окремих "експериментів", то усередненням пристосувань або усередненням даних із окремих експериментів, то підходом усереднених даних. Дозвольте мені детальніше: Я виконую комп'ютерне моделювання, яке генерує криву, показану нижче. Ми витягуємо величину, давайте назвемо її "А", встановивши лінійну область ділянки (тривалий час). Значення - це …
10 error  fitting  average 

3
G-тест проти тестування на чи-квадрат Пірсона
Я тестую незалежність в таблицю спряженості. Я не знаю, чи краще тест G чи Пірсон чи-квадрат. Розмір вибірки - сотні, але кількість низьких клітин. Як зазначено на сторінці Вікіпедії , наближення до розподілу chi-квадратиком краще для G-тесту, ніж для тесту Хі-квадрата Пірсона. Але я використовую моделювання Монте-Карло для обчислення р-значення, …

3
Чому слід здійснювати трансформацію категорійних предикторів ВОЕ в логістичній регресії?
Коли корисна трансформація категорійних змінних ваги доказів (WOE)? Приклад можна побачити в трансформації WOE (Отже, для відповіді , і категоричного прогноктора з категоріями, і успіхів з випробувань в рамках ї категорії цього WOE для ї категорії визначається якyyykkkyjyjy_jnjnjn_jjjjjjj logyj∑kjyj∑kj(nj−yj)nj−yjlog⁡yj∑jkyj∑jk(nj−yj)nj−yj\log \frac{y_j} {\sum_j^k {y_j}} \frac{\sum_j^k (n_j-y_j)}{n_j-y_j} & перетворення складається з кодування кожної …

1
Чи можливий масштабний PCA?
Класичний аналіз основного компонента (PCA) - це зробити на матриці вхідних даних, стовпці якої мають нульове середнє значення (тоді PCA може "максимізувати дисперсію"). Цього можна легко досягти шляхом центрування стовпців. Однак, коли вхідна матриця буде рідкою, централізована матриця тепер буде більш рідкою, і - якщо матриця дуже велика - таким …

1
Очікуване значення як функція квантилів?
Мені було цікаво, де існує загальна формула, що стосується очікуваного значення безперервної випадкової величини як функції квантилів того ж rv Очікуване значення rv визначається як: E ( X ) = ∫ x d F X ( x ) і квантили визначаються як: Q p X = { x : F …

1
Чи потребує моделювання з випадковими лісами перехресне підтвердження?
Наскільки я бачив, думки щодо цього зазвичай відрізняються. Найкраща практика, безумовно, диктує використання перехресної перевірки (особливо якщо порівнювати радіочастотні сигнали з іншими алгоритмами на тому ж наборі даних). З іншого боку, першоджерело зазначає, що обчислюється похибка OOB під час навчання моделі є достатньою для показника продуктивності тестового набору. Навіть Тревор …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.