Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як я можу оцінити ймовірність того, що випадковий член з однієї сукупності буде «кращим», ніж випадковий член з іншої сукупності?
Припустимо, у мене є вибірки з двох різних груп. Якщо я виміряю, скільки часу потрібно кожному члену, щоб виконати завдання, я можу легко оцінити середнє значення та дисперсію кожного населення. Якщо я зараз припускаю гіпотезу про випадкове парування з однією людиною від кожної популяції, чи можу я оцінити ймовірність того, …

4
Як генерувати випадкові автоматичні корельовані дані двійкових часових рядів?
Як я можу генерувати двійкові часові ряди таким чином: Вказується середня ймовірність спостереження 1 (скажімо, 5%); Умовна ймовірність спостереження 1 за час задана величина при (скажімо 30%, якщо значення було 1)?tttt−1t−1t-1t−1t−1t-1

1
Як налаштувати та інтерпретувати контрасти ANOVA з автомобільним пакетом на R?
Скажімо, у мене простий експериментальний експеримент 2x2, над яким я хочу зробити ANOVA. Як ось це, наприклад: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); За відсутності значної взаємодії, за замовчуванням (тобто contr.treatment) вихід Anova()має …
15 r  anova  contrasts 

2
Площа під “pdf” при оцінці щільності ядра в R
Я намагаюся використовувати функцію ' щільності ' в R, щоб робити оцінки щільності ядра. У мене виникають труднощі з інтерпретацією результатів та порівнянням різних наборів даних, оскільки, здається, площа під кривою не обов'язково 1. Для будь-якої функції щільності ймовірностей (pdf) нам потрібно мати область . Я припускаю, що оцінка щільності …

2
Що таке "метод передачі повідомлень"?
У мене розпливчасте розуміння, що таке метод передачі повідомлення: алгоритм, який будує наближення до розподілу шляхом ітеративної побудови апроксимації кожного з факторів розподілу, обумовлених усіма наближеннями всіх інших факторів. Я вважаю, що обидва є прикладами змінної передачі повідомлень та розповсюдження очікування . Що таке алгоритм передачі повідомлень більш чітко / …

4
Як я можу покращити аналіз впливу репутації на голосування?
Нещодавно я провів аналіз впливу репутації на рекламних рефератах (див. Допис у блозі ), а згодом у мене виникло кілька питань щодо можливо більш просвічуючого (або більш підходящого) аналізу та графіки. Отож кілька запитань (і сміливо відповідайте на когось, зокрема, ігноруйте інших): У своєму втіленні я не мав на увазі …

5
Що може бути причиною використання перетворення квадратних коренів на даних?
Чи є якась причина того, що я можу придумати, щоб перетворити дані квадратним коренем? Я маю на увазі те, що я завжди спостерігаю, це те, що R ^ 2 збільшується. Але це, мабуть, лише через центрування даних! Будь-яка думка цінується!

1
Які плюси та мінуси навчання алгоритмічно (моделювання) розподілу порівняно з математично?
Які плюси та мінуси дізнатися про властивості розподілу алгоритмічно (за допомогою комп’ютерного моделювання) та математично? Здається, комп’ютерне моделювання може бути альтернативним методом навчання, особливо для тих нових студентів, які не відчувають сильного результату числення. Також здається, що моделювання кодування може запропонувати більш раннє та інтуїтивно зрозуміле поняття розподілу.

2
Кулбек-Лейблер розбіжність між двома розподілами гами
Вибираючи параметризацію розподілу гами Γ(b,c)Γ(b,c)\Gamma(b,c) за допомогою pdf g(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c)=1Γ(c)xc−1bce−x/bg(x;b,c) = \frac{1}{\Gamma(c)}\frac{x^{c-1}}{b^c}e^{-x/b} Розбіжність Куллбека-Лейблера міжΓ(bq,cq)Γ(bq,cq)\Gamma(b_q,c_q)іΓ(bp,cp)Γ(bp,cp)\Gamma(b_p,c_p)задається [1], як KLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−logbq−cq−logΓ(cq)+logΓ(cp)+cplogbp−(cp−1)(Ψ(cq)+logbq)+bqcqbpKLGa(bq,cq;bp,cp)=(cq−1)Ψ(cq)−log⁡bq−cq−log⁡Γ(cq)+log⁡Γ(cp)+cplog⁡bp−(cp−1)(Ψ(cq)+log⁡bq)+bqcqbp\begin{align} KL_{Ga}(b_q,c_q;b_p,c_p) &= (c_q-1)\Psi(c_q) - \log b_q - c_q - \log\Gamma(c_q) + \log\Gamma(c_p)\\ &\qquad+ c_p\log b_p - (c_p-1)(\Psi(c_q) + \log b_q) + \frac{b_qc_q}{b_p} \end{align} Я здогадуюсь, що -функція digamma. Ψ(x):=Γ′(x)/Γ(x)Ψ(x):=Γ′(x)/Γ(x)\Psi(x):= \Gamma'(x)/\Gamma(x) Це дано без …

1
Як працює нормалізація квантилів?
У дослідженнях експресії генів за допомогою мікроматеріалів дані про інтенсивність мають бути нормалізовані, щоб можна було порівнювати інтенсивність між індивідами, між генами. Концептуально та алгоритмічно, як працює «нормалізація кванті», і як би ви пояснили це нестатисту?

8
Як НЕ використовувати статистику
Це свого роду відкрите питання, але я хочу бути зрозумілим. З огляду на достатню кількість населення, можливо, ви зможете чомусь навчитися (це відкрита частина), але що б ви не дізналися про своє населення, коли це коли-небудь стосується члена населення? З того, що я розумію в статистиці, це ніколи не застосовується …

2
Які відмінності між "Моделюванням змішаних ефектів" та "Моделюванням латентного зростання"?
Я гідно знайомий із моделями зі змішаними ефектами (MEM), але нещодавно колега запитав мене, як вона порівнюється з моделями прихованого зростання (LGM). Я трохи погуглився, і, здається, LGM - це варіант моделювання структурних рівнянь, який застосовується до обставин, коли повторювані заходи отримуються в межах кожного рівня принаймні одного випадкового ефекту, …

1
Чи реалізує GSVD всі лінійні багатовимірні методи?
Я натрапив на статтю Ерве Абді про узагальнену СВД. Автор згадав: Узагальнений SVD (GSVD) розкладає прямокутну матрицю і враховує обмеження, накладені на рядки та стовпці матриці. GSVD дає зважену узагальнену оцінку найменшого квадрату даної матриці матрицею нижчого рангу, а тому, при адекватному виборі обмежень, GSVD реалізує всі лінійні багатоваріантні методи …

2
Як побудувати еліпс із власних значень та власних векторів у R? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Чи може хтось придумати R- код для побудови еліпса із власних значень та власних векторів наступної матриці А = ( 2.20,40,42.8)А=(2.20,40,42.8) \mathbf{A} …

3
Чи нормально використовувати відстань на Манхеттені з міжкластерним зв'язком Варда в ієрархічній кластеризації?
Я використовую ієрархічну кластеризацію для аналізу даних часових рядів. Мій код реалізований з використанням Mathematica функції DirectAgglomerate[...], яка генерує ієрархічні кластери отримують наступні входи: матриця відстані D назва методу, що використовується для визначення міжкластерної зв'язку. Я обчислив матрицю відстані D, використовуючи відстань на Манхеттені: г( х , у) = ∑i|хi- …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.