Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Коли використовувати (не) параметричний тест припущення про гомоседастичність?
Якщо випробовуєте припущення про гомоскедастичність, параметричні (тест Бартлетта на однорідність варіантів bartlett.test) та непараметричні (тест Фігнера-Кіллена на однорідність варіантів fligner.test) доступні. Як сказати, який вид використовувати? Чи повинно це залежати, наприклад, від нормальності даних?

4
Кількісне визначення QQ сюжету
Діаграма qq може бути використана для візуалізації того, наскільки схожі два розподіли (наприклад, візуалізація подібності дистрибутива до нормального розподілу, а також для порівняння двох розподілів артеріальних даних). Чи є які-небудь статистичні дані, які генерують більш об'єктивну, числову міру, яка представляє їх схожість (бажано, у нормалізованій (0 <= x <= 1) …


4
Асимптотичний розподіл багаточлени
Я шукаю обмежувальний розподіл мультиноміального розподілу над d результатами. IE, розподіл наступного limn→∞n−12Xnlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} Де XnXn\mathbf{X_n} - випадкова величина векторного значення з щільністю fn(x)fn(x)f_n(\mathbf{x}) для xx\mathbf{x} така що ∑ixi=n∑ixi=n\sum_i x_i=n , xi∈Z,xi≥0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0 і 0 для всіх інших xx\mathbf{x} , де fn(x)=n!∏i=1dpxiixi!fn(x)=n!∏i=1dpixixi!f_{n}(\mathbf{x})=n!\prod_{i=1}^d\frac{p_i^{x_i}}{x_i!} Я знайшов одну форму …

2
Поздовжнє порівняння двох розподілів
У мене є результати аналізу крові, проведеного 2500 людям чотири рази з шестимісячним інтервалом. Результати в основному складаються з двох заходів імунної відповіді - одного за наявності певних антигенів туберкульозу, а одного за відсутності. В даний час кожен тест оцінює як позитивний, так і негативний, виходячи з різниці між реакцією …

2
Пропускна здатність ядра при оцінці щільності ядра
Я роблю деяку оцінку щільності ядра з встановленою зваженою точкою (тобто, кожен зразок має вагу, яка не є необхідною), у N розмірах. Крім того, ці зразки знаходяться просто в метричному просторі (тобто ми можемо визначити відстань між ними), але нічого іншого. Наприклад, ми не можемо визначити середнє значення зразків балів, …

4
Як шукати долини в графі?
Я вивчаю деякі дані геномного покриття, які в основному є довгим списком (кілька мільйонів значень) цілих чисел, кожне говорить про те, наскільки добре (або "глибоко") ця позиція в геномі охоплена. Я хотів би шукати "долини" в цих даних, тобто регіони, які значно "нижчі", ніж їх навколишнє середовище. Зауважте, що розмір …


11
Революції в статистиці за останні 50 років? [зачинено]
Наразі це запитання не підходить для нашого формату запитань. Ми очікуємо, що відповіді будуть підкріплені фактами, посиланнями або експертними знаннями, але це питання, ймовірно, вимагатиме дискусій, аргументів, опитувань чи розширеної дискусії. Якщо ви вважаєте, що це питання можна вдосконалити та, можливо, знову відкрити, відвідайте довідковий центр для ознайомлення . Закрито …
10 history 

1
Який тип остаточних аналізів ви використовуєте?
Виконуючи множинні лінійні регресії OLS, замість того, щоб будувати залишки проти встановлених значень, я будую (внутрішні) досліджені залишки проти встановлених значень (ditto для коваріатів). Ці залишки визначаються як: e∗i=eis2(1−hii)−−−−−−−−−√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} де - залишковий, а - діагональні елементи матриці капелюхів. Щоб отримати ці студизовані залишки в R, …


2
Чи можна безпосередньо читати стовпці CSV як категоричні дані?
Мені потрібно проаналізувати з R дані з медичного обстеження (зі 100+ кодованими стовпцями), що надходять у CSV. Я використаю брязкальця для початкового аналізу, але за кадром все-таки R. Якщо я читаю файл.csv () , то стовпці з числовими кодами розглядаються як числові дані. Я знаю, що міг би створити з …

1
Оцінка мінливості в часі
У мене є набір даних, який містить ~ 7500 аналізів крові від ~ 2500 людей. Я намагаюся з’ясувати, чи збільшується або зменшується мінливість в аналізі крові з часом між двома тестами. Наприклад - я беру кров для базової проби, а потім негайно беру другий зразок. Через півроку малюю ще один …

5
Які інші нормалізуючі перетворення зазвичай використовуються поза загальними, як квадратний корінь, журнал тощо?
При аналізі тестових балів (наприклад, у галузі освіти або психології) загальні методи аналізу часто передбачають нормальне поширення даних. Однак, можливо, частіше за все бали, як правило, дико відхиляються від нормальних. Мені знайомі деякі основні нормалізуючі перетворення, як-от: квадратні корені, логарифми, зворотні перетворення для зменшення позитивного перекосу, відображені версії вищезгаданого для …

2
Отримання та інтерпретація завантажених довірчих інтервалів з ієрархічних даних
Мені цікаво отримати довірчий інтервал дозволу на величину X, коли ця кількість вимірюється 10 разів у кожної з 10 особин. Один із підходів полягає в тому, щоб отримати середнє значення на особу, після чого завантажте засоби (наприклад, перекомпонуйте засоби із заміною). Інший підхід полягає в тому, щоб зробити наступне для …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.