Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Два способи тесту на значимість завантажувальної програми
Використовуючи завантажувальний інструмент, я обчислюю p значення значень тестів за допомогою двох методів: перекомпонування під нульовою гіпотезою та підрахунок результатів принаймні настільки ж крайній, як і результат, отриманий з оригінальних даних перекомпонування за альтернативною гіпотезою та підрахунок результатів принаймні таким самим віддаленим від початкового результату, як значення, що відповідає нульовій …

4
Інтернет-ресурси для філософії причинного зв'язку для причинного умовиводу
Чи можете ви порекомендувати будь-які книги, статті, есе, онлайн-підручники / курси тощо, які були б цікавими та корисними для епідеміолога / біостатиста, щоб дізнатись про філософію причинно-наслідкового зв'язку? Я знаю небагато про те, як насправді робити причинно-наслідковий висновок із системи епі та біостатів, але я хотів би дізнатися щось про …

2
Як моделювати ефекти місяця в місяць у щоденних даних часових рядів?
У мене є два часові ряди щоденних даних. Один є, sign-upsа другий terminationsпередплати. Я хотів би передбачити останнє, використовуючи інформацію, що міститься в обох змінних. Переглядаючи графік цих рядів, очевидно, що закінчення співвідносяться з кратними реєстраціями місяцями раніше. Тобто, сплеск підписок 10 травня призведе до збільшення термінів припинення в 10 …

3
Доведення зв'язку між ступенем небезпеки, щільністю ймовірності, функцією виживання
Я читаю трохи аналізів виживання, і більшість підручників стверджують, що h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)=limΔt→0P(t&lt;T≤t+Δt|T≥t)Δt=f(t)1−F(t)(1)h(t)= \lim_{ \Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t |T \geq t )}{ \Delta t} =\frac{f(t)}{1-F(t)} (1) де h(t)h(t)h(t) - рівень небезпеки, f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=limΔt→0P(t&lt;T≤t+Δt)Δt(2)f(t)=\lim_{\Delta t \rightarrow 0} \frac{P(t < T \leq t+\Delta t)}{ \Delta t}(2) функція щільності, F(t)=Pr(T&lt;t)(3)F(t)=Pr(T&lt;t)(3)F(t)=Pr(Tt)=1-F(t) …
11 survival 


3
PCA, ICA та лаплакійські власні карти
Питання Мене дуже цікавить метод Лаплаціанських власних карт. В даний час я використовую його для зменшення розмірів на моїх наборах медичних даних. Однак я зіткнувся з проблемою за допомогою методу. Наприклад, у мене є деякі дані (спектральні сигнали), і я можу використовувати PCA (або ICA), щоб отримати деякі ПК (або …
11 pca  ica 

4
Як ви знаходите причинно-наслідкові зв’язки в даних?
Скажімо, у мене є таблиця зі стовпцями "А", "В" Чи є статистичний метод, щоб визначити, чи "A" спричиняє "B"? Не можна реально використовувати R Pearson, оскільки: він лише перевіряє співвідношення значень кореляція не є причиною P Пірсона може співвідносити лише лінійні відносини То які ще варіанти я маю тут?

3
Створення автокорельованих випадкових значень у R
Ми намагаємося створити автоматичні корельовані випадкові значення, які будуть використовуватися як часові сесії. У нас немає існуючих даних, на які ми посилаємось, і просто хочемо створити вектор з нуля. З одного боку, нам, звичайно, потрібен випадковий процес з розподілом та його SD. З іншого боку, має бути описана автокореляція, що …

1
Тест Фішера в R
Припустимо, у нас є такий набір даних: Men Women Dieting 10 30 Non-dieting 5 60 Якщо я проведу точний тест Фішера в R, то що означає alternative = greater(або менше)? Наприклад: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") Я отримую p-value = 0.01588і odds ratio = 3.943534. Крім того, коли я …

2
Випадковий ліс за згрупованими даними
Я використовую випадковий ліс на високомірних згрупованих даних (50 числових вхідних змінних), які мають ієрахічну структуру. Дані були зібрані з 6-ти реплікацій на 30 позиціях 70 різних об'єктів, що призводить до 12600 точок даних, які не є незалежними. Здається, випадковий ліс надмірно підходить для даних, оскільки помилка oob набагато менша, …


5
Як порівняти 2 нестаціонарні часові ряди, щоб визначити кореляцію?
У мене є дві серії даних, які відображають середній вік при смерті з часом. Обидві серії демонструють збільшення віку при смерті з часом, але одна значно нижча за іншу. Я хочу визначити, чи значно збільшується вік при смерті нижньої проби, ніж у верхньої вибірки. Ось дані , упорядковані за роками …

4
Що робити пояснень у часових рядах?
Працюючи в основному з даними поперечного перерізу і зовсім недавно переглядаючи, скануючи спотикання через купу вступної літератури часових рядів, мені цікаво, яку роль відіграють пояснювальні змінні в аналізі часових рядів. Я б хотів пояснити тенденцію, а не дерендувати. Більшість того, що я читаю як вступ, передбачає, що серія випливає з …

6
Як зменшити кількість точок даних у серії?
Я не вивчав статистику більше 10 років (а потім просто основний курс), тому, можливо, моє питання трохи важко зрозуміти. У будь-якому випадку, я хочу зробити це зменшити кількість точок даних у серії. Вісь x - це кількість мілісекунд від початку вимірювання, а вісь y - це показник для цієї точки. …

1
Як автоматично кластеризувати U-матрицю?
Вивчивши карту самоорганізації, можна обчислити U-матрицю . Існують деякі інструменти для візуалізації вручну та визначення кластерів, але мені цікаво, чи існує якийсь алгоритм, щоб цей процес здійснювався автоматичним способом (тобто, не маючи людину дивитись на рисунок, щоб ідентифікувати кластери). Чи можна це зробити? Я пишу свій код в Р. Я …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.