Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Статистична освіта дітей у різних країнах?
Мені цікаво дізнатися, на якому рівні статистики діти навчаються в різних країнах світу. Чи можете ви запропонувати запропонувати дані / посилання, які проливають світло на те, що відбувається у зв'язку з цим? Почну. Ізраїль: Студенти, які більше або менше вивчають математику, - середня, sd, гістограма, нормальний розподіл, дуже основна ймовірність.
10 dataset  teaching 

1
Як боротися з опущеними фіктивними змінними у моделі з фіксованим ефектом?
Я використовую модель фіксованого ефекту для своїх даних на панелі (9 років, 1000+ одиниць), оскільки мій тест Хаусмана вказує на значення . Коли я додаю фіктивні змінні для галузей, до яких входять мої фірми, вони завжди опускаються. Я знаю, що велика різниця стосується DV (індекс розкриття) серед різних галузевих груп. …

1
Чи має сенс тест на значимість для порівняння рандомізованих груп за базовою лінією?
Багато робіт з рандомізованим контрольованим випробуванням (RCT) повідомляють про тестування значущості за базовими параметрами безпосередньо після / до рандомізації, щоб показати, що групи дійсно схожі. Це часто є частиною таблиці "характеристики базової лінії". Однак тести на значимість вимірюють ймовірність отримання спостережуваної (або сильнішої) різниці випадково, чи не так? І якщо …

4
Анімація ефекту зміни ширини ядра в R
У мене є деякі дані в R, які зберігаються в списку. Подумайте d <- c(1,2,3,4) хоча це не мої дані. Якщо я тоді ввійду в команду plot(density(d, kernel="gaussian", width=1)) то я отримую оцінку щільності ймовірності ядра, де ядро ​​є нормальним. Якщо я заміню 1 на інші цифри, звичайно картинка змінюється. …

1
Коефіцієнт внутрішньокласової кореляції та F-тест (одностороння ANOVA)?
Я трохи розгублений щодо коефіцієнта внутрішньокласової кореляції та однобічної ANOVA. Як я розумію, обидва кажуть вам, наскільки схожі спостереження в межах групи, відносно спостережень в інших групах. Чи може хтось пояснити це трохи краще і, можливо, пояснити ситуацію, в якій кожен метод є більш вигідним?

1
Чи можливо аналітично інтегрувати
По-перше, маючи на увазі, аналітично інтегруючи, чи існує правило інтеграції для вирішення цього питання, на відміну від чисельних аналізів (таких як трапецієподібний, Гаус-Легендрський або Сімпсонський)? У мене є функція f(x)=xg(x;μ,σ)f(x)=xg(x;μ,σ)\newcommand{\rd}{\mathrm{d}}f(x) = x g(x; \mu, \sigma) де g(x;μ,σ)=1σx2π−−√e−12σ2(log(x)−μ)2g(x;μ,σ)=1σx2πe−12σ2(log⁡(x)−μ)2 g(x; \mu, \sigma) = \frac{1}{\sigma x \sqrt{2\pi}} e^{-\frac{1}{2\sigma^2}(\log(x) - \mu)^2} - функція густини …

1
Значення коефіцієнтів регресії (GAM), коли вірогідність моделі не суттєво перевищує нульову
Я використовую регрес на основі GAM, використовуючи gamlss пакет R та припускаючи, що бета-завищений бета-розподіл даних. У мене є тільки один пояснює змінної в моїй моделі, так це в основному: mymodel = gamlss(response ~ input, family=BEZI). Алгоритм дає мені коефіцієнт для впливу пояснювальної змінної на середнє значення ( ) та …

5
Чи є логістична регресія упередженою, коли змінна результат розбивається на 5% - 95%?
Я будую модель схильності, використовуючи логістичну регресію для утилітного клієнта. Мене хвилює те, що із загальної вибірки моїх «поганих» рахунків лише 5%, а решта - всі хороші. Я передбачу «поганий». Чи буде результат упередженим? Що є оптимальним "погана до хорошої пропорції", щоб створити хорошу модель?

4
Який тест для порівняння складу громади?
Сподіваюся, що це питання для новачків - це правильне питання для цього веб-сайту: Припустимо, я хотів би порівняти склад екологічних спільнот на двох ділянках A, B. Я знаю, що на всіх трьох ділянках є собаки, коти, корови та птахи, тому я вибираю їх чисельність на кожній ділянці (у мене справді …

8
Графічна енциклопедія
Мені потрібно створити багатокористувацький веб-додаток, який стосується вимірювань трафіку, прогнозів тощо. На даний момент я знаю, що я буду використовувати смуги та пиріжки. На жаль, ці типи діаграм не багаті на вираження всіх даних, які я збираю та обчислюю. Я шукаю колекцію графічних діаграм. Це дуже нормально, якщо мені доведеться …

4
Велика картина щодо аналізу виживання та аналізу даних про життя
Я чув про аналіз виживання та аналіз даних про життя, але не дуже розумію. Мені було цікаво, які теми вони висвітлюють? Це чиста статистика, або просто застосування статистики в якійсь конкретній області? Чи є аналіз дати життя частиною аналізу виживання? Дякую та з повагою!

3
Як відобразити матрицю кореляцій із відсутніми записами?
Я хотів би отримати графічне зображення співвідношень у зібраних нами статтях, щоб легко вивчити зв’язки між змінними. Раніше я малював (безладний) графік, але зараз у мене занадто багато даних. В основному, у мене є таблиця з: [0]: назва змінної 1 [1]: назва змінної 2 [2]: значення кореляції "Загальна" матриця неповна …

1
Поради щодо визначення форми кривої за допомогою Quantreg
Я використовую пакунок Quantreg, щоб зробити модель регресії, використовуючи 99-й перцентиль моїх значень у наборі даних. На основі порад з попереднього запитання про stackoverflow, який я задав, я використав таку структуру коду. mod <- rq(y ~ log(x), data=df, tau=.99) pDF <- data.frame(x = seq(1,10000, length=1000) ) pDF <- within(pDF, y …

3
Тестування гіпотез на безперервно завищених нульових даних
Я дуже вдячний за вашу пораду щодо наступної проблеми: У мене є великий безперервний набір даних з безліччю нулів (~ 95%), і мені потрібно знайти найкращий спосіб перевірити, чи є певні підмножини його "цікавими", тобто, здається, не виведені з того ж розподілу, що і решта. Нульова інфляція походить від того, …

2
Паралелізація пакету кареток за допомогою doSMP
ОНОВЛЕННЯ: тепер caret використовується foreachвнутрішньо, тому це питання вже не є актуальним. Якщо ви можете зареєструвати робочий паралельний бекенд для foreach, caret буде використовувати його. У мене є пакет caret для R, і мені цікаво використовувати trainфункцію для перехресної перевірки моїх моделей. Однак я хочу прискорити роботу, і, здається, каре …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.