Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Корінна знахідка для стохастичної функції
Припустимо, у нас є функція f( х )f(х)f(x) яку ми можемо спостерігати лише через деякий шум. Ми не можемо обчислити f( х )f(х)f(x) безпосередньо, тільки f( x ) + ηf(х)+ηf(x) + \eta де - якийсь випадковий шум. (На практиці: я обчислюю використовуючи деякий метод Монте-Карло.)f ( x )ηη\etaf( х)f(х)f(x) Які …

2
Чи може статистичний тест повернути р-значення нуля?
Я маю на увазі не значення, близьке до нуля (округлене до нуля деяким статистичним програмним забезпеченням), а швидше значення буквально нуля. Якщо так, то чи означає це, що ймовірність отримання отриманих даних, припускаючи нульову гіпотезу, також дорівнює нулю? Що таке (деякі приклади) статистичних тестів, які можуть повернути результати такого роду? …

2
Інтерпретація порядкової логістичної регресії
Я провів цю порядкову логістичну регресію в R: mtcars_ordinal <- polr(as.factor(carb) ~ mpg, mtcars) Я отримав цей підсумок моделі: summary(mtcars_ordinal) Re-fitting to get Hessian Call: polr(formula = as.factor(carb) ~ mpg, data = mtcars) Coefficients: Value Std. Error t value mpg -0.2335 0.06855 -3.406 Intercepts: Value Std. Error t value 1|2 …

3
Чи є "тестова статистика" значенням або випадковою змінною?
Я зараз студент, який проходить свій перший курс статистики. Мене бентежить термін "тестова статистика". У наступному (я бачив це в деяких підручниках), здається, що це конкретне значення, обчислене з конкретної вибірки. t = ¯ x - μ 0ттtt = x¯¯¯- мк0с / н--√т=х¯-мк0с/н t=\frac{\overline{x} - \mu_0}{s / \sqrt{n}} Однак у …

9
Розрахунок індексу ранду
Я намагаюся розібратися, як обчислити індекс Rand алгоритму кластера, але я застряг у тому, як обчислити справжній і хибний негатив. На даний момент я використовую приклад із книги «Вступ до пошуку інформації» (Manning, Raghavan & Schütze, 2009). На сторінці 359 вони розповідають про те, як обчислити індекс Rand. У цьому …
17 clustering 

1
Чи відповідає значення R-квадрата для порівняння моделей?
Я намагаюся визначити найкращу модель для прогнозування цін на автомобілі, використовуючи ціни та можливості, доступні на сайтах рекламних оголошень для автомобілів. Для цього я використав пару моделей з бібліотеки scikit-learn та моделей нейронної мережі з пібраїну та нейролаб. Я використовував поки що підхід - це запустити фіксовану кількість даних через …

3
Статистичний тест для двох розподілів, де відомо лише 5-ти числовий підсумок
У мене є два розподіли, в яких відомі лише підсумок 5 чисел (мінімум, 1-й квартал, медіана, 3-й квартал, максимум) та розмір вибірки. Cntrary на питання тут , не всі точки даних доступні. Чи існує який-небудь непараметричний статистичний тест, який дозволяє мені перевірити, чи різняться їх основні розподіли? Спасибі!

2
Два негативних наслідки, але позитивний ефект взаємодії?
У мене є два основні ефекти, V1 і V2. Вплив V1 і V2 на змінні відповіді негативний. Однак я чомусь отримую позитивний коефіцієнт для терміна взаємодії V1 * V2. Як я можу це інтерпретувати? чи можлива така ситуація?

1
Чи залишаються автокорельовані залишкові візерунки навіть у моделях з відповідними структурами кореляції, і як вибрати найкращі моделі?
Контекст Це питання використовує R, але стосується загальних статистичних питань. Я аналізую вплив факторів смертності (% смертності від хвороб та паразитизму) на швидкість зростання популяції молі протягом часу, де популяції личинок відбирали з 12 місць раз на рік протягом 8 років. Дані про темпи приросту населення показують чітку, але нерегулярну …

2
Якісне кодування змінної в регресії призводить до "особливості"
У мене є незалежна змінна назва "якість"; ця змінна має 3 способи реагування (погана якість; середня якість; висока якість). Я хочу ввести цю незалежну змінну в свою багаторазову лінійну регресію. Коли у мене є двійкова незалежна змінна (фіктивна змінна, я можу кодувати 0/1 ), її легко ввести в модель множинної …

1
Що робить функція "ефекти" в R?
Я не розумію пояснення у Rфайлі довідки для ефектів () : Для лінійної моделі, оснащеної lmабо aov, ефекти - це некорельовані величини одиничної свободи, отримані проектуванням даних на послідовні ортогональні підпростори, що утворюються в результаті розкладання QR під час процесу підгонки. Хтось може пояснити, що це означає? Чи ортогональні підпростори …
17 r  regression 

2
Як встановити дискретний розподіл для підрахунку даних?
У мене є наступна гістограма даних про підрахунок. І я хотів би пристосувати до нього дискретний розподіл. Я не впевнений, як мені це робити. Чи слід спочатку накласти на гістограму дискретний розподіл, скажімо, негативний біноміальний розподіл, щоб я отримав параметри дискретного розподілу, а потім запустив тест Колмогорова – Смірнова для …

1
Які ефективні алгоритми для обчислення сингулярного розкладання значення (SVD)?
У статті Вікіпедії про аналіз основних компонентів йдеться про це Існують ефективні алгоритми для обчислення SVD без необхідності формування матриці , тому обчислення SVD тепер є стандартним способом обчислення аналізу основних компонентів з матриці даних, якщо не потрібно лише декілька компонентів.XXXXTXXTXX^TX Може хтось скаже мені, про які ефективні алгоритми йдеться …
17 pca  algorithms  svd  numerics 

1
Питання щодо принципу ймовірності
В даний час я намагаюся зрозуміти Принцип ймовірності, і я, відверто кажучи, не розумію цього. Отже, я запишу все своє запитання як список, навіть якщо це можуть бути досить основними питаннями. Що саме означає фраза "вся інформація" в контексті цього принципу? (як і вся інформація у вибірці міститься у функції …

3
Аналогія співвідношення Пірсона для 3 змінних
Мене цікавить, чи є "співвідношення" трьох змінних чи ні, і якщо що, що це буде? Коефіцієнт кореляції моменту Пірсона E{(X−μX)(Y−μY)}Var(X)Var(Y)−−−−−−−−−−−−√E{(X−μX)(Y−μY)}Var(X)Var(Y)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)\}}{\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)}} Тепер питання для 3 змінних: Є E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)−−−−−−−−−−−−−−−−−−√E{(X−μX)(Y−μY)(Z−μZ)}Var(X)Var(Y)Var(Z)\frac{\mathrm{E}\{(X-\mu_X)(Y-\mu_Y)(Z-\mu_Z)\}} {\sqrt{\mathrm{Var}(X)\mathrm{Var}(Y)\mathrm{Var}(Z)}} що-небудь? У R це здається чимось тлумачним: > a <- rnorm(100); b <- rnorm(100); c <- rnorm(100) > mean((a-mean(a)) * (b-mean(b)) * …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.