Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

5
Імпутація пакетів KNN R
Я шукаю пакет імпутації KNN. Я дивився на пакет імпутації ( http://cran.r-project.org/web/packages/imputation/imputation.pdf ), але чомусь функція імпутації KNN (навіть якщо наслідувати приклад із опису) лише здається присвоїти нульові значення (як зазначено нижче). Я озирався, але ще не можу щось знайти, і тому цікавився, чи є у когось інші пропозиції щодо …


3
Стандартна помилка медіани
Чи правильна наступна формула, якщо я хочу виміряти стандартну помилку медіани у випадку невеликої вибірки з ненормальним розподілом (я використовую python)? sigma=np.std(data) n=len(data) sigma_median=1.253*sigma/np.sqrt(n)

2
Чому дорівнює нулю ймовірності для будь-якого заданого значення нормального розподілу?
Я помітив, що в нормальному розподілі ймовірність дорівнює нулю, тоді як для розподілу Пуассона він не дорівнює нулю, коли c - негативне ціле число.P(x=c)P(x=c)P(x=c)ccc Моє запитання: чи вірогідна будь-яка константа в нормальному розподілі рівна нулю, оскільки вона представляє площу під будь-якою кривою? Або це лише лише правило запам’ятовування?

1
Confounder - визначення
Як стверджує М. Кац у своїй книзі « Багатовимірний аналіз» (Розділ 1.2, сторінка 6), « Конфідент асоціюється з фактором ризику і причинно пов’язаний з результатом. » Чому учасник повинен бути причинно пов'язаний з результатом? Чи буде достатньо для того, щоб доповідач був пов'язаний з результатом?

4
Тест Брента в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 7 місяців тому . Під час перевірки припущення паралельної регресії в порядковій логістичній регресії я вважаю, що існує кілька підходів. Я використав як графічний підхід (як …

3
Чому ми використовуємо k-засоби замість інших алгоритмів?
Я досліджував k-засоби, і ось що я отримав: k-засоби - це один із найпростіших алгоритмів, який використовує метод непідконтрольного навчання для вирішення відомих проблем кластеризації. Він працює дуже добре з великими наборами даних. Однак є і недоліки K-засобів, які є: Сильна чутливість до залишків і шуму Не добре працює з …

3
Оцінка
У мене є теоретична економічна модель, яка полягає в наступному, y=a+b1x1+b2x2+b3x3+uy=a+b1x1+b2x2+b3x3+u y = a + b_1x_1 + b_2x_2 + b_3x_3 + u Так теорія говорить, що для оцінки y є x1x1x_1 , x2x2x_2 і x3x3x_3 коефіцієнти .yyy Тепер у мене є реальні дані, і мені потрібно оцінити b1b1b_1 , b2b2b_2 …


1
Яка об'єктивна оцінка R-квадрата населення?
Мені цікаво отримати об'єктивну оцінку R2R2R^2 при множинній лінійній регресії. Розмірковуючи, я можу придумати два різних значення, що є неупередженою оцінкою R2R2R^2 може бути яка намагається відповідати. З вибірки R2R2R^2 : r-квадрат, який був би отриманий, якщо рівняння регресії отримано з вибірки (тобто,β^β^\hat{\beta} ), застосовувалося до нескінченного обсягу даних, що …

6
Час, проведений у діяльності як незалежна змінна
Я хочу включити час, витрачений на щось (наприклад, тиждень грудного вигодовування) як незалежну змінну у лінійну модель. Однак деякі спостереження взагалі не зачіпають поведінку. Кодування їх як 0 не дуже правильне, тому що 0 якісно відрізняється від будь-якого значення> 0 (тобто жінки, які не годують грудьми, можуть сильно відрізнятися від …


1
Як знайти залишки та побудувати їх
Мені дали дані x = c(21,34,6,47,10,49,23,32,12,16,29,49,28,8,57,9,31,10,21,26,31,52,21,8,18,5,18,26,27,26,32,2,59,58,19,14,16,9,23,28,34,70,69,54,39,9,21,54,26) y = c(47,76,33,78,62,78,33,64,83,67,61,85,46,53,55,71,59,41,82,56,39,89,31,43,29,55, 81,82,82,85,59,74,80,88,29,58,71,60,86,91,72,89,80,84,54,71,75,84,79) Як я можу отримати залишки та побудувати їх на основі ? І як я можу перевірити, чи виявляються залишки приблизно нормальними?xxx Я не впевнений, чи правильно виконати оригінальну лінійну підгонку, оскільки отримав рівняння але конспект лекції говорить, що лінія лінійної …
14 r  regression 

1
Коефіцієнти регресії хребта, що перевищують коефіцієнти OLS або змінюють знак залежно від
Як виконується регресія хребта, як ви інтерпретуєте коефіцієнти, які в кінцевому підсумку перевищують їх відповідні коефіцієнти під мінімальними квадратами (для певних значень )? Чи не повинна регресія хребта монотонно зменшувати коефіцієнти?λλ\lambda Як пов'язано з приміткою, як можна інтерпретувати коефіцієнт, знак якого змінюється під час регресії хребта (тобто траєкторія хребта перетинає …

2
Продуктивність моделі в квантильному моделюванні
Я використовую квантильну регресію (наприклад, через gbmабо quantregв R) - не зосереджуючись на медіані, а на верхньому квантилі (наприклад, 75-й). Виходячи з фону прогнозного моделювання, я хочу оцінити, наскільки модель добре вписується в тестовий набір, і я можу описати це діловому користувачеві. Моє питання - як? У типових умовах із …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.