Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Які залишки та відстань Кука використовуються для GLM?
Хтось знає, яка формула відстані Кука? Оригінальна формула відстані Кука використовує студизовані залишки, але чому R використовує std. Залишки Пірсона при обчисленні графіку відстані Кука для ГЛМ. Я знаю, що студизовані залишки не визначені для ГММ, але як виглядає формула для обчислення відстані Кука? Припустимо наступний приклад: numberofdrugs <- rcauchy(84, …

2
Пошук індексу стовпця за його назвою в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 6 років тому . У кадрі даних я хотів би отримати індекс стовпця за назвою. Наприклад: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) Я хочу знати індекс стовпців для "bar". …
11 r 

1
Які графічні методи корисні для візуалізації того, як сукупності невизначеностей складаються?
У мене є набір систем, де в ньому накопичуються невизначеності. Вони не завжди є суто добавками - іноді вони є, іноді - ні. Я мав певний успіх у використанні фан-діаграм, смугових діаграм з інтервалами довіри та графіків вікон для передачі окремих елементів. Але як я можу показати, як накопичуються та …

1
Як зупинити excel у зміні діапазону, коли ви перетягуєте формулу вниз? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 7 років тому . Я намагаюся нормалізувати набір стовпців даних у таблиці Excel. Мені потрібно отримати значення, щоб найвище значення в стовпці було = 1, а …
11 excel 

1
Моделювання серії ARIMA (1,1,0)
Я встановив моделі ARIMA до оригінальних часових рядів, а найкраща модель - ARIMA (1,1,0). Тепер я хочу імітувати серію з цієї моделі. Я написав просту модель AR (1), але не зміг зрозуміти, як відрегулювати різницю в моделі ARI (1,1,0). Наступний код R для серії AR (1): phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) …
11 r  time-series  arima 

2
Варіант двох зважених випадкових величин
Дозволяє: Стандартне відхилення випадкової величиниA=σ1=5A=σ1=5A =\sigma_{1}=5 Стандартне відхилення випадкової величиниB=σ2=4B=σ2=4B=\sigma_{2}=4 Тоді дисперсія A + B дорівнює: Va r ( ш1A + w2Б ) = ш21σ21+ ш22σ22+ 2 мас1ш2p1 , 2σ1σ2Vаr(ш1А+ш2Б)=ш12σ12+ш22σ22+2ш1ш2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} Де: p1 , 2p1,2p_{1,2} - кореляція між двома випадковими змінними. ш1ш1w_{1} - вага випадкової величини A ш2ш2w_{2} - …

4
Як ви протестуєте реалізацію k-засобів?
Відмова: Я опублікував це питання на Stackoverflow, але я подумав, що, можливо, це краще підходить для цієї платформи. Як ви протестуєте власну реалізацію k-засобів для багатовимірних наборів даних? Я думав запустити вже наявну реалізацію (тобто Matlab) на даних і порівняти результати з моїм алгоритмом. Але для цього потрібно, щоб обидва …

1
Навіщо використовувати розширення Корніш-Фішера замість зразка квантиля?
Розширення Корніш-Фішера дає спосіб оцінити кванти розподілу на основі моментів. (У цьому сенсі я розглядаю це як доповнення до розширення Edgeworth , яке дає оцінку кумулятивного розподілу на основі моментів.) Я хотів би знати, в яких ситуаціях ви б віддали перевагу розширенню Корніша-Фішера для емпіричної роботи над квантовий зразок, або …

4
Як виконати t-тест з величезними зразками?
У мене дві популяції, одна з N = 38,704 (кількість спостережень) та інша з N = 1,313,662. Ці набори даних мають ~ 25 змінних, всі безперервні. Я взяв середнє значення кожного з кожного набору даних і обчислював тестову статистику за формулою t = середня різниця / STD помилка Проблема полягає …
11 t-test 

2
Розрахунок індексів сезонності для складної сезонності
Я хочу прогнозувати товари роздрібної торгівлі (за тиждень) за допомогою експоненціального згладжування. Зараз я застряг у тому, як обчислювати, зберігати та застосовувати індекси сезональності. Проблема полягає в тому, що всі знайдені нами приклади стосуються якоїсь простої сезонності. У моєму випадку у мене є такі проблеми: 1. Пори року не відбуваються …

2
М'яке порогове порівняно проти лассо пеналізації
Я намагаюсь узагальнити те, що я зрозумів до цього часу в пеналізованому багатоваріантному аналізі з великомірними наборами даних, і я все ще намагаюся отримати правильне визначення м'якої порогової оцінки проти Лассо (або ) пеналізації.L1L1L_1 Точніше, я використовував розріджену регресію PLS для аналізу 2-блокної структури даних, включаючи геномні дані ( одномолекулярні …

5
Які способи показати два аналітичні методи рівнозначні?
У мене є два різні аналітичні методи, які дозволяють вимірювати концентрацію певної молекули в матриці (наприклад, вимірювати кількість солі у воді) Два способи різні, і в кожного є своя помилка. Які існують способи показати два методи, рівнозначні (чи ні). Я думаю, що побудувати графік результатів з ряду вибірок, виміряних обома …

3
Як визначається
Скажіть, що - неперервна випадкова величина, а - дискретна. YYYXXXPr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} Як ми знаємо, оскільки - неперервна випадкова величина. І виходячи з цього, я маю намір зробити висновок, що ймовірність не визначена.Pr(Y=y)=0Pr(Y=y)=0\Pr(Y=y) = 0YYYPr(X=x|Y=y)Pr(X=x|Y=y)\Pr(X=x|Y=y) Однак Вікіпедія стверджує, що насправді це визначено так: Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y)Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y) \Pr(X=x|Y=y) = \frac{\Pr(X=x) f_{Y|X=x}(y)}{f_Y(y)} Питання: …

1
Наскільки різні кубічні сплайни та обмежені сплайни?
Я багато читаю про використання сплайнів при різних проблемах регресії. Деякі книги (наприклад, Ходжес, рясно параметрізовані лінійні моделі ) рекомендують пенізовані сплайни. Інші (наприклад, регресійні стратегії моделювання регресії ) вибирають обмежені кубічні сплайни. Наскільки вони відрізняються на практиці? Чи часто ви отримуєте істотно різні результати від використання того чи іншого? …

1
До чого відноситься термін "рідкісний попередній" (папір FBProphet)?
Читаючи статтю "Прогнозування на масштабі" (інструмент прогнозування FBProphet, див. Https://peerj.com/preprints/3190.pdf ), я натрапив на термін "рідкий попередній". Автори пояснюють, що вони використовували такий "рідкий попередній" при моделюванні вектора відхилень швидкостіδδ\mathbf{\delta} від деякої скалярної швидкості ккk, який є параметром моделі в логістичній моделі зростання. Як вони констатують це δj∼ Лаплас ( …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.