Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Найкращі практики при обробці даних діапазону як безперервних
Я дивлюся, чи достаток пов’язаний із розмірами. Розмір (звичайно) безперервний, проте достаток записується в такій масштабі A = 0-10 B = 11-25 C = 26-50 D = 51-100 E = 101-250 F = 251-500 G = 501-1000 H = 1001-2500 I = 2501-5000 J = 5001-10,000 etc... А через Q …

1
Коефіцієнт вірогідності журналу при узагальненні документів
Я спочатку запитав це про переповнення стека і був спрямований на цей сайт, тож ось: Я впроваджую кілька непідконтрольних методів підбору вмісту / вибору вмісту / вилучення вмісту документів, і я збентежений тим, що мій підручник називає "коефіцієнт вірогідності журналу". Книга " Обробка мови та мови " Юрафського та Мартіна …

4
Дані про масштабування, які є різними порядками для побудови графіків
Переглядаючи такий набір даних: Date Visits Carts carts Orders Created converted Created 2011-11-11 12277 161 9 36 2011-11-12 11871 93 5 19 2011-11-13 13072 107 8 8 2011-11-14 13594 112 4 34 2011-11-15 12741 129 8 43 2011-11-16 15491 261 16 57 2011-11-17 13418 186 17 42 Мене попросили побудувати …

2
Перехресне підтвердження для змішаних моделей?
Ми з колегою підходимо до ряду лінійних та нелінійних моделей змішаного ефекту в Р. Нас просять провести перехресну валідацію на пристосованих моделях, щоб можна було перевірити, що спостережувані ефекти відносно узагальнюючі. Зазвичай це тривіальне завдання, але в нашому випадку ми повинні розділити цілі дані на навчальну частину та тестову частину …

3
Проблема з оцінкою при відстеженні GPS
Проблема: Розгляньте два автомобілі (прийняті точковими об’єктами), названі лідером та послідовником , обидва оснащені GPS-пристроями, які спілкуються між собою. Завдання полягає в тому, щоб слідкувати за якомога ближче, оскільки останній довільно рухається по площині. Зважаючи на те, що всі пристрої GPS мають розподіл помилок (CEP) з можливістю кругової помилки ( …

2
Найсучасніший метод (и) для пошуку нульових середніх частин часового ряду
У мене є шумні часові ряди, які мені потрібно сегментувати на ті ділянки з нульовою середньою, а ті ділянки без нульового середнього. Важливо знайти межі якомога точніше (чітко, де межа точно лежить, трохи суб'єктивно). Я думаю, що варіант кузуму може бути пристосований для цього, але оскільки в основному йдеться про …

1
PACF ручний розрахунок
Я намагаюся повторити обчислення, які SAS і SPSS роблять для часткової функції автокореляції (PACF). У SAS він виробляється через Proc Arima. Значення PACF - це коефіцієнти авторегресії ряду, що становить інтерес, на відсталі значення ряду. Моя змінна інтерес - це продажі, тому я обчислюю lag1, lag2 ... lag12, і я …

4
Знайдіть інтервали щільності ймовірності
У мене є вектор x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (мій фактичний вектор має довжину> 10 000), і я хотів би знайти інтервали, де лежить 90% щільності. Є quantile(x, probs=c(0.05,0.95), type=5)найбільш підходящим чи є якийсь інший спосіб?
9 r 


1
Обчислення надійності між рейтингами в R із змінною кількістю оцінок?
Вікіпедія припускає, що одним із способів розглянути надійність між рейтингами є використання моделі випадкових ефектів для обчислення кореляції внутрішньокласового рівня . Приклад внутрішньокласової кореляції говорить про перегляд σ2ασ2α+σ2ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} від моделі Yij=μ+αi+ϵijYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} "де Y ij - j- е спостереження в i- й групі, μ - …

2
Які навички даних та статистики зараз користуються великим попитом та де вони користуються великим попитом?
Ця публікація стосується події, що швидко змінюється. У мене робота з аналізу даних у галузі фінансів. Моя нинішня робота така, що я не маю особливого впливу на те, що відбувається в решті моєї галузі чи інших галузях. Я маю неабияку кількість знань про байєсівську статистику. Я хотів би тримати себе …
9 careers 

1
Штрихові лінії на ділянці ACF в R
Я переглядаю книгу "Вступний часовий ряд з R" від Cowpertwait і Metcalfe. На сторінці 36 написано, що рядки розміщені за адресою: . Я прочитав тут на форумі R, що рядки знаходяться в . - 1 / n ± 2 /н--√-1/н±2/н-1/n \pm 2/\sqrt{n}± 1,96 /н--√±1,96/н\pm 1.96/\sqrt{n} Я застосував такий код: b …
9 r  time-series 

3
Чим відрізняється просторова залежність від просторової неоднорідності?
Чим відрізняється просторова залежність від просторової неоднорідності? Моє запитання мотивоване читанням проблем специфікації моделі в просторовій економетрії, зокрема Anselin (2010) .

1
Як обчислити
Я намагаюся вирішити проблему для своєї дипломної роботи, і не бачу, як це зробити. У мене є 4 спостереження, випадковим чином взяті з форми( 0 , 1 )(0,1)(0,1)розповсюдження. Я хочу обчислити ймовірність цього3Х( 1 )≥Х( 2 )+Х( 3 )3Х(1)≥Х(2)+Х(3)3 X_{(1)}\ge X_{(2)}+X_{(3)}. Х( i )Х(i)X_{(i)}є статистика i-го порядку (я приймаю статистику …

2
Оцінка піків у часових рядах даних сигналу комірок
Я вимірюю наявність відповіді в вимірюваннях клітинного сигналу. Я спершу застосував алгоритм згладжування (Ханнінг) до часових рядів даних, а потім виявив піки. Що я отримую, це: Якби я хотів зробити виявлення відповіді трохи об'єктивнішим, ніж "так, ви бачите підвищення в безперервному падінні", який би був найкращий підхід? Чи потрібно отримати …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.