Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


3
t-тест на сильно перекошені дані
У мене є набір даних з десятками тисяч спостережень за даними медичних витрат. Ці дані сильно перекошені праворуч і мають багато нулів. Це виглядає так для двох груп людей (у цьому випадку два вікові групи з> 3000 одиниць у кожній): Min. 1st Qu. Median Mean 3rd Qu. Max. 0.0 0.0 …

1
Як поводитися з SVM з категоричними атрибутами
У мене простір у 35 вимірів (атрибутів). Моя аналітична проблема - це проста класифікація. З 35 вимірів понад 25 є категоричними, і кожен атрибут приймає більше 50+ типів значень. У такому сценарії введення фіксованої змінної також не допоможе мені. Як я можу запустити SVM на просторі, який має безліч категоричних …

2
Вплив меж відрізків на основі даних на тест на корисність чи-квадрата?
Залишаючи осторонь очевидну проблему низької потужності квадратика у таких обставинах, уявіть, що ви зробите тест корисності чі-квадрата на деяку щільність з невстановленими параметрами, порівнюючи дані. Для конкретності, скажімо, експоненціальний розподіл з невідомим середнім і розміром вибірки, наприклад, 100. Для отримання розумної кількості очікуваних спостережень за кошик потрібно брати до уваги …

5
Чи припускають статистики, що не можна перезволожувати рослину, або я просто використовую неправильні пошукові терміни для криволінійної регресії?
Майже всі , що я читав про лінійної регресії і GLM зводиться до цього: , де є незростаюча або неубивающей функцією і є параметр , який ви оцінити та перевірити гіпотези про. Існують десятки функцій зв'язку та перетворень і щоб зробити лінійною функцією .f ( x , β ) x …

3
Який взаємозв'язок між вірогідністю профілю та довірчими інтервалами?
Для виготовлення цієї діаграми я створив випадкові вибірки різного розміру із звичайного розподілу із середнім = 0 та sd = 1. Інтервали довіри були потім обчислені, використовуючи альфа-обрізи в межах від .001 до .999 (червона лінія) з функцією t.test (), вірогідність профілю розраховувалася за допомогою коду, нижче якого я знайшов …

5
Ймовірність намалювати задане слово з мішка з літерами в Scrabble
Припустимо, у вас був мішок з ятьма плитками, на кожному на якому буква. Є плитки з літерою 'A', з 'B' і так далі, і 'wildcard' плитками (у нас ). Припустимо, у вас був словник із обмеженою кількістю слів.ннnнАнАn_AнБнБn_Bн∗н∗n_*n=nA+nB+…+nZ+n∗н=нА+нБ+…+нZ+н∗n = n_A + n_B + \ldots + n_Z + n_* Ви вибираєте …

4
Як можна було розробити правило зупинки в аналізі потужності двох незалежних пропорцій?
Я розробник програмного забезпечення, який працює над системами тестування A / B. Я не маю надійної статистики, але за останні кілька місяців я набираю знань. Типовий тестовий сценарій включає порівняння двох URL-адрес на веб-сайті. Відвідувач відвідує, LANDING_URLа потім випадковим чином пересилається на URL_CONTROLабо URL_EXPERIMENTAL. Відвідувач являє собою зразок, і умова …

2
Чому матриця Інформації Фішера є позитивною напівкінцевою?
Нехай . Інформаційна матриця Фішера визначається як:θ∈Rnθ∈Rn\theta \in R^{n} I(θ)i,j=−E[∂2log(f(X|θ))∂θi∂θj∣∣∣θ]I(θ)i,j=−E[∂2log⁡(f(X|θ))∂θi∂θj|θ]I(\theta)_{i,j} = -E\left[\frac{\partial^{2} \log(f(X|\theta))}{\partial \theta_{i} \partial \theta_{j}}\bigg|\theta\right] Як я можу довести, що інформаційна матриця Фішера є позитивною напівмешиною?

3
Варіаційно-коваріаційна матриця в літрах
Я знаю, що однією з переваг змішаних моделей є те, що вони дозволяють задавати дисперсійно-коваріантну матрицю для даних (складна симетрія, авторегресивна, неструктурована тощо). Однак lmerфункція в R не дозволяє легко конкретизувати цю матрицю. Хтось знає, яку структуру lmerвикористовує за замовчуванням і чому немає способу її легко вказати?

2
Велика розбіжність у нахилі оцінюється, коли групи трактуються як випадкові проти фіксованих у змішаній моделі
Я розумію, що ми використовуємо моделі випадкових ефектів (або змішаних ефектів), коли вважаємо, що деякі параметри моделей випадково змінюються в залежності від коефіцієнта групування. У мене є бажання підходити до моделі, де відповідь було нормалізовано та зосереджено (не ідеально, але досить близько) через групуючий фактор, але незалежна змінна xжодним чином …

1
Центральна гранична теорема та закон великих чисел
У мене є питання початківця щодо теореми про центральну межу (CLT): Мені відомо, що CLT стверджує, що середнє значення iid випадкових змінних є приблизно нормально розподіленим (для n → ∞н→∞n \to \infty , де - індекс підсумкових значень) або стандартизована випадкова величина матиме стандартний нормальний розподіл.ннn Тепер Закон великої кількості …

9
Порядкові відстані махаланобіса
Мені потрібно обчислити вибірку відстані махаланобіса в R між кожною парою спостережень в матриці коваріатів . Мені потрібно рішення , яке є ефективним, тобто тільки відстані обчислюються, і переважно реалізовані в C / RCpp / Fortran і т.д. Я вважаю , що , матриця коваріації населення, невідомий і використовувати зразок …
18 r  algorithms  distance 

1
Чим екстремальний випадковий ліс відрізняється від випадкового лісу?
Чи більш ефективна реалізація ER (яка схожа Extreme Gradient Boostingна збільшення градієнта) - чи важлива різниця з практичної точки зору? Є R пакет, який реалізує їх. Чи є новий алгоритм, який долає "загальну" реалізацію (пакет RandomForest від R) не лише з точки зору ефективності, але і в деяких інших сферах? …

3
Періоди в історії статистики
Історію багатьох галузей науки можна розділити на невелику кількість часових інтервалів, які часто починаються з якогось важливого відкриття. Але я ніколи не бачив чогось подібного в часовій шкалі статистики. Очевидно, є деякі важливі дати, які можна вважати вихідними пунктами нового періоду (Паскаль + Фермат, Байес, Пірсон, Тукі, ..). Чи можемо …
18 history 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.