Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Теорема Гаусса-Маркова: СВІТИЙ та OLS
Я читаю теорему Гуаса-Маркова у Вікіпедії , і я сподівався, що хтось може допомогти мені з'ясувати головний пункт теореми. Припускаємо, що лінійна модель у матричній формі задається: у= Xβ+ ηy=Xβ+η y = X\beta +\eta і ми шукаємо СВІТУ, βˆβ^ \widehat\beta . Відповідно до цього я б мітлюη= у- Xβη=y−Xβ\eta = …

3
як інтерпретувати термін взаємодії у формулі lm в R?
У R, якщо я називаю lm()функцію таким чином: lm.1 = lm(response ~ var1 + var2 + var1 * var2) summary(lm.1) Це дає мені лінійну модель змінної відгуку з var1, var2і взаємодія між ними. Однак як саме ми чисельно інтерпретуємо термін взаємодії? У документації сказано , що це «хрест» між var1і …
9 r  regression 

3
Яка статистика тесту в точному тесті Фішера?
Для таблиці на випадок 2 на 2 дехто сказав , що точний тест Фішера використовує підрахунокX1,1X1,1X_{1,1}у клітині (1,1) таблиці як тестова статистика, і за нульової гіпотези матиме гіпергеометричний розподіл.X1,1X1,1X_{1,1} Дехто сказав, що його тестова статистика де - середнє значення гіпергеометричного розподілу (згадане вище) під нулем. Також було сказано, що значення …

1
Значення p-значення змінних логістичної регресійної моделі
Тож я працюю з логістичними регресійними моделями у Р. Хоча я ще новачок у статистиці, я відчуваю, що до цього часу я трохи розуміюсь щодо регресійних моделей, але все ще є щось, що мене турбує: Дивлячись на пов’язане зображення, ви бачите зведені R друку для прикладу створеної нами моделі. Модель …

1
Суми квадратів III типу
У мене лінійна регресійна модель з одним категоріальним змінними (чоловіками і жінками) і однієї безперервної змінної .ААAББB Я встановив контрастні коди в R с options(contrasts=c("contr.sum","contr.poly")). І тепер я маю суми квадратів III типу для , та їх взаємодії (A: B) з використанням .ААAББBdrop1(model, .~., test="F") Те , що я застряг, …

2
Нульова гіпотеза Манна-Вітні за неоднакової дисперсії
Мені просто цікаво нікчемна гіпотеза тесту Манна-Вітні U. Я часто бачу, що зазначається, що нульовою гіпотезою є те, що дві групи населення мають однаковий розподіл. Але я думаю - якби у мене було дві нормальні популяції з однаковою середньою, але надзвичайно неоднаковою дисперсією, тест Манна-Вітні, певно, не виявив би цієї …

2
Надійна оцінка середнього значення з ефективністю оновлення O (1)
Я шукаю надійну оцінку середнього значення, яке має конкретну властивість. У мене є набір елементів, для яких я хочу обчислити цю статистику. Потім я додаю нові елементи по одному, і для кожного додаткового елемента я хотів би перерахувати статистику (також відомий як онлайн-алгоритм). Я хотів би, щоб цей розрахунок оновлення …

2
Прогноз ARIMA з сезонністю та тенденцією, дивний результат
Коли я вступаю в прогнозування за допомогою моделей ARIMA, я намагаюся зрозуміти, як я можу покращити прогноз на основі підходу ARIMA із сезонністю та дрейфом. Мої дані - наступний часовий ряд (понад 3 роки, з чіткою тенденцією вгору та видимою сезонністю, яка, схоже, не підтримується автокореляцією з відставаннями 12, 24, …

1
ЄФА чітко підтримує однофакторність, міра є внутрішньо послідовною, але CFA погано підходить?
Я досліджую психометричні властивості 10-пункту міри самозвітності. У мене близько 400 випадків у двох незалежних зразках. Елементи комплектуються 4-бальною шкалою Лікерта. EFA чітко підтримує однофакторне рішення (наприклад, перше власне значення понад 6, всі інші під 1), а альфа Кронбаха - це добре (наприклад, .90). Жоден предмет не має низького співвідношення …

1
Визначте невідому кількість реальних локацій із звітів на основі GPS
Я працюю над деяким програмним забезпеченням, яке повинно визначати місця в реальному світі (камери швидкості руху) з кількох звітів на основі GPS . Користувач буде керувати автомобілем, коли повідомляє про місцеположення, тому звіти є дуже неточними. Щоб вирішити цю проблему, я повинен кластерувати звіти про одне і те саме місце …

2
Добре придатність до пуассонового розподілу
Назвіть кілька добре відомих статистичних тестів для вимірювання відповідності придатності спостережуваних випадкових величин до розподілу пуассона? Я знаю, що тест Колмогорова-Смірнова є одним з таких, чи є ще інші?


1
Динамічний викривлення часу та нормалізація
Я використовую Dynamic Time Warping, щоб зіставити криву "запит" і "шаблон" і маю досі розумний успіх, але у мене є основні питання: Я оцінюю "відповідність", оцінюючи, чи результат DTW менший від порогового значення, яке я придумав евристично. Це загальний підхід до визначення "відповідності" за допомогою DTW? Якщо ні, то поясніть …

2
Формула Доуна для бінінгу гістограми
Я реалізую різні алгоритми, щоб оцінити найкращу кількість бункерів, які слід використовувати для гістограм. Більшість із тих, що я реалізую, описані на сторінці "Гістограма" у Вікіпедії у розділі " Кількість відрізків та ширина " *. Я застряг у проблемі з формулою Доана: 1 + log(n) + log(1 + kurtosis(data) * …

2
Створення "демонстраційних" даних з реальних даних: маскування без викривлення
(Я не маю реальної ідеї, з чим позначити це, тому що я не статистик, і я не знаю, у яке поле це потрапляє. Сміливо додайте більш підходящі теги.) Я працюю в компанії, яка виробляє програмне забезпечення для аналізу даних, і нам потрібен гідний набір даних для тестування та демонстрації нашого …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.