Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Яка різниця між асимптотичною неупередженістю та послідовністю?
Чи має на увазі кожен другий? Якщо ні, то один означає інший? Чому / чому ні? Це питання виникло у відповідь на коментар до відповіді, яку я розмістив тут . Хоча пошук Google у відповідних термінах не дав нічого корисного, я помітив відповідь на зміну математики. Однак я вважав, що …

1
Чому теорема про центральну межу працює з одним зразком?
Мене завжди вчили, що CLT працює при повторному відборі проб, причому кожен зразок є достатньо великим. Наприклад, уявіть, що у мене є країна з 1 000 000 громадян. Я розумію CLT, що навіть якщо розподіл їх висоти не було нормальним, якщо я взяв 1000 зразків по 50 осіб (тобто проводив …

3
Регресія зі скасованими даними
Спроба підрахувати кількість відвідувань за демографічними показниками та послугами. Дані дуже перекошені. Гістограми: qq ділянки (зліва - журнал): m <- lm(d$Visits~d$Age+d$Gender+city+service) m <- lm(log(d$Visits)~d$Age+d$Gender+city+service) cityі serviceє факторними змінними. Я отримую низьке значення p для всіх змінних, але також отримую низький r-квадрат у розмірі .05. Що я повинен зробити? Чи працювала …


1
Який найкращий метод мережевого мета-аналізу?
Зараз існує кілька різних підходів для здійснення мережевого метааналізу або змішаного порівняння лікування. Можливо, найбільш часто використовувані та доступні такі: в байєсівських рамках : підхід взаємодії дизайну за методом лікування в WinBUGS (наприклад, Jackson et al ); ієрархічне байесівське моделювання на основі арм у WinBUGS (наприклад, Чжао та ін ); …

3
Кодування дата / час (циклічні дані) для нейронних мереж
Як кодувати дату та час події для нейронної мережі? У мене немає безперервного часового ряду, але деякі події з датою та часом, і я аналізую якусь цікавість. Цей інтерес відрізняється між ранком та вечором, і відрізняється між буднями, літом і зимою, перед Різдвом та Великоднем тощо. А самі події мають …

2
Чи байєсівські методи за своєю суттю послідовні?
Тобто, для проведення послідовного аналізу (ви достроково не знаєте, скільки саме даних будете збирати) за допомогою частолістських методів, потрібно особливий догляд; ви не можете просто збирати дані, поки значення p не стане достатньо малим або довірчий інтервал не стане достатньо коротким. Але коли ви робите байєсівський аналіз, це хвилює? Чи …

5
Як аналізувати тенденцію в неперіодичних часових рядах
Припустимо, я маю наступні неперіодичні часові ряди. Очевидно, що тенденція зменшується, і я хотів би довести це деяким тестом (з р-значенням ). Я не в змозі використовувати класичну лінійну регресію через сильну тимчасову (послідовну) автокореляцію серед значень. library(forecast) my.ts <- ts(c(10,11,11.5,10,10.1,9,11,10,8,9,9, 6,5,5,4,3,3,2,1,2,4,4,2,1,1,0.5,1), start = 1, end = 27,frequency = 1) …
12 r  time-series 

2
Як працює операція DepthConcat у програмі "Поглиблення із згортками"?
Читання Заглиблюючись глибше із згортками , я натрапив на шар DepthConcat , будівельний блок запропонованих початкових модулів , який поєднує вихід декількох тензорів різної величини. Автори називають це "Фільтр конкатенації". Здається, це є реалізацією для Torch , але я не дуже розумію, що це робить. Чи може хтось пояснити простими …

1
Інтерпретація вихідного прогнозу Scikit
Я працюю з бібліотекою scikit-learn в python. У наведеному нижче коді я прогнозую ймовірність, але не знаю, як прочитати вихід. Тестування даних from sklearn.ensemble import RandomForestClassifier as RF from sklearn import cross_validation X = np.array([[5,5,5,5],[10,10,10,10],[1,1,1,1],[6,6,6,6],[13,13,13,13],[2,2,2,2]]) y = np.array([0,1,1,0,1,2]) Розділіть набір даних X_train, X_test, y_train, y_test = cross_validation.train_test_split(X, y, test_size=0.5, random_state=0) …

1
Вибір діапазону та щільності сітки для параметра регуляризації в LASSO
Я зараз вивчаю LASSO (найменш абсолютний оператор усадки та відбору). Я бачу, що оптимальне значення параметра регуляризації можна вибрати шляхом перехресної перевірки. Я бачу також у регресії хребта та багатьох методах, які застосовують регуляризацію, ми можемо використовувати CV для того, щоб знайти оптимальний параметр регуляризації (кажучи, штраф). Тепер моє запитання …

2
Очікуване значення x при нормальному розподілі, НАДАЄТЬСЯ, що воно нижче певного значення
Цікаво, чи можна знайти очікуване значення x, якщо воно нормально розподіляється, враховуючи, що воно знаходиться нижче певного значення (наприклад, нижче середнього значення).

1
Чому аналіз часових рядів не вважається алгоритмом машинного навчання
Чому аналіз часових рядів не вважається алгоритмом машинного навчання (на відміну від лінійної регресії). І регресійний, і аналіз часових рядів є методами прогнозування. То чому один з них вважається алгоритмом навчання, а не другий?

1
Точний тест Фішера дає неоднакові значення p
Я намагаюся застосувати точний тест Фішера в симульованій генетичній проблемі, але значення p, схоже, перекошені праворуч. Будучи біологом, я думаю, я просто пропускаю щось очевидне для кожного статистика, тому я дуже вдячний за вашу допомогу. Моя установка така: (налаштування 1, маргінали не зафіксовані) Два зразки 0s та 1s випадковим чином …

3
Джеффріс до нормального розподілу з невідомим середнім значенням та дисперсією
Я читаю попередні розподіли, і я раніше підраховував Джеффрі для вибірки нормально розподілених випадкових величин з невідомою середньою та невідомою дисперсією. Згідно з моїми підрахунками, для Jeffreys раніше було застосовано: Ось, інформаційна матриця Фішера.Яp ( μ , σ2) = dе т ( я)-----√= de t ( 1 / σ2001 / …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.