Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


2
Як ми можемо обмежити ймовірність того, що випадкова величина є максимальною?
\newcommand{\P}{\mathbb{P}} Припустимо, у нас є незалежних випадкових змінних , , X_n з кінцевими засобами \ mu_1 \ leq \ ldots \ leq \ mu_N та дисперсіями \ sigma_1 ^ 2 , \ ldots , \ sigma_N ^ 2 . Я шукаю обмеження без розподілу на ймовірність того, що будь-який X_i …

2
Коли коваріація відстані менш відповідна, ніж лінійна коваріація?
Мене щойно познайомили (неясно) з короваріацією / кореляцією броун / відстань . Це здається особливо корисним у багатьох нелінійних ситуаціях під час тестування на залежність. Але це, здається, не використовується дуже часто, хоча коваріація / кореляція часто використовується для нелінійних / хаотичних даних. Це мене думає, що можуть бути деякі …

5
Сучасні нейронні мережі, що будують власну топологію
Обмеженнями стандартних алгоритмів нейронної сітки (як backprop) є те, що вам потрібно прийняти проектне рішення про те, скільки прихованих шарів та нейронів на шар вам потрібно. Зазвичай рівень навчання та узагальнення є дуже чутливим до цих варіантів. Це стало причиною того, чому алгоритми нейронної сітки, такі як каскадна кореляція , …

4
Що означає "неупередженість"?
Що означає сказати, що "дисперсія - це упереджений оцінювач". Що означає перетворення упередженої оцінки в неупереджену оцінку за допомогою простої формули. Що саме робить це перетворення? Також, яке практичне використання цього перетворення? Чи конвертуєте ви ці бали, використовуючи статистику певного виду?

3
Як я можу обчислити похибку в результаті NPS (Net Promoter Score)?
Я дозволю Вікіпедії пояснити, як обчислюється NPS : Показник чистого промоутера отримується, задаючи клієнтам одне запитання за шкалою рейтингу від 0 до 10, де 10 "надзвичайно вірогідний", а 0 - "зовсім не вірогідний": "Наскільки ймовірно, ви б рекомендували нашу компанію друг чи колега? " На основі своїх відповідей клієнти класифікуються …

5
Який правильний спосіб перевірити значення результатів класифікації
Існує багато ситуацій, коли ви можете тренувати кілька різних класифікаторів або використовувати кілька різних методів вилучення ознак. У літературі автори часто наводять середню помилку класифікації для набору випадкових розщеплень даних (тобто після подвійної вкладеної перехресної перевірки), а іноді також дають розбіжності щодо помилки щодо розщеплення. Однак цього самостійно недостатньо, щоб …

3
Невідповідність регресії проти ANOVA (aov vs lm в R)
У мене завжди було враження, що регресія - це просто більш загальна форма ANOVA і що результати були б ідентичними. Однак останнім часом у мене були такі ж дані, як регресія та ANOVA, і результати суттєво відрізняються. Тобто, в регресійній моделі важливі як основні ефекти, так і взаємодія, тоді як …
21 r  regression  anova 

6
Приклади прихованих проблем моделей Маркова?
Я прочитав зовсім небагато прихованих моделей Маркова і сам зміг кодувати досить базову версію. Але є два основні способи, які, здається, я навчусь. Одне - прочитати та впровадити його в код (що робиться), а друге - зрозуміти, як він застосовується в різних ситуаціях (тому я можу краще зрозуміти, як це …

3
Чому ми повинні дбати про швидке змішування в ланцюгах MCMC?
Працюючи з ланцюжком Маркова Монте-Карло, щоб зробити висновок, нам потрібна ланцюг, яка швидко перемішується, тобто швидко переміщується через опору заднього розподілу. Але я не розумію, для чого нам потрібна ця властивість, тому що, наскільки я розумію, прийнята кандидатура повинна і концентрується у частині високої щільності заднього розподілу. Якщо те, що …
21 mcmc 

1
Як я можу передбачити значення з нових входів лінійної моделі в R?
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі він не приймає нових відповідей чи взаємодій. Я створив лінійну модель в R : mod = lm(train_y ~ train_x). Я хочу передати йому список X і отримати його передбачуване / оцінене / …

5
Приклад сильного коефіцієнта кореляції з високим значенням р
Мені було цікаво, чи можна мати дуже сильний коефіцієнт кореляції (скажімо, 9 або вище), з високим значенням p (скажімо, .25 або вище)? Ось приклад низького коефіцієнта кореляції з високим значенням p: set.seed(10) y <- rnorm(100) x <- rnorm(100)+.1*y cor.test(x,y) cor = 0,03908927, p = 0,6994 Високий коефіцієнт кореляції, низьке значення …

1
Ефективний розрахунок оберненої матриці в R
Мені потрібно обчислити матрицю оберненою і використовую solveфункцію. Хоча це добре працює на малих матрицях, на великих матрицях, solveяк правило, дуже повільно. Мені було цікаво, чи є якась інша функція або комбінація функцій (через SVD, QR, LU чи інші функції розкладання), які можуть дати мені швидші результати.

4
У чому полягає прокляття розмірності?
Зокрема, я шукаю посилання (папери, книги), які будуть суворо показувати і пояснювати прокляття розмірності. Це питання виникло після того, як я почав читати цю білу книгу Лафферті та Вассермана. У третьому абзаці вони згадують "добре відоме" рівняння, з якого випливає, що найкраща швидкість конвергенції - n−4/(4−d)n−4/(4−d)n^{-4/(4-d)} ; якщо хтось може …
21 theory 


Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.