Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

8
Мінімальний розмір вибірки для непарного тесту
Чи існує "правило" для визначення мінімального розміру вибірки, необхідного для тестування тесту? Наприклад, потрібно порівняти між засобами двох груп населення. Є 7 точок даних від однієї сукупності та лише 2 точки даних від іншого. На жаль, експеримент дуже дорогий і забирає багато часу, а отримання більшої кількості даних неможливо. Чи …

6
Де знайти великий текстовий корпус? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 6 років тому . Я шукаю великий (> 1000) текстовий корпус для завантаження. Переважно зі світовими новинами чи якимись репортажами . Я знайшов лише один із …
16 dataset 

2
Пояснення двосхилих тестів
Я шукаю різних способів пояснення учням (в курсі елементарної статистики), що таке тест з двома хвостами і як обчислюється його значення P. Як ви пояснюєте своїм учням тест з двома кінцями?

2
Яке статистичне обґрунтування інтерполяції?
Припустимо, що у нас є дві точки (наступна фігура: чорні кола), і ми хочемо знайти значення для третьої точки між ними (хрест). Дійсно, ми будемо оцінювати це на основі наших експериментальних результатів, чорних точок. Найпростіший випадок - намалювати лінію, а потім знайти значення (тобто лінійна інтерполяція). Якщо у нас були …

5
Книги теорії ймовірностей для самостійного вивчення
Чи є якісь хороші книги, які пояснюють такі важливі поняття теорії ймовірностей, як функції розподілу ймовірностей та функції кумулятивного розподілу? Будь ласка, уникайте посилань на книги типу "Математична статистика та аналіз даних" Джона Райса, які починаються з простих концепцій перестановки, а потім раптом (у другому розділі) зробіть стрибок, припускаючи знання …

3
Робити великі, розумні (помилкові) ставки
Я намагався кодувати алгоритм, щоб запропонувати ставки в 1X2 (зважених) іграх. В основному, у кожній грі є набір матчів (домашні та виїзні команди): 1: домашні виграші X: малювати 2: виграє гості Для кожного матчу і символу ( 1, Xі 2), я присвою відсоток , який представляє шанси / ймовірність цього …

4
Кластеризація 1D даних
У мене є набір даних, я хочу створити кластери для цих даних на основі лише однієї змінної (відсутні відсутні значення). Я хочу створити 3 кластери на основі цієї однієї змінної. Який алгоритм кластеризації використовувати, k-засоби, EM, DBSCAN тощо? Моє головне питання, в яких обставинах я повинен використовувати k-засоби над ЕМ …
16 clustering 

11
Спосіб для початку роботи та вивчення R?
Я кілька разів намагався "піти це самостійно" - але з обмеженим успіхом. Я випадковий користувач SPSS і маю досвід роботи з SAS. Буде вдячний вказівник або два від того, хто має подібний фон і зараз використовує R.
16 r  references 

1
Чи можна використовувати Колмогорова-Смірнова для порівняння двох емпіричних розподілів?
Чи правильно використовувати тест на корисність Колмогорова-Смірнова для порівняння двох емпіричних розподілів, щоб визначити, чи є вони з одного і того ж базового розподілу, а не для порівняння одного емпіричного розподілу із заздалегідь заданим опорним розподілом? Дозвольте спробувати задати це іншим способом. Я збираю N проб з деякого розповсюдження в …

2
Коли ми поєднуємо зменшення розмірності з кластеризацією?
Я намагаюся виконати кластеризацію на рівні документа. Я сконструював частотну матрицю терміна-документ і намагаюся кластеризувати ці великі розмірні вектори за допомогою k-засобів. Замість того, щоб безпосередньо кластеризувати, я спершу застосував сингулярний векторний розпад LSA (Latent Semantic Analysis) для отримання матриць U, S, Vt, вибрав відповідний поріг за допомогою діаграми екрана …

2
Що саме означає "об'єднати дані"?
Я подумав, що "об'єднання даних" просто означало поєднання даних, які раніше були розділені на категорії ... по суті, ігнорування категорій і перетворення даних на один гігантський "пул" даних. Я думаю, це питання більше стосується термінології, ніж застосування статистики. Наприклад: Я хочу порівняти 2 сайти, і в межах кожного сайту у …

1
Генерація випадкових зразків з користувацького розподілу
Я намагаюся генерувати випадкові вибірки з користувальницького pdf за допомогою R. Мій pdf такий: fХ( х ) = 32( 1 - х2) , 0 ≤ x ≤ 1fХ(х)=32(1-х2),0≤х≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 Я створив рівномірні зразки, а потім спробував перетворити його на свій власний розподіл. Я …
16 r  sampling  uniform 

2
Чи можливо створити сюжет паралельних множин за допомогою R?
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Завдяки питанню Tormod (розміщеному тут ) я натрапив на сюжет паралельних наборів . Ось приклад того, як це виглядає: (Це візуалізація набору даних "Титанік". Показано, наприклад, …


2
Оцінка надійності анкети: розмірність, проблемні елементи та чи слід використовувати альфа, лямбда6 чи якийсь інший індекс?
Я аналізую бали, які дають учасники експерименту. Я хочу оцінити надійність моєї анкети, яка складається з 6 пунктів, спрямованих на оцінку ставлення учасників до товару. Я обчислював альфа Кронбаха, обробляючи всі елементи як єдину шкалу (альфа - приблизно 0,6) і видаляв один елемент за один раз (макс. Альфа - приблизно …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.