Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Оптимальний алгоритм для вирішення завдань російських бандитів?
Я читав про цілий ряд алгоритмів для вирішення проблем, пов’язаних з бандитськими озброєними на зразок greedy, softmax та UCB1, але у мене виникають певні проблеми з сортуванням того, який підхід найкраще знизити до жалю.ϵϵ\epsilon Чи відомий оптимальний алгоритм для вирішення проблеми російського бандита? Чи є вибір алгоритму, який, здається, найкраще …

6
Ендогенність проти непоміченої гетерогенності
Чим відрізняється ендогенність від незастереженої неоднорідності? Я знаю, що ендогенність походить, наприклад, від опущених змінних? Але, наскільки я розумію, непомічена неоднорідність викликає ту саму проблему. Але де саме лежить різниця між цими двома поняттями?

4
Що таке практичне застосування дисперсії?
Я навчаю себе теорії ймовірностей, і не впевнений, що розумію будь-яке використання для дисперсії, на відміну від стандартного відхилення. У практичних ситуаціях, на які я дивлюся, дисперсія більша, ніж діапазон, тому вона не здається інтуїтивно корисною.
13 variance 

2
Ускладнення наявності дуже невеликої вибірки в моделі структурного рівняння
Я використовую модель структурних рівнянь (SEM) в Амосі 18. Я шукав 100 учасників свого експерименту (використовувався вільно), що, напевно, було недостатньо для проведення успішної SEM. Мені неодноразово говорили, що SEM (поряд з EFA, CFA) є "великою вибірковою" статистичною процедурою. Коротше кажучи, я не домігся до 100 учасників (який сюрприз!), І …

4
Порівняння важливості різних наборів предикторів
Я радив студенту-досліднику з певною проблемою, і я хотів отримати інформацію про інших на цьому сайті. Контекст: У дослідника було три типи змінних предиктора. Кожен тип містив різну кількість змінних предиктора. Кожен предиктор був суцільною змінною: Соціальні: S1, S2, S3, S4 (тобто чотири прогнози) Пізнавальний: C1, C2 (тобто два предиктори) …


4
Як обчислити кореляцію між / в групах змінних?
У мене є матриця з 1000 спостережень і 50 змінних, кожна з яких вимірюється за 5-бальною шкалою. Ці змінні впорядковані в групи, але в кожній групі немає однакової кількості змінних. Я хотів би обчислити два типи кореляцій: Кореляція всередині груп змінних (серед характеристик): деякий показник того, чи змінні в межах …

3
Чи прогноктор з більшою дисперсією "кращий"?
У мене є питання щодо поняття "основна статистика". Як студент, я хотів би знати, чи я думаю про це абсолютно неправильно, і чому, якщо так: Скажімо, я гіпотетично намагаюся розглянути взаємозв'язок між "проблемами управління гнівом" і сказати про розлучення (так / ні) в рамках логістичної регресії, і я маю можливість …

2
Контрольоване навчання з "рідкісними" подіями, коли рідкість пов'язана з великою кількістю подій, що зустрічаються фактично
Припустимо, ви можете спостерігати "матчі" між покупцями та продавцями на ринку. Ви також можете спостерігати за характеристиками як покупців, так і продавців, які ви хочете використовувати для прогнозування майбутніх відповідностей та надання рекомендацій обом сторонам ринку. Для простоти припустимо, що є N покупців і N продавців, і кожен знайде відповідність. …

5
Чи можна використовувати квадрат чи для порівняння пропорцій?
Я читав, що тест квадратних чі корисний, щоб дізнатись, чи суттєво відрізняється зразок від набору очікуваних значень. Наприклад, ось таблиця результатів опитування улюблених кольорів людей (n = 15 + 13 + 10 + 17 = 55 загалом респондентів): red,blue,green,yellow 15,13,10,17 Тест на квадрат чі може мені сказати, чи цей зразок …

2
Кількість значущих цифр, які слід помістити в таблицю?
Чи існує обґрунтоване правило щодо кількості важливих цифр для публікації? Ось кілька конкретних прикладів / питань: Чи є спосіб співвідносити кількість значущих цифр з коефіцієнтом варіації? Наприклад, якщо оцінка становить 12,3, а резюме - 50%, чи означає це, що інформація, представлена ​​".3", наближається до нуля? Якщо довірчий інтервал має діапазон …
13 tables 

1
Регресія часових рядів з перекриваються даними
Я бачу регресійну модель, яка регресує річну прибутковість фондового індексу за затримкою (12 місяців) Річна прибутковість того ж біржового індексу, кредитний спред (різниця між середньомісячним значенням безризикових облігацій та корпоративних облігацій врожайність), рівень інфляції у річному обчисленні та індекс промислового виробництва за рік. Це виглядає таким чином (хоча ви в …

3
Потрібна допомога з визначення розподілу за його гістограмою
У мене вибіркова сукупність зареєстрованих амплітудних максимумів певного сигналу. Населення складає близько 15 мільйонів проб. Я створив гістограму сукупності, але не можу здогадатися про розподіл за допомогою такої гістограми. EDIT1: Файл із необов’язковими значеннями вибірки тут: вихідні дані Хтось може допомогти оцінити розподіл за допомогою наступної гістограми:

1
Логістична регресія з даними спрямованості як IV
Я шукаю хороших посилань на використання даних спрямованості (міра напрямку в градусах) як незалежної змінної в регресії; в ідеалі це також було б корисно для ієрархічних нелінійних моделей (дані вкладені). Мене також цікавлять більш цільові дані. Я знайшов текст Мардії, який я збираюся отримати, але задумався, чи є хороші статті. …

3
Яка ймовірність того, що нормальний розподіл з нескінченною дисперсією має значення, що перевищує його середнє?
Мене сьогодні в інтерв'ю запитали щось подібне до цього. Інтерв'юер хотів дізнатись, яка ймовірність того, що опція "гроші" закінчиться грошима, коли волатильність прагне до нескінченності. Я сказав 0%, тому що нормальні розподіли, що лежать в основі моделі Чорного Шоулса, і гіпотеза про випадкову ходу матимуть нескінченну дисперсію. І тому я …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.