Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Справа з регресією незвично обмеженої змінної реакції
Я намагаюся моделювати змінну відповідей, яка теоретично обмежена між -225 та +225. Змінна - це загальна оцінка, яку отримували суб'єкти під час гри. Хоча теоретично суб'єкти можуть набрати +225. Незважаючи на це, оскільки оцінка залежала не тільки від дій суб'єктів, але і від дій інших дій, максимум, кого хто забив …

1
Оцінка класифікаторів: криві навчання та криві ROC
Я хотів би порівняти два різних класифікатори для проблеми класифікації багатокласового тексту, які використовують великі набори навчальних даних. Я сумніваюся, чи варто використовувати криві ROC або криві навчання для порівняння двох класифікаторів. З одного боку, криві навчання корисні для визначення розміру навчального набору даних, оскільки ви можете знайти розмір набору …

3
Виміряйте рівномірність розподілу точок у 2D квадраті
У мене 2D квадрат, і всередині нього є набір точок, скажімо, 1000 точок. Мені потрібен спосіб побачити, чи розподілено точки всередині квадрата (або більш-менш рівномірно розподілено) чи вони мають тенденцію збиратися в якомусь місці всередині квадрата. Мені потрібен математичний / статистичний (не програмуючий) спосіб для цього. Я погуглив, знайшов щось …

2
Перетворити безперервні змінні для логістичної регресії
У мене є великі дані опитування, двійкова змінна результат та багато пояснювальних змінних, включаючи двійкові та безперервні. Я будую набори моделей (експериментую як з GLM, так і зі змішаним GLM) і використовую інформаційно-теоретичні підходи для вибору топ-моделі. Я уважно вивчив пояснення (як безперервні, так і категоричні) на предмет кореляцій, і …


1
Генерація випадкових чисел Log-Cauchy
Мені потрібно намалювати випадкові числа з розподілу зрубу, який має щільність: Хтось може мені допомогти або вказати на книгу / папір, який міг би показати мені як?f( x ; μ , σ) = 1х πσ[ 1 + ( l n ( x ) - μσ)2].f(х;мк,σ)=1хπσ[1+(лн(х)-мкσ)2].f(x;\mu,\sigma)=\frac{1}{x\pi\sigma\left[1+\left(\frac{ln(x)-\mu}{\sigma}\right)^2\right]}.

2
Як "розумно" скласти колекцію відсортованих даних?
Я намагаюся інтелектуально зібрати впорядковану колекцію. У мене є збірка з яти даних. Але я знаю, що ці дані вписуються в нерівномірних розмірів. Я не знаю, як розумно вибрати кінцеві точки, щоб правильно підходити до даних. наприклад:nnnmmm Скажімо, у моїй колекції 12 предметів, і я знаю, що дані вмістяться в …

4
Діагональні прямі лінії в залишках проти встановлених значень ділянки для множинної регресії
За моїми даними я спостерігаю дивні закономірності в залишках: [EDIT] Ось графіки часткової регресії для двох змінних: [EDIT2] Додано графік PP Здається, розподіл іде добре (див. Нижче), але я не маю жодного уявлення, звідки може бути ця пряма лінія. Будь-які ідеї? [ОНОВЛЕННЯ 31.07] Виявляється, ви були абсолютно праві, у мене …

1
Пошук порівнянної групи контролю для групи лікування?
У мене є група лікування розміром 30 (30 шкіл у Каліфорнії), яка використовувала додаткові програми з математики. У простому аналізі я хотів би порівняти середній приріст математики студентів між нашою групою лікування та порівнянною контрольною групою. У CA є багато шкіл, які не використовували програмне забезпечення. Мені б хотілося, щоб …

3
Інформаційно-теоретична центральна межа теореми
Найпростішою формою інформаційно-теоретичного CLT є наступна: Нехай Х1, X2, …Х1,Х2,…X_1, X_2,\dots є iid із середнім значенням 000 та дисперсією . Нехай - щільність нормованої суми а - стандартна щільність Гаусса. Тоді інформаційно-теоретичний CLT стверджує, що якщо кінцевий для деякого n , то D (f_n \ | \ phi) \ до …

5
Кластеризація як засіб поділу даних для логістичної регресії
Я намагаюся передбачити успіх чи невдачу студентів на основі деяких особливостей з логістичною регресійною моделлю. Щоб покращити ефективність моделі, я вже думав про розподіл учнів на різні групи на основі очевидних відмінностей та побудови окремих моделей для кожної групи. Але я думаю, що може бути складно визначити ці групи за …

2
Як оцінити точність інтеграла?
Надзвичайно поширена ситуація в комп'ютерній графіці полягає в тому, що колір деякого пікселя дорівнює інтегралу якоїсь функції з реальною цінністю. Часто функція занадто складна, щоб її вирішити аналітично, тому нам залишається числове наближення. Але функція також часто дуже дорога для обчислення, тому ми сильно обмежені у тому, скільки зразків ми …

1
Тест на властивість markov у часовому ряду
Враховуючи (спостерігається) часовий ряд з , чи існує статистичний тест для тестування нульової гіпотези, що (тобто властивість markov)?ХтХтX_tХт∈ { 1 , . . . , n }Хт∈{1,...,н}X_t\in\{1,...,n\}П( Xт| Хt - 1, Xt - 2, . . . , X1) = Р( Xт| Хt - 1)П(Хт|Хт-1,Хт-2,...,Х1)=P(Xt|Xt−1)P(X_t|X_{t-1},X_{t-2},...,X_1)=P(X_t|X_{t-1})

6
Ідентифікація нелінійних регресій
Я займаюся дослідженнями в області функціональної реакції кліщів. Я хотів би зробити регресію для оцінки параметрів (швидкість атаки та час обробки) функції Роджерса типу II. У мене є набір даних про вимірювання. Як я можу найкращим чином визначити людей, що вижили? Для моєї регресії я використовую наступний скрипт у R …

3
Заняття / експерименти класу для викладання статистичних понять?
Я маю намір прочитати одноденну лекцію для підлітків про статистику. Я, мабуть, побачу їх лише один раз. Цей сценарій може траплятися знову і знову. Я хотів би приділити їм деяку діяльність, щоб змусити їх переживати статистику. Але я змушений це робити з людьми, які нічого не знають про ймовірність, статистичні …
11 teaching 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.