Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Що таке емпірична ентропія?
У визначенні спільно типових множин (у "Елементах теорії інформації", гл. 7.6, стор. 195) ми використовуємо - 1нжурналр ( хн)-1нжурнал⁡p(хн)-\frac{1}{n} \log{p(x^n)} в якості емпіричної ентропії як -sequence з . Я ніколи раніше не стикався з цією термінологією. Це не визначено явно ніде відповідно до покажчика книги.ннnр ( хн) = ∏нi = …

1
Зниження невикористаних рівнів у гранях за допомогою ggplot2 [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закритий минулого року . Чи можна знизити рівні, які не використовуються в гранях ggplot2s? Це мій код: tab = as.data.frame(cbind(groups = mtcars$cyl, names = row.names(mtcars), val = …

2
Чи перетворення журналу є дійсною технікою для тестування ненормальних даних?
Рецензуючи документ, автори констатують: "Змінні безперервного результату, що виявляють косий розподіл, були перетворені, використовуючи природні логарифми, до того, як були проведені t випробування для задоволення необхідних припущень щодо нормальності". Чи прийнятний це спосіб аналізу ненормативних даних, особливо якщо базовий розподіл не обов'язково є нормальним? Це може бути дуже дурним питанням, …

3
Коли для повторних заходів ANOVA віддається перевазі моделі зі змішаними ефектами?
У відповідь на це питання, щодо того, чи мій дизайн, де я випадковим чином представляв учасникам картинки з різних категорій, був прикладом, коли я повинен використовувати повторні заходи ANOVA, я отримав відповідь, що замість цього я повинен використовувати змішану модель тому що я маю дві форми залежності: для предметів та …

2
Оновлення ймовірності класифікації при логістичній регресії через час
Я будую прогностичну модель, яка прогнозує ймовірність успіху студента в кінці курсу. Мене конкретно цікавить, чи успіх студента чи невдача, коли успіх зазвичай визначається як закінчення курсу та досягнення 70% або більше балів із загальної кількості балів. Коли я розгортаю модель, оцінку ймовірності успіху потрібно оновлювати протягом часу, оскільки з'являється …

2
Як передбачити, коли відбудеться наступна подія, виходячи з часів попередніх подій?
Я студент середньої школи і працюю над проектом комп’ютерного програмування, але не маю багато досвіду в галузі статистики та моделювання даних поза курсом статистики середньої школи, тому я ніби не розгублений. В основному, у мене досить великий список (припустимо, він достатньо великий, щоб відповідати припущенням для будь-яких статистичних тестів чи …

3
Напівконтрольне навчання, активне навчання та глибоке навчання для класифікації
Остаточне редагування з усіма оновленими ресурсами: Для проекту я застосовую алгоритми машинного навчання для класифікації. Завдання: Досить обмежені марковані дані та набагато більше мічених даних. Цілі: Застосовуйте напівнаглядову класифікацію Застосувати як-небудь напівпідконтрольний процес маркування (відомий як активне навчання) Я знайшов багато інформації з науково-дослідних робіт, таких як застосування EM, Transductive …

4
Візуалізація відповідей Лікерта за допомогою R або SPSS
У мене є 82 респонденти у 2 групах (43 у групі A та 39 у групі B), які завершили опитування з 65 питань Likert, кожне - від 1 до 5 (сильно згодні - категорично не згодні). Тому у мене є кадр даних з 66 стовпцями (1 для кожного питання + …

5
2D аналог стандартного відхилення?
Розглянемо наступний експеримент: групі людей надається список міст та просять позначити відповідні місця на (інакше не маркованій) карті світу. Для кожного міста ви отримаєте розсіювання точок, орієнтовно орієнтованих у відповідному місті. Деякі міста, скажімо, Стамбул, демонструватимуть менше розсіювання, ніж інші, скажуть Москва. Припустимо, що для даного міста ми отримуємо набір …

2
Який розподіл різниці двох-т-розподілів
... і чому ? Припустимо, що , X 2 є незалежними випадковими змінними із середнім μ 1 , μ 2 та дисперсією σ 2 1 , σ 2 2 відповідно. Моя основна книга статистики говорить мені, що розподіл X 1 - X 2 має такі властивості:X1X1X_1X2X2X_2μ1,μ2μ1,μ2\mu_1,\mu_2σ21,σ22σ12,σ22\sigma^2_1,\sigma^2_2X1−X2X1−X2X_1-X_2 E(X1−X2)=μ1−μ2E(X1−X2)=μ1−μ2E(X_1-X_2)=\mu_1-\mu_2 Var(X1−X2)=σ21+σ22Var(X1−X2)=σ12+σ22Var(X_1-X_2)=\sigma^2_1 +\sigma^2_2 Скажімо, …

4
Як обчислити довірчий інтервал середнього засобу?
Уявіть, що ви повторите експеримент тричі. У кожному експерименті ви збираєте триразові вимірювання. Триплітники, як правило, досить близькі між собою, порівняно з відмінностями трьох експериментальних засобів. Обчислити велику середню досить просто. Але як можна обчислити довірчий інтервал для великого значення? Приклад даних: Експеримент 1: 34, 41, 39 Експеримент 2: 45, …

1
Що сприймає громада щодо четвертого квадрату?
Нассім Талеб, відомий з чорного лебедя (або ганебний), розробив концепцію і розробив те, що він називає "картою меж статистики" . Його основний аргумент полягає в тому, що існує одна різновид проблеми прийняття рішень, коли використання будь-якої статистичної моделі є шкідливим. Це будь-які проблеми з рішенням, коли наслідок прийняття неправильного рішення …

7
Середнє значення розсувного вікна в R
У мене є вектор значень, про який я хотів би повідомити про середнє значення у вікнах на меншому слайді. Наприклад, для вектора таких значень: 4, 5, 7, 3, 9, 8 Розмір вікна 3 та слайд 2 виконають наступне: (4+5+7)/3 = 5.33 (7+3+9)/3 = 6.33 (9+8)/3 = 5.67 І повернути вектор …
19 r 

3
Хтось вирішив вправу PTLOS 4.1?
Ця вправа дається в теорії ймовірностей: Логіка науки Едвін Джейнс, 2003. Існує часткове рішення тут . Я розробив більш загальне часткове рішення і цікавився, чи хтось ще його вирішив. Я трохи зачекаю, перш ніж опублікувати свою відповідь, щоб дати зрозуміти іншим. Добре, тож припустимо, що у нас є nnn взаємно …

6
Різниця між d Коена і хеджами для показників розміру ефекту
Для аналізу розміру ефекту зауважую, що існують відмінності між d Коена, Hedges's g і Hedges 'g *. Ці три показники зазвичай дуже схожі? Що було б у випадку, коли вони давали б різні результати? Також це питання переваги, яким я користуюся чи повідомляю?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.