Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Книги зі статистичної екології?
Я знаю, що це питання було задано раніше: Довідник з екологічних досліджень, але це не те, що я шукаю. Що я шукаю, якщо хтось може порекомендувати гарну книгу (або канонічну довідку) про статистичну екологію? Я дуже добре розумію статистику, щоб книга могла бути справді на будь-якому рівні. Я б використовував …

4
Використання логістичної регресії для безперервної залежної змінної
Нещодавно я переглянув свою дослідницьку роботу, і наступний коментар рецензента щодо моєї роботи: Результати, отримані за однією моделлю, не зовсім переконливі, особливо лінійна регресія, як правило, має недоліки в роботі з людьми, що втратили життя. Я пропоную авторам також спробувати логістичну регресію та порівняти відповідні результати з поточними результатами. Якщо …

3
статистичний тест, щоб перевірити, чи відносини лінійні чи нелінійні
У мене є приклад набору даних таким чином: Volume <- seq(1,20,0.1) var1 <- 100 x2 <- 1000000 x3 <- 30 x4 = sqrt(x2/pi) H = x3 - Volume r = (x4*H)/(H + Volume) Power = (var1*x2)/(100*(pi*Volume/3)*(x4*x4 + x4*r + r*r)) Power <- jitter(Power, factor = 1, amount = 0.1) plot(Volume,Power) …

4
Чи є назва цієї діаграми - свого роду перехрес між круговою діаграмою та мекко сюжетом
Чи є назва цієї діаграми нижче (отримана від Міністерства бізнесу, інновацій та зайнятості Нової Зеландії , для якого я працюю, але я не брав участі у створенні цього сюжету)? Він складається з прямокутників, де площа пропорційна змінній і нагадує своєрідний хрест між круговою діаграмою, мозаїчною сюжетом та мекко сюжетом. Це, …

1
Інтерпретація сюжетних скрипків
Я порівнюю розподіл різних груп за допомогою сюжетних скриптів, однак більшість знайдених в Інтернеті ресурсів пов'язані саме з тим, як зробити сюжети та дуже базову інтерпретацію результатів (середня варіація, дані кластеризовані чи ні). Я шукаю докладні приклади, які я можу дотримуватися як своє керівництво, щоб правильно інтерпретувати сюжетні скрипки.

2
Міра продуктивності класифікатора, що поєднує чутливість та специфічність?
У мене є дані з 2-класовим маркуванням, за якими я здійснюю класифікацію, використовуючи кілька класифікаторів. А набори даних добре збалансовані. Оцінюючи ефективність класифікаторів, я повинен враховувати, наскільки точний класифікатор у визначенні не тільки справжніх позитивних, але й справжніх негативів. Тому, якщо я буду використовувати точність, і якщо класифікатор схильний до …

1
Чи є умовне значення
Я читав документ про примірку кривої Байєса ( Dimatteo et al. Байєсівська крива підганяння зі сплайнами вільного вузла, 2001 ) і натрапив на символ ≏≏\bumpeq . Він використовується декілька разів у всьому документі, але ніколи чітко не визначений. Після кількох пошуків google та stackexchange видається, що символ ні широко використовується, …

3
Рекомендації для вчителя вперше (вступ до біостатистики)
Я навчаю свій перший клас цієї осені (вступ до біостатистики). У когось є якісь пропозиції щодо викладання статистики? Можливо, який-небудь приклад, який ви хочете, щоб ваш перший вчитель використав? Я використовую Принципи біостатистики Пагано та Говро. Редагувати: ДЕТАЛІ Цей клас - це онлайн-клас, який збирається двічі на тиждень протягом 1,5 …

1
Хороші, корисні та характерні експерименти для (оптимального) статистичного проектування експериментів
Існує більше явищ, до яких може бути застосовано експериментальний дизайн, ніж є альтернативні діючі стратегії проектування. Це має бути правдою, хоча існує безліч способів правильно розробити експеримент. Які найкращі "проблеми", які справді демонструють цінність та нюанс для різних типів оптимального проектування експериментів? (A, D, E, C, V, phi, ....) Чи …

5
Як виміряти ефективність класифікатора, коли близько 100% міток класу належать одному класу?
У моїх даних, у мене є змінна класу, позначена як . Значення змінної цього класу становлять (двійкові). Практично всі спостереження мають 0 (близько 100%, точніше, 97%). Мені б хотілося "тестування" продуктивності на різних моделях класифікації (це може бути точність). Мені страшно траплятися, що якщо у мене є класифікаційна модель, яка …

2
Плутанина, пов'язана з вибіркою Гіббса
Я натрапив на цю статтю, де сказано, що в вибірці Гіббса приймається кожен зразок. Я трохи розгублений. Як прийти, якщо кожен зразок, який він прийняв, переходить до нерухомого розподілу. Загалом алгоритм Метрополіса приймаємо як min (1, p (x *) / p (x)), де x * - точка вибірки. Я припускаю, …

1
Використання процентилів як предикторів - хороша ідея?
Я думаю про проблему, яка полягає в тому, щоб передбачити вхід (витрати) клієнта за допомогою лінійної регресії. Я розглядаю, які функції використовувати як вхідні дані, і цікаво, чи було б добре використовувати перцентил змінної як вхідні дані. Наприклад, я міг використовувати дохід компаній як вкладення. Мені цікаво, чи можу я …

2
Додавання ваг для сильно перекошених наборів даних при логістичній регресії
Я використовую стандартну версію логістичної регресії, щоб підходити мої вхідні змінні до двійкових вихідних змінних. Однак у моїй проблемі негативні результати (0s) значно перевищують позитивні результати (1s). Співвідношення 20: 1. Тому, коли я треную класифікатор, здається, що навіть функції, які наголошують на можливості позитивного виводу, все ще мають дуже низькі …

1
R / caret: поїзд та тестові набори проти перехресної перевірки?
Це може бути дурним питанням, але коли генерувати модель з обережністю та використовувати щось на кшталт LOOCVабо (навіть більше, до речі) LGOCV, яка користь від розбиття даних на поїзди та тестові набори, якщо це по суті те, що крос перехресної перевірки все одно? Я прочитав деякі пов'язані з цим питання, …

4
Якщо у мене є багато позитивних, незначних результатів, чи можу я перевірити "принаймні з цих результатів позитивні"?
Скажімо, я провів однакову регресію для 100 різних осіб окремо. Мої коефіцієнти інтересу позитивні (і зовсім відрізняються один від одного), але статистично незначні у всіх 100 результатах (давайте скажемо, кожне p-значення = 0,11). Чи існує спосіб поєднання цих p-значень, щоб зробити висновок «щонайменше 80 з цих результатів є позитивними» з …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.