Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Якщо будь-який параметричний тест не відхиляє нуль, чи робить його непараметрична альтернатива те саме?
Якщо вважається, що непараметричні тести мають меншу потужність, ніж їх параметричні альтернативи, чи означає це, що якщо будь-який параметричний тест не відхиляє нульове значення, то його непараметрична альтернатива також не відхиляє нуль? Як це може змінитися, якщо припущення параметричного тесту не виконуються і тест все одно використовується?

1
Розуміння вимірюють нерівності концентрації
В дусі цього питання Розуміючи докази леми, що використовується в нерівності Геффдінга , я намагаюся зрозуміти кроки, які призводять до нерівності Геффдінга. Найбільш загадковою для мене є доказ - це частина, де обчислюються експоненціальні моменти для сукупності змінних iid, після яких застосовується нерівність Маркова. Моя мета полягає в тому, щоб …

4
Найкращий спосіб просто зберігати дані для статистичного аналізу в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 6 років тому . Я вже деякий час використовую текстові файли, щоб зберігати свої дані для R без жодних проблем. Але для недавнього проекту розміри файлів …
12 r  dataset 

1
Критерії вибору "найкращої" моделі в моделі прихованої Маркова
У мене є набір даних часових рядів, до яких я намагаюся встановити модель прихованої Маркова (HMM), щоб оцінити кількість прихованих станів у даних. Мій псевдо-код для цього: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest BIC" ... } Тепер, …

2
Як застосувати нейронні мережі до задач класифікації на багато міток?
Опис: Нехай проблемною областю буде класифікація документів там, де існує набір функцій векторів, кожен з яких належить до 1 або більше класів. Наприклад, документ doc_1може належати Sportsі Englishкатегорії. Питання: Використовуючи нейронну мережу для класифікації, якою міткою був би вектор функції? це був би вектор, що складається з усіх класів таким, …

2
Двійкові моделі (Пробіт і Логіт) з логарифмічним зміщенням
Чи має хтось висновок про те, як офсет працює у бінарних моделях, таких як probit та logit? У моїй проблемі вікно подальших дій може відрізнятися за довжиною. Припустимо, пацієнти отримують профілактичний знімок як лікування. Постріл відбувається в різний час, тому , якщо результат є двійковим індикатором того або стався спалах …

2
Змішана модель з 1 спостереженням на рівень
Я підхоплюю модель випадкових ефектів glmerдо деяких бізнес-даних. Метою є аналіз результатів продажів через дистриб'ютора з урахуванням регіональних відмінностей. У мене є такі змінні: distcode: ідентифікатор дистриб'ютора, близько 800 рівнів region: географічний ідентифікатор верхнього рівня (північ, південь, схід, захід) zone: географія середнього рівня, що вкладається region, приблизно 30 рівнів territory: …

2
Як зробити вибірку з дискретного (категоричного) розподілу в просторі журналу?
Припустимо, у мене дискретний розподіл, визначений вектором таким, що категорія буде намальована з вірогідністю тощо. Потім я виявляю, що деякі значення в розподілі настільки малі, що вони переповнюють представлення числа плаваючої крапки мого комп'ютера, тому, щоб компенсувати, я виконую всі свої обчислення в журнальному просторі. Тепер у мене є векторний …

2
Співвідношення та різниця між часовими рядами та регресом?
Які відношення та різниця між часовими рядами та регресом? Чи правильно для моделей та припущень регресійні моделі передбачають незалежність між вихідними змінними для різних значень вхідної змінної, тоді як модель часових рядів не робить? Які ще інші відмінності? Для методів - з веб-сайту Дарлінгтона Існує ряд підходів до аналізу часових …

3
Коли справді фіксований ефект?
Розглянемо лінійну неспостережувані ефекти модель типу: , де з є непомітним , але час-інваріантної характеристикою і е помилка, я і т індексу окремі спостереження і часу, відповідно. Типовим підходом у регресії з фіксованими ефектами (FE) було б усунення c i за допомогою окремих манекенів (LSDV) / де-значення або шляхом першої …

1
Алгоритм нормалізації даних у режимі реального часу?
Я працюю над алгоритмом, який займає вектор останньої точки даних з ряду потоків датчиків і порівнює евклідову відстань з попередніми векторами. Проблема полягає в тому, що різні потоки даних походять від абсолютно різних датчиків, тому проходження простої евклідової відстані різко перекреслить деякі значення. Ясна річ, мені потрібен певний спосіб нормалізації …

1
Тестування певних контрастів: це, очевидно, важка проблема, чи ні?
Я опублікував це на mathoverflow і ніхто не відповів: Метод Шеффе для визначення статистично значущих контрастів широко відомий. Контраст серед засобів , з популяцій є лінійною комбінацією , в якому , а скалярний кратний контраст - це по суті той самий контраст, тому можна сказати, що безліч контрастів є проективним …

1
Байєсівська мережа з використанням pymc (плутанина для початківців)
Зараз я проходжу курс PGM Дафни Коллер на Coursera. Таким чином, ми, як правило, моделюємо Байєсівську мережу як графік, спрямований на причини та наслідки змінних, що входять до спостережуваних даних. Але на підручниках і прикладах PyMC я, як правило, бачу, що це не зовсім моделюється так само, як PGM або …

2
Інтеграція оцінювача щільності ядра в 2D
Я виходжу з цього питання на випадок, якщо хтось захоче піти слідом. В основному у мене є набір даних складається з об'єктів, де кожен об'єкт має задане число вимірюваних значень, приєднаних до нього (у цьому випадку два):NΩΩ\OmegaNNN Ω = o1[ х1, у1] , о2[ х2, у2] , . . . …

2
Чи можна р-значення для тесту кореляції Пірсона обчислювати саме з коефіцієнта кореляції та розміру вибірки?
Передумови: я прочитав одну статтю, де автори повідомляють про співвідношення Пірсона 0,754 від розміру вибірки 878. Результат p-значення для тесту кореляції є значущим "дві зірки" (тобто p <0,01). Однак я вважаю, що при такому великому розмірі вибірки відповідне значення p повинно бути менше 0,001 (тобто три зірки). Чи можна р-значення …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.