Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Висловіть відповіді у вигляді оригінальних одиниць у трансформованих даних Box-Cox
Для деяких вимірювань результати аналізу належним чином представлені в трансформованій шкалі. У більшості випадків, однак, бажано представити результати в оригінальній шкалі вимірювання (інакше ваша робота більш-менш нікчемна). Наприклад, у випадку даних, що перетворюються в журнал, виникає проблема з інтерпретацією у вихідній шкалі, оскільки середнє значення зареєстрованих значень не є журналом …

3
Використання інформаційної геометрії для визначення відстаней та обсягів… корисно?
Я натрапив на велику кількість літератури, яка виступає за використання метрики Інформації Фішера як природної локальної метрики в просторі розподілів ймовірностей, а потім інтегруючи її за визначенням відстаней і обсягів. Але чи справді ці "інтегровані" кількості корисні для чого-небудь? Я не знайшов теоретичних виправдань і дуже мало практичних застосувань. Одним …

1
Інтуїція до вищих моментів у круговій статистиці
У круговій статистиці значення очікування випадкової величини зі значеннями на колі визначається як (див. Вікіпедія ). Це дуже природне визначення, як і визначення дисперсії Тож нам не знадобився другий момент, щоб визначити дисперсію!S m 1 ( Z ) = ∫ S z P Z ( θ ) d θZZZSSSм1( Z) …

5
Когнітивна обробка / інтерпретація методів візуалізації даних
Хтось знає про дослідження, які досліджують ефективність (зрозумілість?) Різних методів візуалізації? Наприклад, як швидко люди розуміють одну форму візуалізації над іншою? Чи допомагає інтерактивність із візуалізацією пригадувати дані? Що завгодно за цими лініями. Прикладом візуалізацій можуть бути: розкидання графіків, графіків, часових ліній, карт, інтерактивних інтерфейсів (наприклад, паралельних координат) тощо. Мене …

4
Програмне забезпечення для анонімізації даних
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Хтось знає про хороше програмне забезпечення для анонімізації даних? Чи, можливо, пакет для R, який робить анонімізацію даних? Очевидно, не очікуючи незбагненної анонімізації - просто хочеться …
13 software 

5
Зменшення розмірності SVD для часових рядів різної довжини
Я використовую сингулярне значення декомпозиції як метод зменшення розмірності. З огляду на Nвектори розмірності D, ідея полягає у представленні ознак у перетвореному просторі некоррельованих розмірів, що конденсує більшу частину інформації даних у власних векторах цього простору у зменшуваному порядку важливості. Зараз я намагаюся застосувати цю процедуру до даних часових рядів. …

3
Лінійні моделі змішаних ефектів
Я часто чув, що моделі LME є більш надійними при аналізі даних про точність (тобто, в експериментах з психології), оскільки вони можуть працювати з біноміальними та іншими ненормальними розподілами, які традиційні підходи (наприклад, ANOVA) не можуть. Що є математичною основою моделей LME, що дозволяють їм включати ці інші дистрибутиви, і …

4
Виділення двох сукупностей від вибірки
Я намагаюся відокремити дві групи значень з одного набору даних. Я можу припустити, що одна з популяцій зазвичай розподілена і становить щонайменше половину розміру вибірки. Значення другого є і нижчими, або вищими, ніж значення першого (розподіл невідомий). Що я намагаюся зробити - це знайти верхню і нижню межі, які охоплювали …

2
Використання аналізу часових рядів для аналізу / прогнозування насильницької поведінки
Це трохи легковажне запитання, але у мене є серйозний інтерес до відповіді. Я працюю в психіатричній лікарні і маю три роки дані, щодня збираються в кожному відділенні щодо рівня насильства в цьому відділенні. Очевидно, що модель, яка відповідає цим даним, - це модель часового ряду. Мені довелося відрізняти бали, щоб …

5
Коли використовувати кілька моделей для прогнозування?
Це досить загальне питання: Я, як правило, виявив, що використання декількох різних моделей випереджає одну модель, намагаючись передбачити часовий ряд із зразка. Чи є якісь хороші документи, які демонструють, що комбінація моделей перевершить одну модель? Чи є найкращі практики поєднання кількох моделей? Деякі посилання: Хуей Зуа, Юйонг Ян "Поєднання моделей …

2
Родина GLM представляє розподіл змінної відповіді або залишків?
Я обговорював з декількома членами лабораторії про це, і ми перейшли до кількох джерел, але все ще не дуже відповіді: Коли ми кажемо, що у GLM є сім'я пуассонів , скажімо, ми говоримо про розподіл залишків або змінну відповіді? Суперечки Читаючи цю статтю, в ній зазначається, що припущеннями GLM є …

1
Чому у випадковому лісі чомусь випадковий підмножина функцій вибирається на рівні вузла, а не на рівні дерева?
Моє запитання: Чому випадковий ліс розглядає випадкові підмножини ознак для розщеплення на рівні вузла в межах кожного дерева, а не на рівні дерева ? Передумови: Це щось із питань історії. Тін Кам Хо опублікував цю статтю про будівництво «рішення лісу» шляхом випадкового вибору підмножини функцій для використання для вирощування кожного …

1
Чи точність є неправильним правилом оцінювання у бінарній класифікації?
Нещодавно я дізнався про правильні правила зарахування імовірнісних класифікаторів. Кілька ниток на цьому веб-сайті підкреслили, що точність - це неправильне оцінювальне правило, і його не слід використовувати для оцінки якості прогнозів, породжених ймовірнісною моделлю, такою як логістична регресія. Однак чимало академічних робіт, які я прочитав, дали втрати внаслідок неправильної класифікації …

2
Чи є теоретична проблема із усередненням коефіцієнтів регресії для побудови моделі?
Я хочу побудувати регресійну модель, яка є середнім числом декількох моделей OLS, кожна базується на підмножині повних даних. Ідея цього лежить в основі цієї роботи . Я створюю k складок і будую k OLS-моделі, кожна з даних без однієї складки. Потім я середнє значення коефіцієнтів регресії, щоб отримати остаточну модель. …

11
Чи є стандартне відхилення абсолютно неправильним? Як можна обчислити std за висотою, підрахунком тощо (додатні цифри)?
Скажімо, я обчислюю висоту (у см), і числа повинні бути більшими за нуль. Ось зразок списку: 0.77132064 0.02075195 0.63364823 0.74880388 0.49850701 0.22479665 0.19806286 0.76053071 0.16911084 0.08833981 Mean: 0.41138725956196015 Std: 0.2860541519582141 У цьому прикладі, згідно з нормальним розподілом, 99,7% значень повинні бути в межах ± 3 рази більше середнього відхилення від …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.