Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Практичний підручник з PCA з даними
Пошук в Інтернеті за підручником PCA дає тисячі результатів (навіть відео). Багато навчальних посібників дуже хороші. Але я не в змозі знайти жодного практичного прикладу, де PCA пояснюється за допомогою деяких наборів даних, які я можу використовувати для демонстрації. Мені потрібен підручник, який надає невеликий набір даних, який легко побудувати …

4
Які номери найменш вірогідні для того, щоб обирати люди в лотереї?
Мега мільйони сьогодні - понад 500 мільйонів доларів. Я пам'ятаю, як читав документ JSTOR про деякі числа, які навряд чи будуть обрані. Наприклад, багато людей вибирають 7, тому що це їх щасливе число, і я хочу, щоб це було навпаки. Однак мій член JSTOR закінчився. Які числа найменш вірогідні люди …

2
Що зараз дрозофіла ШІ?
У середині 1960-х дослідники славно назвали шахи « дрозофілою ШІ»: як фруктова муха, гра в шахи була доступною і порівняно простою проблемою для експерименту, яка все ж дала важливі знання про складніші проблеми. Зараз, здається, люди кажуть, що «шахи - це лише пошукова проблема», а «шахові методи не дадуть особливого …

1
Автоматичний вибір функції для виявлення аномалії
Який найкращий спосіб автоматичного вибору функцій для виявлення аномалії? Я зазвичай розглядаю функцію виявлення аномалії як алгоритм, де функції вибираються експертами людини: важливим є діапазон виводу (як у "ненормальному введенні - ненормальний вихід"), тому навіть при багатьох функціях ви можете створити набагато менший підмножина шляхом комбінування особливості. Однак, якщо припустити, …

4
Можна отримати кращу АНН, видаливши деякі з'єднання?
Мені було цікаво, чи можливо за якихось обставин ANN працює краще, якщо відрізати деякі зв’язки на них, наприклад: Побудова однієї ANN, взявши паралельно два багатошарові АН і В (паралельні вузли вводу та виходу), додавши кілька "комунікаційних" зв'язків між прихованими шарами А і В? Чи можна отримати кращі результати узагальнення? Це …

1
Маркова ковдра проти нормальної залежності в байєсівській мережі
Поки я читав про байєсівські мережі, я зіткнувся з терміном " Маркова ковдра " і сильно плутався з його незалежністю в графіку байесівської мережі. Ковдра Маркова коротко каже, що кожен вузол залежить лише від батьків, дітей та батьків дітей [це сіра зона для вузла А на малюнку]. Яка спільна ймовірність …

2
Як похибки пов'язані з довірчими інтервалами?
Може хтось скаже мені різницю між похибками та довірчими інтервалами? В Інтернеті я бачу, як ці два значення вживаються взаємозамінно. Чи правильно сказати: "Інтервали довіри відображаються у формі 1,96 і відображаються на графіках у вигляді меж помилок"?

4
Стандартизовані бета-ваги для багаторівневої регресії
Як можна отримати стандартизовані (фіксований ефект) ваги регресії з багаторівневої регресії? І, як "надбудова": Який найпростіший спосіб отримати ці стандартизовані ваги з mer-об'єкта (від lmerфункції lme4пакета в R)?

4
Як концептуалізувати помилку в регресійній моделі?
Я відвідую клас аналізу даних, і деякі мої добре вкорінені ідеї хитаються. А саме думка про те, що помилка (epsilon), як і будь-яка інша різновид дисперсії, стосується лише (так я думав) для групи (вибірки або цілої сукупності). Тепер нас вчать, що одне з припущень регресії - це те, що дисперсія …

1
Пошук відповідних правил для нових даних за допомогою ручок
Я використовую R (і пакет arules) для видобутку транзакцій для правил асоціації. Що я хочу зробити - це побудувати правила, а потім застосувати їх до нових даних. Наприклад, скажіть, що у мене є багато правил, одне з яких - канонічне {Beer=YES} -> {Diapers=YES}. Тоді я маю нові дані про трансакцію, …

1
Чи може значення коефіцієнта взаємної інформації бути більше 1
У мене дуже базові сумніви. Вибачте, якщо це мало кого дратує. Я знаю, що значення Взаємної Інформації повинно бути більше 0, але чи повинно бути менше 1? Чи обмежує це якесь верхнє значення? Спасибі, Аміт.

1
Оцінка ймовірності успіху з урахуванням референтної сукупності
Припустимо, у вас така ситуація: Ви спостерігали за часом 1000 гравців у боулінг, які кожен грав порівняно невелику кількість ігор (скажімо, від 1 до 20). Ви відзначили відсоток страйку для кожного з цих гравців за кількість ігор, які кожен з них грав. Приходить новий гравець в боулінг, який грає 10 …

1
Розширення 2-класових моделей на багатокласні проблеми
У цьому документі про Adaboost наведено кілька пропозицій та код (стор. 17) щодо поширення 2-класових моделей на проблеми K-класу. Я хотів би узагальнити цей код таким чином, щоб я міг легко підключити різні моделі 2 класу та порівняти результати. Оскільки більшість моделей класифікації мають інтерфейс формули та predictметод, деякі з …

3
Чи слід використовувати біноміальний cdf або звичайний cdf при гортанні монет?
Монету потрібно перевірити на справедливість. 30 голів з’являються після 50 обертів. Якщо припустити, що монета справедлива, яка ймовірність, що ви отримаєте принаймні 30 голів за 50 обертів? За словами мого вчителя, правильний спосіб вирішити цю проблему - це зробити normalcdf(min = .6, max = ∞, p = .5, σ = …

2
Регресія, заснована, наприклад, на дні тижня
Мені потрібно трохи допомоги, щоб рухатись у правильному напрямку. З давніх пір я вивчив будь-яку статистику, і жаргон, схоже, змінився. Уявіть, що у мене є набір даних про автомобіль, таких як Час подорожі з міста А до міста Б Відстань від міста A до міста B Розмір двигуна Розмір взуття …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.