Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Прихована маркова модель порогу
Я розробив доказову систему концепції розпізнавання звуку за допомогою mfcc та прихованих моделей markov. Це дає перспективні результати, коли я тестую систему на відомі звуки. Хоча система, коли вводиться невідомий звук, повертає результат з найбільшою відповідністю, і оцінка не є такою чіткою для розробки, що це невідомий звук, наприклад: Я …

4
Чи можливо додати дані тренінгу до існуючих моделей SVM?
Я використовую libsvm, і я помітив, що кожного разу, коли я дзвоню svmtrain (), я створюю нову модель і, здається, немає можливості розміщувати дані в існуючій моделі. Чи можливо це зробити? Я просто не бачу цього аспекту в libsvm?
14 svm  libsvm 

1
Варіантне розділення та поздовжні зміни кореляції з бінарними даними
Я аналізую дані про 300 000 учнів у 175 школах за допомогою логістичної лінійної моделі змішаних ефектів (випадкові перехоплення). Кожна зіниця виникає рівно один раз, і дані охоплюють 6 років. Як я можу розрізняти різницю між рівнями школи та учнів, аналогічно VPC / ICC для постійних результатів? Я бачив цю …

2
Ви відкидаєте нульову гіпотезу, коли
Це, очевидно, лише питання визначення чи конвенції і майже не має практичного значення. Якщо для встановлено його традиційне значення 0,05, чи р значення 0,0500000000000 ... вважається статистично значущим чи ні? Чи правило для визначення статистичної значущості зазвичай вважається p &lt; α або p ≤ α ??αα\alphapppp&lt;αp&lt;αp < \alphap≤αp≤αp \leq \alpha

1
Які існують різні типи кодування для категоричних змінних (в R) і коли ви їх використовуєте?
Якщо вам підходить лінійна модель або змішана модель, існують різні типи кодувань, які дозволяють перетворити категоричну або номінальну змінну в ряд змінних, для яких оцінюються параметри, такі як манекенне умовлення (за замовчуванням R) та кодування ефектів. Я чув, що кодування ефектів (іноді їх називають відхиленням або контрастним кодуванням) є кращим, …

3
Тематичні моделі для коротких документів
Натхненний цим питанням , мені цікаво, чи зроблена якась робота над тематичними моделями для великих збірок надзвичайно коротких текстів. Моя інтуїція полягає в тому, що Twitter повинен бути природним натхненником для таких моделей. Однак, з деяких обмежених експериментів, схоже, що стандартні тематичні моделі (LDA тощо) на цих даних досить погано …

2
Чи можу я використовувати алгоритми glm, щоб зробити багаточленну логістичну регресію?
Я використовую spotfire (S ++) для статистичного аналізу в своєму проекті, і мені потрібно виконати багаточленну логістичну регресію для великого набору даних. Я знаю, що найкращий алгоритм був би mlogit, але він, на жаль, недоступний у s ++. Однак у мене є можливість використовувати алгоритм glm для цієї регресії. Я …

5
Інтерпретація розбіжностей між R та SPSS з аналітичним факторним аналізом
Я аспірант з інформатики. Я робив аналіз дослідницьких факторів для дослідницького проекту. Мої колеги (які ведуть проект) використовують SPSS, тоді як я вважаю за краще використовувати R. Це не мало значення, поки ми не виявили значної розбіжності між двома статистичними пакетами. Ми використовуємо фактори основного осі як метод вилучення (будь …

2
Робота з наборами даних зі змінною кількістю функцій
Які існують деякі підходи до класифікації даних із змінною кількістю функцій? Як приклад, розглянемо проблему, коли кожна точка даних є вектором x і y точок, а у нас немає однакової кількості точок для кожного екземпляра. Чи можемо ми розглядати кожну пару точок x і y як особливість? Або ми повинні …

3
Динамічні системи рекомендацій
Система рекомендацій вимірює співвідношення між рейтингами різних користувачів та дає рекомендації для даного користувача щодо елементів, які можуть його зацікавити. Однак смаки змінюються з часом, тому старі рейтинги можуть не відображати поточних уподобань і навпаки. Можливо, ви колись помістили "відмінно" до книги, яку зараз оціните як "не надто огидну" тощо. …

2
Питання про логістичну регресію
Я хочу запустити бінарну логістичну регресію для моделювання наявності чи відсутності конфлікту (залежної змінної) з набору незалежних змінних протягом 10-річного періоду (1997-2006), причому кожен рік мав 107 спостережень. Мої незалежні: деградація земель (категорична для 2 видів деградації); приріст населення (0- ні; 1-так); тип існування (0 - тип один; 1 - …

3
Що можна розповісти школяреві про статистику та машинне навчання?
Наступного тижня у нас є стажист із місцевої школи. Концепція його короткого стажування полягає в тому, щоб отримати уявлення про те, як працює реальний світ і якими певними роботами займаються, як виглядає щоденна робота тощо. Тепер я поцікавився, що можна розповісти / показати / продемонструвати такому маленькому малюкові про статистику …

2
Кодування категоричних ознак до чисел для машинного навчання
Багато алгоритмів машинного навчання, наприклад нейронні мережі, розраховують мати справу з числами. Отже, коли у вас є категоричні дані, вам потрібно їх перетворити. Під категоричністю я маю на увазі, наприклад: Марки автомобілів: Audi, BMW, Chevrolet ... Ідентифікатори користувачів: 1, 25, 26, 28 ... Незважаючи на те, що ідентифікаційні дані користувачів …

1
Пов'язаний з функцією генерування моменту
Це запитання виникає з того, що тут задають питання про функції, що генерують момент (MGF). Припустимо, ХХX - обмежена нульова середня випадкова величина, що приймає значення у [ - σ, σ][-σ,σ][-\sigma, \sigma] і нехай є її MGF. З прив’язки, що використовується у доказі нерівності Геффдінга , ми маємо, що де …

1
Чому ми повинні обговорювати поведінку конвергенції різних оцінювачів у різних топологіях?
У першому розділі книги « Алгебраїчна геометрія та теорія статистичного навчання», в якому йдеться про конвергенцію оцінок у різних функціональних просторах, згадується, що байєсова оцінка відповідає топології розподілу Шварца, тоді як оцінка максимальної вірогідності відповідає топології над норми (на сторінці 7): Наприклад, над-норма, -норма, слабка топологія простору Гільберта L 2 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.