Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як ви використовуєте прості експоненціальні згладжування в R?
Я початківець в R, чи не могли б ви пояснити, як використовувати ses в пакеті прогнозу R прогнозу ? Я хотів би вибрати кількість початкових періодів і постійну згладжування. d <- c(3,4,41,10,9,86,56,20,18,36,24,59,82,51,31,29,13,7,26,19,20,103,141,145,24,99,40,51,72,58,94,78,11,15,17,53,44,34,12,15,32,14,15,26,75,110,56,43,19,17,33,26,40,42,18,24,69,18,18,25,86,106,104,35,43,12,4,20,16,8) У мене 70 періодів, я хотів би використати 40 періодів для початкових і 30 для вибіркових. ses(d, h=30, …

1
Що таке ітеративний завантажувач? Як він використовується?
Нещодавно я натрапив на згадку про "подвійний / потрійний завантажувальний" або "ітеративний завантажувальний". Як я розумію, кожен зразок завантажувальної програми знову завантажується. У чому сенс? Як він використовується?
9 bootstrap 

1
обумовлене загальним, яким є розподіл від'ємних біномів
Якщо х1,х2, … ,хнx1,x2,…,xnx_1, x_2, \ldots, x_n чи є негативними двочленними, то який розподіл (х1,х2, … ,хн)(x1,x2,…,xn)(x_1, x_2, \ldots, x_n) дано х1+х2+ … +хн= Nx1+x2+…+xn=Nx_1 + x_2 + \ldots + x_n = N\quad? NNN фіксується. Якщо х1,х2, … ,хнx1,x2,…,xnx_1, x_2, \ldots, x_n тоді Пуассон, залежно від загального, (х1,х2, … ,хн)(x1,x2,…,xn)(x_1, …

1
Дискретні дані та альтернативи PCA
У мене є набір даних дискретних (порядкових, меристичних та номінальних) змінних, що описують морфологічні символи крила на кількох близьких видах комах. Що я хочу зробити - це провести якийсь аналіз, який би дав мені наочне уявлення про подібність різних видів на основі морфологічних характеристик. Перше, що мені впало в голову, …

2
Спільна фільтрація за допомогою матричної факторизації з логістичною функцією втрат
Розглянемо проблему спільної фільтрації. У нас є матрицяММM розміру # користувачі * #items. Мi , j= 1Мi,j=1M_{i,j} = 1 якщо користувачеві мені подобається предмет j, Мi , j= 0Мi,j=0M_{i,j} = 0 якщо користувач мені не подобається пункт j і Мi , j= ?Мi,j=?M_{i,j}=?якщо немає даних про (i, j) пари. Ми …

2
Навчання за реляційними даними
Налаштування Багато алгоритмів працюють на одному відношенні або таблиці, в той час як багато реальних баз даних зберігають інформацію в декількох таблицях (Domingos, 2003). Запитання Які види алгоритмів добре навчаються з декількох (реляційних) таблиць. Зокрема, мене цікавлять алгоритми, застосовні до задач регресії та класифікації (не орієнтовані на мережевий аналіз, наприклад, …

4
Розширення логістичної регресії для результатів в межах від 0 до 1
У мене є проблема регресії, коли результати не строго 0, 1, а скоріше в діапазоні всіх реальних чисел від 0 до 1, включаючи .Y= [ 0 , 0.12 , 0.31 , . . . , 1 ]Y=[0,0,12,0,31,...,1]Y = [ 0, 0.12, 0.31, ..., 1 ] Ця проблема вже обговорювалася в …

3
Перемикання знаків при додаванні ще однієї змінної в регресії та значно більших масштабів
Основна настройка: модель регресії: де C - вектор керуючих змінних.у= константа +β1х1+β2х2+β3х3+β4х4+ α C+ ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon Мене цікавить і очікую, що та будуть негативними. Однак у моделі є проблема мультиколінеарності, коефіцієнт кореляції задається через, corr ( , 0,9345, corr ( , 0,1765, corr ( , 0,3019.ββ\betaβ1β1\beta_1β2β2\beta_2х1x1x_1х2) =x2)=x_2)=х1x1x_1х3) …

1
Як мені нормалізувати дані датчика акселерометра?
Я працюю з великим набором даних акселерометра, зібраними за допомогою декількох датчиків, які носили багато предметів. На жаль, тут, здається, ніхто не знає технічних характеристик пристроїв, і я не думаю, що вони ніколи не були повторно відкалібровані. У мене не багато інформації про пристрої. Я працюю над магістерською дисертацією, акселерометри …

4
Box Cox Трансформації для регресії
Я намагаюся встановити лінійну модель на деякі дані лише з одним предиктором (скажімо, (x, y)). Дані є такими, що для малих значень x значення y дають чітке прилягання до прямої лінії, однак у міру збільшення значень x значення y стають більш мінливими. Ось приклад таких даних (код R) y = …

1
Парель між LSA та pLSA
В оригінальній статті pLSA автор Томас Гофман провів паралель між структурами даних pLSA та LSA, яку я хотів би обговорити з вами. Фон: Здійснюючи натхнення для отримання інформації, припустимо, у нас є колекція документів та словниковий запас термінівNNND={d1,d2,....,dN}D={d1,d2,....,dN}D = \lbrace d_1, d_2, ...., d_N \rbraceMMMΩ={ω1,ω2,...,ωM}Ω={ω1,ω2,...,ωM}\Omega = \lbrace \omega_1, \omega_2, ..., …

5
Чи допомагає попереднє кластерування побудувати кращу модель прогнозування?
Для завдання моделювання збивання я розглядав: Обчисліть k кластери для даних Побудуйте k моделі для кожного кластеру окремо. Обґрунтуванням цього є те, що немає чого доводити, що популяція субрибелів є однорідною, тому розумно вважати, що процес генерації даних може бути різним для різних "груп" Моє запитання, чи це відповідний метод? …

2
Припущення про залежність Бенджаміні-Хохберга виправдані?
У мене є набір даних, де я перевіряю на значні відмінності між трьома сукупностями щодо приблизно 50 різних змінних. Я роблю це, використовуючи тести Крускала-Уолліса, з одного боку, і тести співвідношення ймовірності вкладеної моделі GLM (з і без сукупності як незалежної змінної), з іншого. Як результат, у мене є список …

2
Скасовані змінні в PCA або факторному аналізі
Я хочу зробити аналіз основних компонентів (факторний аналіз) на SPSS на основі 22 змінних. Однак деякі мої змінні дуже перекошені (косості, обчислені за SPSS, коливаються в межах 2–80!). Тож ось мої запитання: Чи слід тримати подібні змінні чи можу перетворити змінні на аналіз основних компонентів? Якщо так, то як би …

4
Як побудувати графік 20 років щоденних даних у часових рядах
У мене є такий набір даних: https://dl.dropbox.com/u/22681355/ORACLE.csv, і я хотів би побудувати щоденні зміни у "Відкрити" на "Дата", тому я зробив наступне: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") і я отримую наступне: Зараз це, очевидно, не найприємніший сюжет коли-небудь, тому мені цікаво, який правильний метод використовувати при побудові таких …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.