Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
використання інформації про сусідів для введення даних або пошуку даних (у R)
У мене є набір даних з припущенням, що найближчі сусіди є найкращими прогнозами. Просто прекрасний приклад двостороннього візуалізації градієнта- Припустимо, у нас є випадок, коли мало значень не вистачає, ми можемо легко передбачити, виходячи з сусідів та тенденції. Відповідна матриця даних у R (макетний приклад для тренування): miss.mat <- matrix …

2
Чи є простий варіант тесту на еквівалентність тесту Колмогорова – Смірнова?
Чи було сформовано два однобічні тести на еквівалентність (TOST) для тесту Колмогорова-Смірнова для перевірки нульовістичної нульової гіпотези про те, що два розподіли відрізняються хоча б деяким рівнем, визначеним дослідником? Якщо не TOST, то якась інша форма тесту на еквівалентність? Нік Стаунер мудро зазначає, що (я вже повинен знати;) існують інші …

3
Яким критеріям необхідно відповідати, щоб зробити висновок про "ефект стелі"?
Згідно з Енциклопедією методів дослідження суспільних наук SAGE … [a] ефект стелі виникає, коли міра має чітку верхню межу для потенційних відповідей і велика концентрація балів учасників на цій межі або біля неї. Ослаблення масштабу - це методологічна проблема, яка виникає всякий раз, коли відхилення обмежуються таким чином. … Наприклад, …

3
Випадковий ліс на багаторівневих / ієрархічно структурованих даних
Я зовсім новачок у машинному навчанні, CART-техніці тощо, і я сподіваюся, що моя наївність не надто очевидна. Як Random Forest обробляє багаторівневі / ієрархічні структури даних (наприклад, коли взаємозв'язок на рівні рівнів представляє інтерес)? Тобто набори даних з одиницями аналізу на декількох ієрархічних рівнях ( наприклад , учні вкладені в …

3
Стандартне відхилення декількох вимірювань з невизначеностями
У мене є дві 2 години GPS даних зі швидкістю вибірки 1 Гц (7200 вимірювань). Дані наведені у вигляді , де - невизначеність вимірювання.N σ(X,Xσ,Y,Yσ,Z,Zσ)(X,Xσ,Y,Yσ,Z,Zσ)(X, X_\sigma, Y, Y_\sigma, Z, Z_\sigma)NσNσN_\sigma Коли я беру середнє значення всіх вимірювань (наприклад, середнє значення Z за ці дві години), яке його стандартне відхилення? Я, …

1
Як інтерпретувати навантаження PCA?
Читаючи про PCA, я натрапив на таке пояснення: Припустимо, у нас є набір даних, де кожна точка даних являє собою одиничні бали учнів у математичному тесті, фізичному тесті, тесті на читання та тесті словникового запасу. Ми знаходимо перші два основні компоненти, які фіксують 90% змінності даних та інтерпретують їх завантаження. …
13 pca 

1
Найсучасніший у дедуплікації
Які найсучасніші методи у дедуплікації записів? Дедуплікацію також іноді називають: зв'язок запису, роздільна здатність сутності, дозвіл ідентичності, злиття / очищення. Я знаю, наприклад, про CBLOCK [1]. Буду вдячний, якщо відповіді включали також посилання на існуюче програмне забезпечення, що реалізує методи. Я знаю, наприклад, що Mahout реалізує навіс-кластеризацію . Є також …

4
Чому всі відомі дистрибуції є одномодовими?
Я не знаю жодних мультимодальних розподілів. Чому всі відомі дистрибуції є одномодовими? Чи є якийсь "відомий" дистрибутив, який має більше одного режиму? Звичайно, суміші розподілів часто мультимодальні, але хотілося б знати, чи існують якісь "немішані" розподіли, які мають більше одного режиму.

2
Чому геометричний розподіл і гіпергеометричний розподіл називаються такими?
Чому геометричний розподіл та гіпергеометричний розподіл називають відповідно "геометричним" та "гіпергометричним"? Це тому, що їхні PMFS мають якусь особливу форму? Спасибі!

1
Як масштабувати нові спостереження для прогнозування, коли модель оснащувалася масштабованими даними?
Я розумію поняття масштабування матриці даних для використання в лінійній регресійній моделі. Наприклад, в R ви можете використовувати: scaled.data <- scale(data, scale=TRUE) Єдине моє запитання - як правильно оцінювати нові спостереження, для яких я хочу передбачити вихідні значення? Було б scaled.new <- (new - mean(data)) / std(data),?

1
Чому стандартна помилка перехоплення ще більше збільшується від 0?
Стандартна помилка терміна перехоплення ( ) у задається , де є середнє значення 's.у=β1х+β0+εSЕ( β 0)2=σ2[1β^0β^0\hat{\beta}_0y=β1x+β0+εy=β1x+β0+εy=\beta_1x+\beta_0+\varepsilonˉxxiSE(β^0)2=σ2[1n+x¯2∑ni=1(xi−x¯)2]SE(β^0)2=σ2[1n+x¯2∑i=1n(xi−x¯)2]SE(\hat{\beta}_0)^2 = \sigma^2\left[\frac{1}{n}+\frac{\bar{x}^2}{\sum_{i=1}^n(x_i-\bar{x})^2}\right]x¯x¯\bar{x}xixix_i Як я розумію, SE визначає вашу невизначеність - наприклад, у 95% зразків інтервал міститиме справжній . Я не розумію, як SE, міра невизначеності, збільшується за допомогою . Якщо я просто зміщу свої …

3
Трансформація надзвичайно перекошених розподілів
Припустимо, що у мене є змінна, розподіл якої перекоситься позитивно на дуже високий ступінь, така що взяття журналу буде недостатньо для того, щоб привести його в діапазон косості для нормального розподілу. Які мої варіанти на даний момент? Що я можу зробити, щоб перетворити змінну в нормальний розподіл?

3
Покрокова реалізація PCA в R за допомогою підручника Ліндсі Сміт
Я працюю в R через чудовий підручник з PCA Ліндсей І Сміт, і я застрягаю на останній стадії. Сценарій R нижче приводить нас до етапу (на с. 19), де реконструюються оригінальні дані (головного компонента в цьому випадку), який повинен отримати прямий графік уздовж осі PCA1 (враховуючи, що дані має лише …
13 r  pca 

1
Геометрична інтерпретація узагальненої лінійної моделі
Для лінійної моделі , ми можемо мати хорошу геометричну інтерпретацію розрахункової моделі з допомогою МНК: у = х & beta ; + е . У є проекцією у на простір , натягнуте на х і залишкової е перпендикулярна це простір , натягнуте на х.у= x β+ еy=xβ+ey=x\beta+eу^= x β^+ е^y^=xβ^+e^\hat{y}=x\hat{\beta}+\hat{e}у^y^\hat{y}е^e^\hat{e} …

3
Як перевірити, чи відрізняються два (ненормальні) розподіли?
Я читав про t-тест Стьюдента, але, здається, він працює, коли можна припустити, що оригінальні дистрибутиви зазвичай розподіляються. У моєму випадку їх точно немає. Крім того, якщо у мене є 13 розподілів, чи потрібно робити 13^2тести?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.