Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Розуміння обчислень кореляції відстаней
Наскільки я зрозумів, кореляція відстані є надійним і універсальним способом перевірити, чи існує зв’язок між двома числовими змінними. Наприклад, якщо у нас є набір пар чисел: (x1, y1) (x2, y2) ... (xn, yn) ми можемо використовувати кореляцію відстані, щоб перевірити, чи існує якесь (не обов'язково лінійне) відношення між двома змінними …

2
Висока дисперсія перехресної валідації "відхилення"
Я знов і знов читав, що перехресне підтвердження "Вихід-один-вихід" має велику дисперсію через велике перекриття тренувальних складок. Однак я не розумію, чому це так: чи не повинно виконання крос-валідації бути дуже стабільним (низька дисперсія) саме тому, що навчальні набори майже однакові? Або я взагалі неправильно розумію поняття "дисперсія"? Я також …

3
Чи може модель для негативних даних із збіганням нулів (Tweedie GLM, нульовий надутий GLM тощо) передбачити точні нулі?
Розподіл Tweedie може моделювати скошені дані з точковою масою в нулі, коли параметр (показник у співвідношенні середня дисперсія) знаходиться між 1 і 2.ppp Аналогічно, надута з нуля (будь-то безперервна чи дискретна) модель може мати велику кількість нулів. У мене виникають проблеми з розумінням того, що це так, що коли я …

2
Який зв’язок між ланцюгом Маркова та ланцюгом Маркова monte carlo
Я намагаюся зрозуміти ланцюги Маркова за допомогою SAS. Я розумію, що процес Маркова - це той, де майбутній стан залежить лише від поточного стану, а не від минулого стану, і є матриця переходу, яка фіксує ймовірність переходу з одного стану в інший. Але потім я натрапив на цей термін: Марківський …

5
Ядро SVM: Я хочу інтуїтивно зрозуміти відображення у просторі більш високого розміру, і як це робить можливим лінійне розділення
Я намагаюся зрозуміти інтуїцію, що стоїть за SVM ядра. Тепер я розумію, як працює лінійна SVM, завдяки якій приймається лінія рішення, яка розбиває дані якнайкраще. Я також розумію принцип переносу даних у простор більш високого розміру, і як це може полегшити пошук лінійної лінії рішення у цьому новому просторі. Я …

1
значення різниці між двома підрахунками
Чи є спосіб визначити, чи різниця між кількістю дорожньо-транспортних пригод за часом 1 значно відрізняється від підрахунку часу 2? Я знайшов різні методи визначення різниці між групами спостережень у різний час (наприклад, порівняння засобів Пуассона), але не для порівняння лише двох показників. Або невірно навіть намагатися? Будь-яка порада чи вказівка …

1
У мене лінійка найкраще підходить. Мені потрібні точки даних, які не змінять мою лінію найкращим чином
Я веду презентацію про примірні лінії. У мене проста лінійна функція, y=1x+by=1x+by=1x+b . Я намагаюся отримати розрізнені точки даних, які я можу розмістити в діаграмі розкидання, що дозволить моїй лінії найкраще відповідати тому ж рівнянню. Я хотів би вивчити цю техніку або в R, або в Excel - залежно від …

2
Яке інтуїтивне значення стоїть за випадковою змінною, що визначається як "решітка"?
У теорії ймовірностей негативну випадкову величину ХXX називають решіткою, якщо існує г≥ 0d≥0d \geq 0 така, що ∑∞n = 0П( X= n d) = 1∑н=0∞П(Х=нг)=1\sum_{n=0}^{\infty}P(X=nd) = 1 . Чи існує геометричне тлумачення, чому це визначення називається решіткою?

1
Що робити, якщо висока точність перевірки, але низька точність тестування в дослідженні?
У мене є конкретне питання щодо валідації в дослідженні машинного навчання. Як ми знаємо, режим машинного навчання просить дослідників підготувати свої моделі на навчальних даних, вибирати з кандидатських моделей за допомогою набору перевірок та повідомляти про точність на тестовому наборі. У дуже жорсткому дослідженні тестовий набір можна використовувати лише один …

3
Сплайнс проти Гауссової регресії процесу
Мені відомо, що Гауссова процесова регресія (GPR) - це альтернатива використанню сплайнів для встановлення гнучких нелінійних моделей. Мені хотілося б знати, в яких ситуаціях одна була б більш придатною, ніж інша, особливо в байєсівській регресії. Я вже розглядав, які переваги / недоліки використання сплайнів, згладжених сплайнів та емуляторів процесів Гаусса? …

2
Джекніф проти LOOCV
Чи дійсно є якась різниця між джек-ножем і залишити один позаперевірну перевірку? Процедура здається ідентичною, я щось пропускаю?

1
Чи є необхідна кількість дисперсії, зібрана PCA, щоб зробити пізніші аналізи?
У мене є набір даних з 11 змінними і PCA (ортогональний) було зроблено для зменшення даних. Визначивши кількість компонентів, які потрібно зберегти, для мене було видно з моїх знань про тему та графік обстеження (див. Нижче), що двох основних компонентів (ПК) було достатньо для пояснення даних, а інші компоненти були …
15 variance  pca 

1
Як CNN уникає зникаючої градієнтної проблеми
Я багато читав про нейромережі, що розвиваються, і цікавився, як вони уникають проблеми градієнта, що зникає. Я знаю, що мережі глибокої віри складають однорівневі автокодери або інші заздалегідь підготовлені неглибокі мережі, і таким чином можна уникнути цієї проблеми, але я не знаю, як цього уникнути в CNN. За даними Вікіпедії …

4
Скільки даних вам потрібно для звивистої нейронної мережі?
Якщо у мене є конволюційна нейронна мережа (CNN), яка має близько 1 000 000 параметрів, скільки тренувальних даних потрібно (припустимо, я роблю стохастичний градієнтний спуск)? Чи є якесь правило? Додаткові зауваження: Коли я виконував стохастичний градієнтний спуск (наприклад, 64 патчів за 1 ітерацію), після ~ 10000 ітерацій точність класифікатора може …

3
Вибір оптимального K для КНН
Я здійснив 5-кратне резюме, щоб вибрати оптимальний K для KNN. І здається, що чим більший K отримує, тим менша помилка ... Вибачте, у мене не було легенди, але різні кольори представляють різні випробування. Всього їх 5, і, здається, між ними мало варіацій. Помилка завжди здається зменшуватися, коли K стає більше. …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.