Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чому важливо включити термін корекції зміщення для оптимізатора Адама для глибокого навчання?
Я читав про оптимізатора Адама для глибокого навчання і натрапив на таке речення у новій книзі « Глибоке навчання » Беґніо, Гудфллоу та Кортвіла: Адам включає коригування зміщення оцінок як моментів першого порядку (термін імпульсу), так і (безцентрованих) моментів другого порядку для обліку їх ініціалізації при початку. видається, що основною …

1
Як порівняти моделі на основі AIC?
У нас є дві моделі, які використовують один і той же метод для обчислення ймовірності журналу, і AIC для однієї нижче, ніж для іншої. Однак той із нижчим АПК інтерпретувати набагато складніше. У нас виникають проблеми вирішити, чи варто ввести труднощі, і ми оцінили це, використовуючи відсоткову різницю в АПК. …

2
Різниця між вибором функцій на основі "F регресії" та на основі значень
Чи порівнюють функції, використовуючи F-regressionте саме, що співвідносити функції з міткою окремо і дотримуватися значення ?R2R2R^2 Я часто бачив, як мої колеги використовують F regressionдля вибору функцій у своєму трубопроводі машинного навчання sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` Деякі, будь ласка, скажіть мені - чому це дає ті ж результати, що і лише співвідносивши …

1
Чи впливає прокляття розмірності на деякі моделі більше, ніж на інші?
Місця, які я читав про прокляття розмірності, пояснюють це в поєднанні насамперед з kNN та лінійними моделями взагалі. Я регулярно бачу найкращих рейтингів у Kaggle, використовуючи тисячі функцій на наборі даних, які навряд чи мають 100k балів даних. Вони, в основному, використовують бусте дерева та NN, серед інших. Це багато …

1
Що означає розмір VC про глибоке навчання?
У базовому машинному навчанні нас навчають наступним "правилам": a) розмір ваших даних повинен бути щонайменше в 10 разів більший за розмір VC вашого набору гіпотез. б) нейронна мережа з N з'єднаннями має розмір VC приблизно N. Отже, коли нейрональна мережа глибокого навчання має, скажімо, мільйони одиниць, чи це означає, що …

2
Чому lrtest () не відповідає anova (test = “LRT”)
Я шукав способи зробити тест на коефіцієнт ймовірності в R, щоб порівняти відповідність моделі. Спочатку я кодував це сам, потім знайшов як функцію за замовчуванням, так anova()і lrtest()в lmtestпакеті. Однак, коли я перевіряв, anova()завжди створює дещо інше значення p від інших двох, навіть якщо для параметра "test" встановлено значення "LRT". …

1
Чи може логістична регресія glmnet безпосередньо обробляти факторні (категоричні) змінні, не потребуючи фіктивних змінних? [зачинено]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 3 роки тому . Я будую логістичну регресію в R за допомогою методу LASSO з функціями cv.glmnetвибору lambdaі glmnetдля кінцевої моделі. Я вже знаю всі недоліки …

1
Зв'язок між гаммою та розподіленням у квадраті
Якщо де , тобто всі є звичайними випадковими змінними нульового значення з однаковими варіаціями, тодіY=∑i=1NX2iY=∑i=1NXi2Y=\sum_{i=1}^{N}X_i^2Xi∼N(0,σ2)Xi∼N(0,σ2)X_i \sim \mathcal{N}(0,\sigma^2)XiXiX_iY∼Γ(N2,2σ2).Y∼Γ(N2,2σ2).Y \sim \Gamma\left(\frac{N}{2},2\sigma^2\right). Я знаю , що хі-квадрат розподіл є окремим випадком гамма - розподілу, але не може отримати розподіл хі-квадрат для випадкової величини . Будь-яку допомогу, будь ласка?YYY

1
Перетворення даних на бажане середнє та стандартне відхилення
Я шукаю метод перетворення мого набору даних із його поточного середнього та стандартного відхилень до цільового середнього та цільового стандартного відхилення. В основному, я хочу зменшити / розширити дисперсію і масштабувати всі числа до середнього. Не працює два окремі лінійні перетворення, одне для стандартного відхилення, а потім середнє. Який метод …

3
Різниця у використанні нормалізованого градієнта та градієнта
У загальному налаштуванні алгоритму спуску градієнта у нас є де - поточна точка, - розмір кроку, а - градієнт оцінюється на . хn + 1= хн- η∗ gr a dя е н тхнхн+1=хн-η∗гrагiентхнx_{n+1} = x_{n} - \eta * gradient_{x_n}хнхнx_nηη\etaгr a dя е н тхнгrагiентхнgradient_{x_n}хнхнx_n Я бачив в якомусь алгоритмі, люди …

2
Що таке хороший попередній розподіл на ступінь свободи при розподілі?
Я хочу використовувати при розподілі для моделювання коротких інтервальних повернень активів у байєсовій моделі. Я хотів би оцінити обидва ступені свободи (разом з іншими параметрами в моїй моделі) для розподілу. Я знаю, що віддача активів є зовсім ненормальною, але я не знаю занадто багато того. Який відповідний, м'яко інформативний попередній …

1
logloss vs gini / auc
Я навчив дві моделі (двійкові класифікатори, використовуючи h2o AutoML), і хочу вибрати одну для використання. У мене є такі результати: model_id auc logloss logloss_train logloss_valid gini_train gini_valid DL_grid_1 0.542694 0.287469 0.092717 0.211956 0.872932 0.312975 DL_grid_2 0.543685 0.251431 0.082616 0.186196 0.900955 0.312662 і aucі loglossстовпці - це показники крос-валідації (для перехресної …

4
Як слід замовити вибір функції та оптимізацію гіперпараметрів у трубопроводі машинного навчання?
Моя мета - класифікувати сенсорні сигнали. Поняття мого рішення поки що: i) Інженерні особливості з необробленого сигналу ii) Вибір відповідних функцій за допомогою функції ReliefF та кластеризації підходу iii) Застосування NN, Random Forest та SVM Однак я захоплений дилемою. У ii) та iii) існують гіперпараметри, такі як k-Найближчі Neigbours для …

1
Що означає шар вузького місця в нейронних мережах?
Я читав папір FaceNet і в третьому пункті вступу написано: Попередні підходи до розпізнавання облич, засновані на глибоких мережах, використовують рівень класифікації, підготовлений за набором відомих ідентичностей обличчя, а потім приймають проміжний рівень вузького місця як уявлення, яке використовується для узагальнення розпізнавання поза набором ідентичностей, що використовуються в навчанні. Мені …

2
Чи можемо ми використовувати категоричну незалежну змінну в дискримінантному аналізі?
У дискримінантному аналізі залежна змінна є категоричною, але чи можу я використовувати категоричну змінну (наприклад, житловий стан: сільський, міський) разом з якоюсь іншою суцільною змінною як незалежну змінну в лінійному дискримінантному аналізі?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.