Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чи неправильно використовувати ANOVA замість t-тесту для порівняння двох засобів?
У мене розподіл зарплат і я хочу порівняти різницю в засобах для чоловіків і жінок. Я знаю, що є студентський тест для порівняння двох засобів, але після того, як запропонував ANOVA, я отримав певну критику, сказавши, що ANOVA - це порівняння більш ніж двох засобів. Що (якщо що-небудь) не так …

3
Чи варто використовувати офсет для мого Poisson GLM?
Я провожу дослідження, щоб вивчити відмінності в щільності риб та багатстві видів риб при використанні двох різних підводних методів візуального перепису. Мої дані спочатку підраховували дані, але зазвичай це змінюється на щільність риби, але я все ж вирішив використовувати Poisson GLM, що, я сподіваюся, правильно. model1 <- glm(g_den ~ method …

2
Інкрементальне навчання класифікаційним моделям в R
Припустимо, у мене є класифікатор (це може бути будь-який із стандартних класифікаторів, як дерево рішень, випадковий ліс, логістична регресія ... тощо) для виявлення шахрайства за допомогою наведеного нижче коду library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a …

2
Чи є лінійна лінійна регресія в 3 вимірах площиною, яка найкраще підходить, або лінія, що найкраще підходить?
Наш професор не потрапляє в математику чи навіть геометричне зображення множинної лінійної регресії, і це мене трохи збентежило. З одного боку, це все ще називається множинною лінійною регресією, навіть у більш високих розмірах. З іншого боку, якщо ми, наприклад , Y = B 0 + B 1 X 1 + …

2
Різниця в відмінностях від даних окремих панелей рівня
Який правильний спосіб визначити різницю в різницькій моделі з даними окремих панелей рівня? Ось така настройка: Припустимо, що дані панелей на індивідуальному рівні вбудовуються у містах протягом декількох років, і лікування залежить від рівня міста. Формально, нехай буде результатом індивідуального в місті і рік і є фіктивною чи заходи ураженого …

1
Як інтерпретувати результати TBATS моделі та діагностику моделі
Я отримав дані про півгодинну попит, що є багатосезонним часовим рядом. Я використовував tbatsв forecastпакеті в R, і отримав результати , як це: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) Чи означає це, що в ряді необов’язково використовувати перетворення Box-Cox, а термін помилки - ARMA (5, 4), а терміни 6, 6 …

2
методи машинного навчання для поздовжніх даних
Мені було цікаво, чи існують якісь методи машинного навчання (без нагляду) для моделювання поздовжніх даних? Я завжди використовував моделі змішаних ефектів (переважно нелінійні), але мені було цікаво, чи існують інші способи цього (за допомогою машинного навчання). Під машинним навчанням я маю на увазі випадковий ліс, класифікацію / кластеризацію, дерева рішень …

1
Коли я повинен перестати шукати модель?
Я шукаю модель між запасами енергії та погодою. У мене є ціна MWatt, куплена між країнами Європи, і багато цінності погоди (файли Grib). Кожні години протягом 5 років (2011-2015). Ціна / добу Це на день протягом одного року. Я маю це за годину протягом 5 років. Приклад погоди 3Dscatterplot, у …

4
Хороші приклади / книги / ресурси, щоб дізнатися про прикладне машинне навчання (не лише про саму ML)
Раніше я брав курс з МЛ, але тепер, коли я працюю з проектами, пов’язаними з МЛ, на моїй роботі я дуже намагаюся реально застосувати його. Я впевнений, що речі, якими я займаюся, були досліджені / вирішені раніше, але я не можу знайти конкретні теми. Усі приклади машинного навчання, які я …

1
Що пояснює приклад того, чому нормалізацію партії потрібно робити з обережністю?
Я читав документ про нормалізацію партії [1], і в ній був один розділ, де йдеться про приклад, намагаючись показати, чому нормалізацію потрібно робити обережно. Я, чесно кажучи, не можу зрозуміти, як працює приклад, і мені справді дуже цікаво зрозуміти, що вони створюють папір, наскільки я можу. Спочатку дозвольте це процитувати …

4
Нейронна мережа - значення ваг
Я використовую передачу NN. Я розумію концепцію, але моє питання стосується ваг. Як ви можете їх інтерпретувати, тобто що вони представляють, або як вони можуть бути знятими (що стосується просто коефіцієнтів функції)? Я знайшов щось, що називається "простір ваг", але я не зовсім впевнений, що це означає.

2
Чи пов'язані залишкові мережі з підвищенням градієнта?
Нещодавно ми побачили появу Залишкової Нейронної Мережі, де кожен шар складається з обчислювального модуля та з'єднання, що зберігає вхід до шару, такого як вихід i-го шару демонструє: Мережа дозволяє витягнути залишкові характеристики та дозволяє отримати більш глибоку глибину, в той час як бути більш надійною до зникаючої градієнтної проблеми, досягаючи …

2
Перехресне підтвердження після LASSO у складних даних опитування
Я намагаюся зробити вибір моделей на деяких прогнозованих кандидатах, використовуючи LASSO з постійним результатом. Мета полягає у виборі оптимальної моделі з найкращою продуктивністю прогнозування, що зазвичай може бути виконано перехресним перевіркою K-кратного результату після отримання шляху рішення параметрів настройки від LASSO. Проблема тут полягає в тому, що дані походять із …

2
Інтерпретація моделювання усереднення результатів у R
Я намагаюся зрозуміти і знати, про що потрібно повідомити з мого аналізу деяких даних за допомогою усереднення моделі в Р. Я використовую такий сценарій для аналізу ефекту методу вимірювання над заданою змінною: Ось набір даних: https://www.dropbox.com/s/u9un273gzw9o30u/VMT4.csv?dl=0 Модель, що підлягає встановленню: LM.1 <- gls(VMTf ~ turn+sex+method, na.action="na.fail", method = "ML",VMT4) екскаватор …

1
Різниця між ElasticNet у науковому навчальному Python та Glmnet в R
Хто-небудь намагався перевірити, чи встановлення моделі Elastic Net з ElasticNetнауками на Python та glmnetR в одному наборі даних дає однакові арифметичні результати? Я експериментував з багатьма комбінаціями параметрів (оскільки дві функції відрізняються за значеннями за замовчуванням, які вони передають аргументам), а також масштабування даних, але ніби нічого не створює однакову …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.