Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Відстань між двома гауссовими сумішами для оцінки кластерних рішень
Я запускаю швидке моделювання для порівняння різних методів кластеризації, і в даний час натиснув на корч, намагаючись оцінити кластерні рішення. Я знаю різні показники перевірки (багато з них знайдені у cluster.stats () в R), але я припускаю, що їх найкраще використовувати, якщо орієнтовна кількість кластерів насправді дорівнює дійсній кількості кластерів. …

1
Мотивація за кроками випадкових лісових алгоритмів
Метод, який я знайомий для побудови випадкового лісу, полягає в наступному: (від http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm ) Щоб побудувати дерево в лісі: Завантажте зразок розміру N, де N - розмір нашого навчального набору. Використовуйте цей зразок завантаження як навчальний набір для цього дерева. На кожному вузлі дерева випадковим чином виберіть m наших M …

2
Чому моделі випадкових ефектів вимагають некорельованого впливу з вхідними змінними, тоді як моделі з фіксованим ефектом дозволяють корелювати?
З Вікіпедії Існують два загальних припущення щодо індивідуального конкретного ефекту, припущення про випадкові ефекти та припущення про фіксовані ефекти. Випадкові ефекти припущення (зроблено в моделі випадкових ефектів) є те , що окремі ефекти специфічних коррелірованни з незалежним змінними. Припущення за фіксованим ефектом полягає в тому, що індивідуальний специфічний ефект корелює …

3
Сукупний / кумулятивний графік (або “Візуалізація кривої Лоренца”)
Я не знаю, як називаються такі сюжети, і тому я просто дав це питання дурною назвою. Скажімо, я маю впорядкований набір даних наступним чином 4253 4262 4270 4383 4394 4476 4635 ... Кожне число відповідає кількості повідомлень, які певний користувач внесли на веб-сайт. Я емпірично досліджую явище "нерівності участі", визначене …

2
Чому задня густина пропорційна функції ймовірності попереднього часу густини?
Згідно теореми Байєса, . Але згідно з моїм економетричним текстом, це говорить, що P ( θ | y ) ∝ P ( y | θ ) P ( θ ) . Чому це так? Я не розумію, чому P ( y ) ігнорується.П( у| θ)Р( θ ) = P( θ …

3
Питання про нормальне підтвердження рівняння
Як можна довести, що нормальні рівняння: мають один чи більше розв’язків без припущення, що X є незворотним?( XТХ) β= XТY(XTX)β=XTY(X^TX)\beta = X^TY Єдина моя здогадка - це щось спільне з узагальненим зворотним, але я повністю втрачений.
11 regression  proof 

1
Як передбачити нові дані за допомогою сплайну / плавної регресії
Чи може хто-небудь допомогти дати концептуальне пояснення того, як робляться прогнози для нових даних при використанні гладких / сплайнів для прогнозної моделі? Наприклад, враховуючи модель, створену за gamboostдопомогою mboostпакету в R, з p-сплайнами, як робляться прогнози для нових даних? Що використовується з даних про навчання? Скажіть, що є нове значення …

2
Фішер для манекенів?
Коротка версія: чи є вступ до творів Рональда Фішера (паперів та книг) про статистику, який спрямований на тих, у кого статистичні дані мало чи відсутні? Я думаю про щось на кшталт "анотованого читача Фішера", спрямованого на нестатистів. Я поясню мотивацію цього питання нижче, але попередив, що це довгодухо (я не …

1
Як LASSO відбирає серед колінеарних прогнозів?
Я шукаю інтуїтивну відповідь, чому модель GLM LASSO вибирає конкретного прогноктора з групи сильно корельованих, і чому це робить інакше, ніж вибір найкращої підмножини. З геометрії LASSO, показаної на фіг.2 в Tibshirani 1996, я припускаю думку, що LASSO вибирає предиктор з більшою дисперсією. Тепер припустимо, що я використовую найкращий вибір …

4
Статистичні тести, що містять невизначеність вимірювання
Припустимо, мені дано дві групи вимірювань маси (у мг), які називаються y1 та y2. Я хочу зробити тест, щоб визначити, чи брали два зразки з популяцій різними способами. Щось подібне, наприклад (в R): y1 <- c(10.5,2.9,2.0,4.4,2.8,5.9,4.2,2.7,4.7,6.6) y2 <- c(3.8,4.3,2.8,5.0,9.3,6.0,7.6,3.8,6.8,7.9) t.test(y1,y2) Я отримую p-значення 0,3234, і при рівні значущості 0,05 не …

3
Хороші книги / папери з оцінки кредиту
Я шукаю рекомендації для книг з кредитування. Мене цікавлять усі аспекти цієї проблеми, але в основному: 1) Гарні особливості. Як їх побудувати? Які виявились хорошими? 2) Нейронні мережі. Їх застосування до проблеми скорингу кредиту. 3) Я вибрав нейронні мережі, але мене цікавлять і інші методи.

1
Поєднання двох матриць коваріації
Я обчислюю паралельно коваріацію розподілу, і мені потрібно поєднувати розподілені результати в сингулярному гауссі. Як поєднати ці два? Лінійна інтерполяція між цими двома майже працює, якщо вони однаково розподілені та розміри. Вікіпедія пропонує форуми внизу для комбінації, але це не здається правильним; два однаково розподілених розподіли повинні мати однакову коваріацію, …


2
Скільки обчислення необхідно для розуміння максимальної оцінки ймовірності?
Я намагаюся скласти план навчання для вивчення ПНЖ. Для цього я намагаюся розібратися, який мінімальний рівень обчислення, необхідний для розуміння MLE. Чи достатньо зрозуміти основи обчислення (тобто знайти мінімум та максимум функцій), щоб зрозуміти MLE?

2
Зважування балів схильності при аналізі Кокса та коваріату
Щодо зважування балів схильності (IPTW) під час моделювання пропорційного ризику Кокса даних про виживання часу до події: У мене є потенційні дані реєстру, де нам цікаво переглянути ефект від лікування ліками, які в більшості випадків пацієнти вже приймали на початковому рівні. Тому я не впевнений, як найкраще проаналізувати дані. Потенційно, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.