Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Інтервали довіри, коли розмір вибірки дуже великий
Моє запитання можна переосмислити як "як оцінити помилку вибірки за допомогою великих даних", особливо для публікації журналу. Ось приклад для ілюстрації виклику. З дуже великого набору даних (> 100000 унікальних пацієнтів та їх призначених ліків із 100 лікарень) я зацікавився оцінити частку пацієнтів, які приймають конкретний препарат. Отримати цю пропорцію …

1
Чому моделі змішаних ефектів вирішують залежність?
Скажіть, нас цікавить, як на оцінку студентських іспитів впливає кількість годин, які вивчають ці студенти. Щоб дослідити цей взаємозв'язок, ми могли б запустити таку лінійну регресію: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i Але якщо ми відіб’ємо учнів з кількох різних шкіл, ми можемо очікувати, що учні …

1
Чому додавання ефекту відставання означає середнє відхилення в ієрархічній моделі Баєса?
Передумови: Зараз я виконую деяку роботу, порівнюючи різні ієрархічні моделі Баєса. Дані це числові показники добробуту для учасника i та часу j . У мене близько 1000 учасників і від 5 до 10 спостережень на кожного учасника.уi jуijy_{ij}iiijjj Як і у більшості поздовжніх наборів даних, я очікую побачити певну форму …

1
Різниця між логістичною регресією та підтримуючими векторними машинами?
Я знаю, що при логістичній регресії виявляється гіперплан, який розділяє навчальні зразки. Я також знаю, що векторні машини підтримки знаходять гіперплан з максимальним запасом. Моє запитання: чи різниця між логістичною регресією (LR) та машинами підтримки вектора (SVM) полягає в тому, що LR виявляє будь-яку гіперплану, яка розділяє навчальні зразки, тоді …

2
GLM: перевірка вибору функції розподілу та зв'язку
У мене є узагальнена лінійна модель, яка приймає функцію Гауссова розподілу та зв'язку каналів. Після встановлення моделі я перевіряю залишки: графік QQ, залишки проти передбачуваних значень, гістограма залишків (визнаючи, що необхідна обережність). Все виглядає добре. Це, мабуть, говорить про те, що вибір гауссового розподілу був досить розумним. Або, принаймні, що …

2
Різні результати від randomForest за допомогою карети та базового пакету randomForest
Я трохи розгублений: як результати тренованої моделі за допомогою карети можуть відрізнятися від моделі в оригінальній упаковці? Читаю, чи потрібна попередня обробка перед прогнозуванням за допомогою FinalModel of RandomForest з пакетом caret?але я тут не використовую жодної попередньої обробки. Я навчав різні випадкові ліси, використовуючи пакет карет і налаштовуючи різні …

1
Коли ми використовуємо бідні та медіальні, а не квантові та медіанні?
Я не можу знайти дефіцитні або медіальні визначення у Вікіпедії або Вольфрам Матсвіту, але наступне пояснення дано у Білкові, Д. та Мала, І. (2012), " Застосування методу L-моменту при моделюванні розподілу доходу. в Чехії », Австрійський журнал статистики , 41 (2), 125–132. Медіальна - це значення (зразка) тканини так само, …

1
Те ж саме, різна варіація
Припустимо, у вас є вісім бігунів, які бігають з гонки; Розподіл їх індивідуального часу запуску є нормальним, і, наприклад, кожен має середнє значення 111111 секунд Стандартне відхилення бігуна один - найменший, два другий найменший, третій найменший тощо, і вісім найбільший. Двоє запитань мене бентежать: (1) Яка ймовірність, коли перший б’є …

1
Чи є якась різниця між тренуванням штабельного автокодера та двошарової нейронної мережі?
Скажімо, я пишу алгоритм для побудови двошарових складених автокодер та двошарової нейронної мережі. Вони однакові речі чи різниця? Що я розумію, це те, що коли я будую складений автокодер, я буду будувати пошарово. Для нейронної мережі я би ініціалізував усі параметри в мережі, а потім для кожної точки даних я …

1
Від досвіду (коефіцієнтів) до коефіцієнта коефіцієнта та їх інтерпретації в логістичній регресії з факторами
Я провів лінійну регресію прийому до коледжу на основі балів SAT та сімейного / етнічного походження. Дані вигадані. Це продовження попереднього запитання, вже відповіді. Питання фокусується на збиранні та інтерпретації коефіцієнтів шансів, залишаючи бали SAT осторонь простоти. Змінні: Accepted(0 або 1) та Background("червоний" чи "синій"). Я налаштував дані, щоб люди …
14 r  regression  logistic 

2
Діріхле Процеси кластеризації: як поводитися з мітками?
Питання: Який стандартний спосіб кластеризації даних за допомогою процесу Діріхле? При використанні Gibbs зразки кластерів з’являються і зникають під час вибірки. Крім того, у нас є проблема ідентифікації, оскільки задній розподіл є інваріантним відношенням кластерів. Таким чином, ми не можемо сказати, що це кластер користувача, а скоріше, що два користувачі …

2
Кращі запропоновані підручники про перекомпонування Bootstrap?
Я просто хотів запитати, які, на вашу думку, найкращі доступні книги про завантажувальну службу там. Під цим я не обов'язково маю на увазі лише той, який написали його розробники. Скажіть, будь-ласка, який підручник, на вашу думку, найкращий для завантажувального програмного забезпечення, який охоплює такі критерії? Філософська / гносеологічна основа методики, …

2
Питання щодо Q-навчання за допомогою нейронних мереж
Я реалізував Q-навчання, як описано в, http://web.cs.swarthmore.edu/~meeden/cs81/s12/papers/MarkStevePaper.pdf Для того, щоб прибл. Q (S, A) Я використовую нейронну мережеву структуру, як описано нижче, Активація сигмоїдної Входи, кількість входів + 1 для нейронів дії (масштабування всіх входів 0-1) Виходи, один вихід. Q-значення N кількість M прихованих шарів. Метод дослідження випадковий 0 <rand …


1
Як "Основна теорія факторного аналізу" застосовується до PCA, або як визначаються навантаження PCA?
Зараз я переживаю слайд, який я маю для "факторного аналізу" (PCA, наскільки я можу сказати). У ній виведена "фундаментальна теорема факторного аналізу", яка стверджує, що матрицю кореляції даних, що надходять в аналіз ( ), можна відновити за допомогою матриці факторних навантажень ( A ):RR\bf RAA\bf A R = A A⊤R=AA⊤\bf …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.