Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Як ви обчислюєте очікування ?
Якщо розподілено експоненціально з параметром і взаємно незалежні, яке очікуванняXiXiX_i(i=1,...,n)(i=1,...,n)(i=1,...,n)λλ\lambdaXiXiX_i (∑i=1nXi)2(∑i=1nXi)2 \left(\sum_{i=1}^n {X_i} \right)^2 з точки зору та та, можливо, інших констант?nnnλλ\lambda Примітка. Це питання отримало математичну відповідь на /math//q/12068/4051 . Читачі теж поглянули б на це.

3
Як використовувати статистику CDF та PDF для аналізу
Це може бути надто загальним питанням, але я сподіваюся, що тут я можу знайти допомогу. Я розпочинаю роботу в університеті, і моя тема буде пов'язана з аналізом інтернет-трафіку. Я досить новачок у світі аналізу, але, мабуть, у світі досліджень це те, що мені потрібно зробити багато. Я розглядав декілька робіт, …


1
Оновлення ласо підходило до нових спостережень
Я підганяю L1-регульовану лінійну регресію до дуже великого набору даних (з n >> p.) Змінні відомі заздалегідь, але спостереження надходять невеликими шматками. Я хотів би підтримувати придатність ласо після кожного шматка. Я, очевидно, можу перевстановити всю модель, побачивши кожен новий набір спостережень. Однак це було б досить неефективно, враховуючи, що …
12 regression  lasso 

5
Краща класифікація за замовчуванням при логістичній регресії
Повне розкриття: це домашнє завдання. Я включив посилання на набір даних ( http://www.bertelsen.ca/R/logistic-regression.sav ) Моя мета - максимально спрогнозувати неплатників кредитів у цьому наборі даних. Кожна модель, яку я придумав поки що, передбачає> 90% неплатників, але <40% неплатників, що робить ефективність класифікації загальною ~ 80%. Отже, мені цікаво, чи існують …
12 r  logistic  spss  self-study 

3
Перевірка анкет
Я розробляю анкету для моєї дисертації. Я в процесі перевірки анкети я застосував альфа-тест Кронбаха до початкової групи вибірки. Відповіді на анкету - за шкалою Лікерта; чи може хтось запропонувати будь-які подальші тести, які допоможуть перевірити його достовірність. Я не є експертом зі статистики, тому будь-яка допомога буде вдячна. Я …

2
Аналіз предмета для R-новачка
Я намагаюся оцінити тест з вибором у багато предметів. Я хочу виконати аналіз предмета, такий, який можна знайти в цьому прикладі . Тому для кожного запитання я хочу значення P та співвідношення із загальною сумою та розподілом обраних варіантів. Я нічого не знаю про різні статистичні пакети програмного забезпечення там, …

3
Адаптивні оцінки щільності ядра?
Чи може хто-небудь повідомити про свій досвід роботи з адаптивним оцінювачем щільності ядра? (Є багато синонімів: адаптивний | змінної | змінної ширини, KDE | гістограма | інтерполятор ...) Змінна оцінка щільності ядра говорить, що "ми змінюємо ширину ядра в різних областях вибіркового простору. Існують два методи ..." насправді більше: сусіди …

2
Як параметризувати співвідношення двох нормально розподілених змінних або зворотну одну?
Проблема: я параметризую розподіли для використання в якості апріорів та даних у байєсівському метааналізі. Дані наводяться в літературі у вигляді підсумкової статистики, майже виключно вважається звичайно розподіленою (хоча жодна зі змінних не може бути <0, деякі - відношеннями, деякі - масовою тощо). Я натрапив на два випадки, для яких у …

4
Як застосувати метод ітеративно завищених найменших квадратів (IRLS) до моделі LASSO?
Я запрограмував логістичну регресію за допомогою алгоритму IRLS . Я хотів би застосувати санкцію LASSO для автоматичного вибору потрібних функцій. При кожній ітерації вирішується наступне: (XTWX)δβ^=XT(y−p)(XTWX)δβ^=XT(y−p)\mathbf{\left(X^TWX\right) \delta\hat\beta=X^T\left(y-p\right)} Нехай - невід'ємне дійсне число. Я не караю перехоплення, як пропонується в "Елементах". Статистичне навчання . Дітто для вже нульових коефіцієнтів. В іншому …

2
Параметричний розрахунок розміру вибірки та непараметричний аналіз
Мені цікаво дізнатись, чи є у когось конкретна довідка (текст чи стаття в журналі), щоб підтримати загальну практику в медичній літературі щодо обчислення розміру вибірки з використанням параметричних методів (тобто при умові нормального розподілу та певної дисперсії вимірювань) коли аналіз результату первинного випробування буде здійснено за допомогою непараметричних методів. Приклад: …

5
Стандартне посилання на класичну математичну статистику?
Чи може хтось порекомендувати деякі книги, які вважаються стандартними посиланнями на класичну (частоту) статистику? IE, досить вичерпний, а також деякий час існував, щоб помилки друку і помилок у формулах мали шанс перевірити та виправити

3
Методи поводження з неповними / відсутніми даними
Моє питання спрямоване на методи боротьби з неповними даними під час навчання класифікатора / моделі / підгонки. Наприклад, у наборі даних із кількома сотнями рядків, у кожному рядку якого, скажімо, п'ять вимірів та мітка класу як останній елемент, більшість точок даних виглядатиме так: [0,74, 0,39, 0,14, 0,33, 0,34, 0] Деякі …


3
Чи можете ви пояснити, чому статистична прив'язка не наївно відхиляється, коли ?
Мені потрібна допомога з поясненням та цитуванням базових текстів статистичних статей, статей чи інших посилань, чому взагалі невірно використовувати статистичні похибки (МНС), повідомлені при опитуванні, для наївного оголошення статистичної межі. Приклад: Кандидат А веде кандидата B у опитуванні, відсотків, відхилення від помилки для опитаних виборців.4,5 % 50039 - 3139−3139 - …
12 polling 

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.