Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Var (X) відомо, як обчислити Var (1 / X)?
Якщо у мене є лише , як я можу обчислити ?V a r ( 1Var(X)Var(X)\mathrm{Var}(X)Var(1X)Var(1X)\mathrm{Var}(\frac{1}{X}) У мене немає ніякої інформації про розподіл , тому я не можу використовувати перетворення, або будь-які інші методи , які використовують розподіл ймовірностей .XXXXXX

1
Особливості побудови та нормалізації в машинному навчанні
Скажімо, я хочу створити логістичний класифікатор для фільму М. Моїми характеристиками буде щось на зразок віку людини, статі, професії, місця розташування. Тож навчальний набір буде чимось на кшталт: Вікова стать Професія Місце подобається (1) / Не подобається (0) 23 M Програмне забезпечення США 1 24 F Лікар Великобританії 0 і …

2
Чи існує пакет R для безперервних подовжених бінарних відповідей?
bildПакет , здається, чудовий пакет для послідовних бінарних відповідей. Але це для дискретного часу. Я хотів би вказати плавну функцію часу для з'єднання співвідношення шансів поточної відповіді Y з двійковими відповідями, виміряними в більш ранні часи, або, принаймні, першою черговою версією Маркова. Я вважаю, що це називається чергуванням логістичної регресії. …

2
Числові розв'язувачі для стохастичних диференціальних рівнянь у R: чи є?
Я шукаю загальний, чистий і швидкий (тобто, використовуючи підпрограми C ++) R для імітації шляхів з неоднорідної нелінійної дифузії типу (1) за допомогою схеми Ейлера-Маруями, схеми Мільштейна (або будь-якої іншої). Це призначено для вбудовування в більшу оціночну версію і тому заслуговує на оптимізацію. гХт= f( θ , t , Xт)гt …

1
Чи потрібне центрування під час завантаження вибірки?
Читаючи про те, як наблизити розподіл середньої вибірки, я натрапив на непараметричний метод завантаження. Мабуть, можна наблизити розподіл до розподілу ˉ X ∗ n - ˉ X n , де ˉ X ∗ n позначає середнє значення вибірки завантажувального зразка.Х¯н- мкX¯n−μ\bar{X}_n-\muХ¯∗н- X¯нX¯n∗−X¯n\bar{X}_n^*-\bar{X}_nХ¯∗нX¯n∗\bar{X}_n^* Моє питання тоді: чи потрібно мені центрування? Для …

2
Якщо p> n, ласо вибирає не більше n змінних
Одним із мотивів еластичної сітки було таке обмеження LASSO: У випадку ласо вибирає не більше n змінних, перш ніж воно насичується, через характер проблеми опуклої оптимізації. Це, здається, є обмежувальною особливістю для способу вибору змінних. Більше того, ласо не є чітко визначеним, якщо обмежена на L1-норма коефіцієнтів менша за певне …

1
Проблема оптимізації
Мій друг продає моделей блендерів. Деякі з блендерів дуже прості та дешеві, інші - дуже складні та дорожчі. Його дані складаються з розрахунку на кожен місяць із цін кожного блендера (які фіксуються ним) та кількості проданих одиниць для кожної моделі. Щоб встановити якусь позначення, він знає місяцями векторами де p_ …

1
Лінійна регресія та просторово-автокореляція
Я хочу передбачити висоту дерева в певній області, використовуючи деякі змінні, отримані за допомогою дистанційного зондування. Як приблизна біомаса тощо. Спочатку я хочу використовувати лінійну регресію (я знаю, що це не найкраща ідея, але це необхідний крок для мого проекту). Мені хотілося знати, як погано може впливати на нього просторова …

1
Чи є завантажувальний метод правильним методом оцінки невизначеності медіанної оцінки?
Бутстрапінг працює добре, щоб отримати доступ до невизначеності в середній оцінці, проте я пам’ятаю, що читати де-небудь завантажувальний треп не допомагає в оцінці невизначеності в кількісних оцінках (особливо медіані). Я не пам’ятаю, де я це читав, і не міг багато чого знайти при швидкому пошуку в Google. Думки щодо цього …

1
Очікуване значення та дисперсія функції сліду
Для випадкових змінних та позитивної напіввизначеної матриці A : Чи є спрощене вираження для очікуваного значення, E [ T r ( X T A X ) ] та дисперсії, V a r [ T r ( X T А X ) ] ? Зверніть увагу, що A не є випадковою …

5
Відповідні методи кластеризації тимчасових даних?
У мене є тимчасові дані про частоти активності. Я хочу визначити кластери в даних, які вказують на різні періоди часу з подібними рівнями активності. В ідеалі я хочу визначити кластери, не вказуючи апріори кількість кластерів. Які підходять методи кластеризації? Якщо моє запитання не містить достатньо інформації для відповіді, які відомості …

1
Виведення негентропії. Застрягаючи
Отже, це питання дещо пов'язане, але я наполегливо намагався зробити це максимально відвертим. Мета: Коротше кажучи, існує виведення негентропії, яка не передбачає кумулянтів вищого порядку, і я намагаюся зрозуміти, як це було отримано. Довідка: (я все це розумію) Я самостійно вивчаю книгу «Незалежний аналіз компонентів» , яку знайшов тут. (Це …

3
Стандартний показник хрусткості?
У мене дуже багато даних, і я хочу зробити щось, що здається дуже простим. У цьому великому наборі даних мене цікавить, скільки конкретний елемент злипається. Скажімо, мої дані - це впорядкований набір таким чином: {A, C, B, D, A, Z, T, C ...}. Скажімо, я хочу знати, чи прагнуть A …

3
Чи дійсно компоненти PCA представляють відсоток дисперсії? Чи можуть вони становити більше 100%?
"Машинне навчання хакерам" О'Рейлі говорить, що кожен головний компонент становить відсоток дисперсії. Я цитував відповідну частину сторінки нижче (глава 8, с.207). Розмовляючи з іншим експертом, вони погодилися, що це відсоток. Однак 24 компоненти складають 133.2095%. Як це може бути? Переконавшись у тому, що ми можемо використовувати PCA, як це робити …
13 r  pca 

5
Оцінка відсотків як залежної змінної в регресії
У мене відсоткові відсотки студентів на 38 іспитах є залежною змінною в моєму дослідженні. Відсотковий відсоток обчислюється (рангом / кількістю студентів на іспиті). Ця залежна змінна має майже рівномірний розподіл, і я хочу оцінити вплив деяких змінних на залежну змінну. Який підхід регресії я використовую?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.