Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Рівняння в новинах: Переклад багаторівневої моделі на загальну аудиторію
"Нью-Йорк Таймс" довго коментує систему оцінювання "доданої вартості" вчителів, яка використовується для надання відгуків викладачам міста Нью-Йорк. Lede - це рівняння, яке використовується для обчислення балів - подано без контексту. Здається, риторична стратегія - це залякування математикою: Повний текст статті доступний за адресою: http://www.nytimes.com/2011/03/07/education/07winerip.html Автор, Майкл Вінеріп, стверджує, що значення …

3
Чи має значення порядок пояснювальних змінних при обчисленні їх коефіцієнтів регресії?
Спочатку я думав, що порядок не має значення, але потім я прочитав про процес ортогоналізації грам-шмідта для обчислення кількох коефіцієнтів регресії, а тепер у мене є другі думки. Відповідно до процесу грам-шмідта, чим пізніше пояснювальна змінна індексується серед інших змінних, тим менший її залишковий вектор, оскільки від неї віднімаються залишкові …

7
Алгоритм динамічного моніторингу квантів
Я хочу оцінити кількість деяких даних. Дані настільки величезні, що їх неможливо розмістити в пам'яті. Дані не є статичними, нові дані продовжують надходити. Хтось знає який-небудь алгоритм для моніторингу квантових даних, що спостерігалися до цього часу, з дуже обмеженою пам'яттю та обчисленнями? Я вважаю алгоритм P2 корисним, але він не …

4
Виправлення p-значень для декількох тестів, де тести співвідносяться (генетика)
Я маю значення p з багатьох тестів і хотів би знати, чи є насправді щось важливе після виправлення для багаторазового тестування. Ускладнення: мої тести не є незалежними. Метод, про який я думаю (варіант методу продукту Фішера, Зайкін та ін., Genet Epidemiol , 2002), потребує кореляції між значеннями p. Для того, …

13
Підручники з економетрики?
Які хороші підручники з економетрики ви б рекомендували? Редагувати: там є досить багато книг, що мають різний рівень математичної витонченості. Було б добре скласти уявлення про те, наскільки технічна книга, яку ви рекомендуєте.

3
Чи категорична змінна година дня?
Чи категоричною є змінна "година дня", де значення може бути 0, 1, 2, ..., 23? Мені б сподобатися сказати "ні", оскільки 5, наприклад, "ближче" до 4 або 6, ніж до 3 або 7. З іншого боку, існує розрив між 23 і 0. Так це взагалі вважається категоричним чи ні? Зауважте, …

2
Чому працює корекція безперервності (скажімо, нормальне наближення до біноміального розподілу)?
Я хотів би краще зрозуміти, як виведена корекція безперервності до біноміального розподілу для нормального наближення. Який метод був використаний, щоб вирішити, що ми повинні додати 1/2 (чому б не інше число?). Будемо вдячні за будь-яке пояснення (або посилання на запропоноване читання, крім цього ).

1
Як обчислити інтервал прогнозування для множинної регресії OLS?
Яке алгебраїчне позначення для обчислення інтервалу передбачення для множинної регресії? Це звучить нерозумно, але у мене виникають проблеми з пошуку чіткого алгебраїчного позначення цього.

2
Як зрозуміти "нелінійне" як "нелінійне зменшення розмірності"?
Я намагаюся зрозуміти відмінності між методами зменшення лінійної розмірності (наприклад, PCA) та нелінійними (наприклад, Isomap). Я не можу повністю зрозуміти, що означає (не) лінійність у цьому контексті. Я прочитав з Вікіпедії це Для порівняння, якщо PCA (алгоритм зменшення лінійних розмірностей) використовується для зменшення цього ж набору даних на два виміри, …

2
Як у 12-му CNN Крижевського отримує 253,440 нейронів у першому шарі?
У Олексія Крижевського та ін. Класифікація Imagenet із глибокими звивистими нейронними мережами вони перераховують кількість нейронів у кожному шарі (див. Схему нижче). Вхід в мережу є 150 528-мірним, а кількість нейронів у решті шарів мережі визначається 253,440–186,624–64,896–64,896–43,264– 4096–4096–1000. 3D-перегляд Кількість нейронів для всіх шарів після першого зрозуміла. Один простий спосіб …

3
Як можна інтерпретувати матрицю плутанини Sklearn
Я використовую матрицю плутанини для перевірки працездатності мого класифікатора. Я використовую Scikit-Learn, я трохи розгублений. Як я можу інтерпретувати результат from sklearn.metrics import confusion_matrix >>> y_true = [2, 0, 2, 2, 0, 1] >>> y_pred = [0, 0, 2, 2, 0, 2] >>> confusion_matrix(y_true, y_pred) array([[2, 0, 0], [0, 0, …

4
Моделюйте рівномірний розподіл на диску
Я намагався моделювати ін'єкцію випадкових точок всередині кола, щоб будь-яка частина кола мала однакову ймовірність виникнення дефекту. Я очікував, що підрахунок на площу отриманого розподілу слід за розподілом Пуассона, якщо я розбиваю коло на прямокутники рівних площ. Оскільки для цього потрібно лише розмістити точки в межах кругової області, я ввів …

7
як представити географію чи поштовий індекс у моделі машинного навчання чи в системі рекомендацій?
Я будую модель, і я думаю, що географічне розташування, ймовірно, дуже добре спрогнозує мій цільовий змінний. У мене є поштовий індекс кожного з моїх користувачів. Я не зовсім впевнений, що найкращий спосіб включити поштовий індекс як функцію передбачувача у свою модель. Хоча поштовий індекс - це номер, він нічого не …

3
Наскільки саме рідкий PCA кращий за PCA?
Я дізнався про PCA кілька лекцій тому на уроці, і, переконуючись більше про цю захоплюючу концепцію, я дізнався про рідкісний PCA. Мені хотілося запитати, чи не помиляюсь, це таке рідкісне PCA: У PCA, якщо у вас є точок даних із змінними, ви можете представляти кожну точку даних у розмірному просторі …

2
Середня абсолютна процентна помилка (MAPE) у Scikit-learn [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для Cross Valified. Закрито 2 роки тому . Як можна обчислити середню абсолютну процентну похибку (MAPE) наших прогнозів за допомогою Python та scikit-learn? У документах у нас є лише ці …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.