Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Навчання моделі прихованої Маркова, кілька навчальних екземплярів
Я реалізував дискретний HMM відповідно до цього підручника http://cs229.stanford.edu/section/cs229-hmm.pdf Цей підручник та інші завжди говорять про підготовку НММ із заданою послідовністю спостереження. Що відбувається, коли у мене є кілька тренувальних послідовностей? Треба просто запускати їх послідовно, навчаючи модель за іншою? Інший варіант - об'єднати послідовності в одну і тренувати на …

3
Негативно-біноміальний GLM проти перетворення журналу для даних підрахунку: підвищений показник помилок типу I
Хтось із вас, можливо, прочитав цей приємний документ: O'Hara RB, Kotze DJ (2010) Не записуйте дані про кількість перетворень. Методи екології та еволюції 1: 118–122. клацати . У моїй галузі досліджень (екотоксикологія) ми маємо справу з погано повторюваними експериментами, і ГЛМ не використовуються широко. Тому я зробив аналогічне моделювання, як …

2
Чому оптимізувати суміш Гаусса безпосередньо обчислювально важко?
Розглянемо вірогідність зрубу суміші гауссів: l(Sn;θ)=∑t=1nlogf(x(t)|θ)=∑t=1nlog{∑i=1kpif(x(t)|μ(i),σ2i)}l(Sn;θ)=∑t=1nlog⁡f(x(t)|θ)=∑t=1nlog⁡{∑i=1kpif(x(t)|μ(i),σi2)}l(S_n; \theta) = \sum^n_{t=1}\log f(x^{(t)}|\theta) = \sum^n_{t=1}\log\left\{\sum^k_{i=1}p_i f(x^{(t)}|\mu^{(i)}, \sigma^2_i)\right\} Мені було цікаво, чому обчислювально важко було максимізувати це рівняння безпосередньо? Я шукав або чітку тверду інтуїцію щодо того, чому повинно бути очевидним, що його важке, чи, можливо, більш жорстке пояснення, чому це важко. Чи ця …

1
Квадрат нормального розподілу зі специфічною дисперсією
Який розподіл квадрата звичайно розподіленої випадкової величини з ? Я знаю, є коректним аргументом для порівняння стандартного нормального розподілу, але як бути з випадком неодиничної дисперсії?Х2Х2X^2Х∼ N( 0 , σ2/ 4)Х∼N(0,σ2/4)X\sim N(0,\sigma^2/4)χ2( 1 ) = Z2χ2(1)=Z2\chi^2(1)=Z^2

1
Що саме називається "головним компонентом" в PCA?
Припустимо є вектор , який максимізує дисперсію проекції даних з конструкцією матриці .XуuuХXX Тепер я бачив матеріали, які називають (першим) основним компонентом даних, який також є власним вектором з найбільшим власним значенням.уuu Однак я також бачив, що основною складовою даних є .ХуXuX u Очевидно, і і різні речі. Хто-небудь може …

3
Як обчислити стандартні похибки коефіцієнтів логістичної регресії
Я використовую науку Python для навчання та перевірки логістичної регресії. scikit-learn повертає коефіцієнти регресії незалежних змінних, але це не забезпечує стандартних помилок коефіцієнтів. Мені потрібні ці стандартні помилки для обчислення статистики Wald для кожного коефіцієнта і, в свою чергу, порівняння цих коефіцієнтів один з одним. Я знайшов один опис, як …

1
Алгоритми кластеризації, які працюють на розріджених матрицях даних [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 5 років тому . Я намагаюся скласти список алгоритмів кластеризації, які є: Реалізовано в R Оперуйте над матричними матрицями даних (не (не) матрицями подібності), такими, які …
18 r  clustering  sparse 

9
Запит на запит: Узагальнені лінійні моделі
Я шукаю вступну книгу про середній рівень про узагальнені лінійні моделі. В ідеалі, крім теорії, що стоїть за моделями, я хотів би, щоб вона включала додатки та приклади на R чи іншій мові програмування - я чую, що SAS також є популярним вибором. Я маю намір вивчити це самостійно, і …

2
Компоненти з низькою дисперсією в PCA, чи вони справді просто шум? Чи є спосіб перевірити це?
Я намагаюся вирішити, чи буде зберігатися компонент PCA, чи ні. Існує gazillion критеріїв, заснованих на величині власного значення, описаного та порівняного, наприклад, тут чи тут . Однак у моїй заяві я знаю, що мале (est) власне значення буде малим порівняно з великим (st) власним значенням, і всі критерії, засновані на …
18 pca 


4
Як обчислити кількість функцій на основі роздільної здатності зображення?
Просто покрита нелінійна Гіпотеза Ендрю Нг з Neural Netowrks, і у нас було питання множинного вибору для визначення кількості функцій для зображення дозволу 100x100 з grescale інтенсивності. І відповідь була 50 мільйонів, х10 755510710710^7 Однак раніше для 50х50 пікселів зображення сірого масштабу. кількість функцій - 50x50 (2500) Чому це було …

9
Галерея діаграм, діаграм та типів сюжету
Що б ви порадили як всебічну галерею методів подання даних? Джерело, на яке можна звернутися, коли ви думаєте про кращі способи подання своїх даних? Я визначив наступні, але буду радий, якщо ви можете додати своє: Онлайн-галереї: http://www.mathworks.com/discovery/gallery.html http://www.idlcoyote.com/gallery/ https://developers.google.com/chart/interactive/docs/gallery?csw=1 http://www.walkingrandomly.com/?p=4788 http://en.wikipedia.org/wiki/Category:Statistic_charts_and_diagrams (не містить односторінкової графічної галереї) http://docs.ggplot2.org/current/ http://www.itl.nist.gov/div898/handbook/graphgal.htm http://scikit-learn.org/stable/auto_examples/index.html http://www.stata.com/support/faqs/graphics/gph/stata-graphs/ …

1
Як MANOVA пов'язаний з LDA?
У кількох місцях я побачив твердження, що MANOVA схожа на ANOVA плюс лінійний дискримінантний аналіз (LDA), але це завжди робилося рукою, що розмахує рукою. Я хотів би знати, що саме це має означати. Я знайшов різні підручники, що описують усі деталі обчислень MANOVA, але, здається, дуже важко знайти хорошу загальну …

1
Безкоштовний Інтернет або завантажувані ресурси для розрахунків розміру вибірки
Сьогодні я помітив це питання , і я подумав , що було б корисно , якби у нас було що - нитка перерахованих ресурси , які люди могли зручно доступ для аналізу потужності / вибірок розрахунків розміру, можливо , аналогічного цю тему: Ресурси для навчання R .

1
Кластеризовані стандартні помилки проти багаторівневого моделювання?
Я проглянув кілька книг (Рауденбуш і Брик, Сніджерс і Боскер, Гельман і Хілл та ін.) Та кілька статей (Гельман, Юсько, Примо та Якобсмієр тощо), і я все ще не дуже обертав голову основні відмінності між використанням кластеризованих стандартних помилок віршів багаторівневого моделювання. Я розумію частини, які стосуються дослідницького питання; є …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.