Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Як дізнатися, чи слід за даними після розподілу Пуассона в R?
Я студент з нижчих класів і маю проект для свого класу ймовірностей. В основному я маю набір даних про урагани, які впливали на мою країну протягом ряду років. У моїй книжці ймовірностей ("Ймовірність та статистика з R") є (не повний) приклад того, як перевірити, чи відповідають дані за розподілом Пуассона, …

3
LSA проти PCA (кластеризація документів)
Я досліджую різні методи, що використовуються в кластеризації документів, і я хотів би усунути деякі сумніви щодо PCA (аналіз основних компонентів) та LSA (латентний семантичний аналіз). Перше - які відмінності між ними? Я знаю, що в PCA розкладання SVD застосовується до терміна-коваріаційної матриці, тоді як в LSA - матриця терміна-документа. …

2
Який байєсівський еквівалент загального тесту на придатність?
У мене є два набори даних, один із набору фізичних спостережень (температур) та один із ансамблю числових моделей. Я роблю аналіз ідеальної моделі, припускаючи, що модельний ансамбль є справжньою, незалежною вибіркою, і перевіряю, чи спостереження проведені з цього розподілу. Статистику, яку я підрахував, нормалізується і теоретично повинна бути стандартним нормальним …

1
Порівняння рівнів факторів після ГЛМ в R
Ось невеличка інформація про мою ситуацію: мої дані стосуються кількості здобичі, яку з'їдає хижак. Оскільки кількість видобутку обмежена (25 доступних) у кожному випробуванні, у мене був стовпчик "Зразок", який представляє кількість доступної здобичі (так, 25 у кожному випробуванні), та інший під назвою "Порахувати", який був кількістю успіху ( скільки здобичі …

1
Яке прийнятне значення критерію Calinski & Harabasz (CH)?
Я зробив аналіз даних, намагаючись кластеризувати поздовжні дані за допомогою R та пакету kml . Мої дані містять близько 400 окремих траєкторій (як це називається у статті). Ви можете побачити мої результати на наступному малюнку: Прочитавши розділ 2.2 "Вибір оптимальної кількості кластерів" у відповідному документі, я не отримав відповідей. Я …

3
Є R життєздатним для виготовлення (розгорнутого) коду
Я прочитав ряд статей, які розповідають про такі компанії, як Google, Facebook та багато інших, які використовують R для дослідження. Інший сценарій, про який я читав, - це компанії, які використовують R для прототипування аналітичного рішення, а потім повторно реалізують його іншою мовою. Я намагаюся знайти літературу про компанії, що …
25 r  references 

5
Вступне читання про Copulas
Я вже деякий час шукаю хорошого вступного читання про Copulas для свого семінару. Я знаходжу багато матеріалів, які розповідають про теоретичні аспекти, що добре, але, перш ніж перейти до них, я прагну створити добре інтуїтивне розуміння цієї теми. Чи може хтось запропонувати якісь хороші документи, які дають добру основу для …

2
Яким чином ставки визначають ставки на спорт?
Візьмемо для прикладу футбол (футбол). Можливі 3 результати, виграти вдома, нічия, виграти в гостях. Я взяв випадкову гру від bet365 Turkey vs Ukraine hwin, draw, awin 2.20 3.40 3.20 Тож для інвестицій у розмірі 100 $ за даного результату ви втрачаєте 100 $ або виграєте: 220 $ , 340 $ …

3
Як моделювати цей непарний розподіл (майже зворотний J)
Моя залежна змінна, показана нижче, не відповідає жодному мені відомості про розподіл запасів. Лінійна регресія створює дещо ненормальні залишки з правою косою, які відносяться до передбачуваного Y незвичайним чином (2-й графік). Будь-які пропозиції щодо перетворень чи інші способи отримання найбільш вагомих результатів та найкращої точності прогнозування? Якщо можливо, я хотів …

2
Чи дійсно "Полювання на снарка" Джоела Спольського є статистичним аналізом змісту?
Якщо ви останнім часом читали бюлетені спільноти, ви, ймовірно, бачили The Hunting of Snark, публікацію в офіційному блозі StackExchange Джоела Спольського, генерального директора мережі StackExchange. Він обговорює статистичний аналіз, проведений на вибірці коментарів SE для оцінки їх "дружелюбності" з точки зору стороннього користувача. Зауваження були відібрані випадковим чином із StackOverflow, …

6
Як нейронна мережа розпізнає зображення?
Це запитання було перенесено із переповнення стека, оскільки на нього можна відповісти на перехресному підтвердженні. Мігрували 7 років тому . Я намагаюся дізнатися, як нейронна мережа працює на розпізнавання зображень. Я бачив кілька прикладів і став ще більше плутати. У прикладі розпізнавання літер зображення розміром 20x20 значення кожного пікселя стають …

3
Як виміряти плавність часового ряду в R?
Чи є хороший спосіб виміряти плавність часового ряду в R? Наприклад, -1, -0.8, -0.6, -0.4, -0.2, 0, 0.2, 0.4, 0.6, 0.8, 1.0 набагато плавніше, ніж -1, 0.8, -0.6, 0.4, -0.2, 0, 0.2, -0.4, 0.6, -0.8, 1.0 хоча вони мають однакове середнє і стандартне відхилення. Було б здорово, якщо є функція, …
25 r  time-series 


3
Інтервал довіри для відхилення за одним спостереженням
Це проблема із "7-ї студентської олімпіади ім. Колмогорова з теорії ймовірностей": Враховуючи одне спостереження від розподілу з обома параметрами невідомими, дайте довірчий інтервал для з рівнем довіри принаймні 99%.Нормальна ( μ , σ 2 ) σ 2XXXNormal(μ,σ2)Normal⁡(μ,σ2)\operatorname{Normal}(\mu,\sigma^2)σ2σ2\sigma^2 Мені здається, що це має бути неможливим. У мене є рішення, але я …

2
Порівнюючи згладжуючі сплайни та льоси для згладжування?
Я б хотів краще зрозуміти плюси / мінуси використання або лесових, або згладжуючих сплайнів для згладжування деякої кривої. Ще одна варіація мого питання полягає в тому, чи є спосіб побудувати згладжуючий сплайн таким чином, що дасть ті самі результати, що і використання льосу. Будь-яка посилання чи розуміння вітаються.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.