Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Чому дослідники економіки використовують лінійну регресію для бінарних змінних відповідей?
Останнім часом мені довелося прочитати кілька робіт з економіки (сфера, з якою я не надто знайомий). Одне, що я помітив, - це те, що навіть коли змінна відповідь є бінарною, лінійні регресійні моделі, встановлені за допомогою OLS, є всюдисущими. Моє питання, таким чином: Чому перевагу надає лінійна регресія, наприклад, логістична …

1
Чому ln [E (x)]> E [ln (x)]?
Ми маємо справу з лонормальним розподілом у курсах фінансів, і в моєму підручнику просто зазначено, що це правда, що мені здається неприємним, оскільки мій математичний фон не дуже сильний, але я хочу, щоб інтуїція. Хтось може мені показати, чому це так?

1
Еквівалентність (0 + фактор | група) та (1 | група) + (1 | група: фактор) специфікацій випадкових ефектів у разі симетрії сполуки
Дуглас Бейтс зазначає, що наступні моделі є еквівалентом "якщо матриця коваріації дисперсії для випадкових ефектів, що оцінюються за вектором, має спеціальну форму, що називається складовою симетрією" ( слайд 91 у цій презентації ): m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor + (1|group) …

3
Що сталося зі статистичною значимістю в регресії, коли розмір даних гігантський?
Я читав це запитання щодо широкомасштабної регресії ( посилання ), де Віктор зазначив цікавий момент: "Практично будь-який статистичний тест, який ви проводите, буде настільки потужним, що майже впевнено визначити" суттєвий "ефект. Вам потрібно значно більше зосередитися на статистичній важливості, наприклад, на розмірі ефекту, а не на значущості". --- блуд Мені …


2
Оптимізація та машинне навчання
Мені хотілося знати, наскільки машинне навчання вимагає оптимізації. З того, що я чув, статистика є важливою математичною темою для людей, які працюють з машинним навчанням. Так само, наскільки важливо, щоб хтось, хто працює з машинним навчанням, дізнався про опуклу або невипуклу оптимізацію?

1
Використання iloc для встановлення значень [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 2 роки тому . Цей рядок повертає перші 4 рядки в кадрі даних combinedдляfeature_a combined.iloc[0:4]["feature_a"] Як очікувалося, наступний рядок повертає 2-й, 4-й та 16-й рядки в …
13 python  pandas 

8
Опитування: чи є 25% великого представника бази користувачів?
В даний час мій роботодавець проводить опитування компанії про ставлення до офісу, тобто про почуття. У минулому вони відкрили опитування для всіх напрямків бізнесу (припустимо, 10 дуже різних відділів) та всіх працівників у них (Припустимо, загалом 1000 працівників у всій компанії) Кількість працівників у кожному відділі не однакова і одна …

2
Я не розумію дисперсію двочлена
Я дуже глум, навіть задаючи таке основне питання, але ось що: Якщо у мене є випадкова величина яка може приймати значення і , з і , то якщо я витягу з неї вибірок, я отримаю біноміальний розподіл.XXX000111P(X=1)=pP(X=1)=pP(X=1) = pP(X=0)=1−pP(X=0)=1−pP(X=0) = 1-pnnn Середнє значення розподілу - μ=np=E(X)μ=np=E(X)\mu = np = E(X) …

1
Якщо
Я натрапив на доказ одного з властивостей моделі ARCH, який говорить про те, що якщо , то { X t } є нерухомим iff ∑ p i = 1 b i &lt; 1, де модель ARCH:Е ( X2т) &lt; ∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty{ Xт}{Xt}\{X_t\}∑pi = 1бi&lt; 1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 Хт= σтϵтXt=σtϵtX_t …

3
Звідки бета-розподіл?
Як я впевнений, всі тут уже знають, PDF-файл дистрибутива Beta X∼B(a,b)X∼B(a,b)X \sim B(a,b) надає f(x)=1B(a,b)xa−1(1−x)b−1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} Я полював всюди за поясненнями про походження цієї формули, але не можу її знайти. Кожна стаття, яку я знайшов у розповсюдженні бета-версії, начебто дає цю формулу, ілюструє кілька її форм, а потім переходимо …

4
Норми
норма є унікальною (принаймні частково) , тому що знаходиться на кордоні між неопуклі і опуклі. норма є «найбільш розрідженим» опукла норма (правда?). p = 1 L 1L1L1L_1p=1p=1p=1L1L1L_1 Я розумію, що норма Евкліда має коріння в геометрії, і вона має чітку інтерпретацію, коли розміри мають однакові одиниці. Але я не розумію, …

4
Чи варто турбуватися про мультиколінеарність при використанні нелінійних моделей?
Скажімо, у нас є проблема бінарної класифікації з переважно категоричними ознаками. Ми використовуємо деяку нелінійну модель (наприклад, XGBoost або Random Forests), щоб дізнатися її. Чи варто все-таки турбуватися про багатоколірність? Чому? Якщо відповідь на вищезазначене відповідає дійсності, як з цим боротися, враховуючи, що використовуються ці типи нелінійних моделей?

2
Нейрові мережі: одночасна змінна переважна безперервна?
У мене є вихідні дані, які містять близько 20 стовпців (20 функцій). Десять із них - це суцільні дані, 10 з них - категоричні. Деякі з категоричних даних можуть мати приблизно 50 різних значень (США). Після того як я попередньо обробляла дані, 10 безперервних стовпців стають 10 підготовленими стовпцями, а …

4
У лінійній регресії чому змінна відповіді повинна бути безперервною?
Я знаю, що в лінійній регресії змінна відповідь повинна бути безперервною, але чому це так? Я не можу знайти щось в Інтернеті, що пояснює, чому я не можу використовувати дискретні дані для змінної відповіді.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.