Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Навіщо додати одну обернену частоту документа?
У моєму підручнику перелічено idf як деlog(1+Nnt)log(1+Nnt)log(1+\frac{N}{n_t}) NNN : Кількість документів ntntn_t : Кількість документів, що містять термінttt Вікіпедія перераховує цю формулу як згладжену версію фактичного . Я розумію: він коливається від до що здається інтуїтивним. Але переходить від до що здається дивним ... Я трохи знаю про вирівнювання мовного …

3
Багаточленна логістична втрата проти (Поперечна Ентропія проти Квадратної Помилки)
Я зауважив, що Caffe (глибока рамка навчання) використовувала рівень втрат Softmax SoftmaxWithLoss як вихідний шар для більшості зразків моделі . Наскільки мені відомо, рівень втрати Softmax - це поєднання багатошарового логістичного рівня втрат та шару Softmax . З Кафе вони сказали це Розрахунок градієнта рівня втрат Softmax втрат більш чисельно …


1
Як збільшується градієнт, як градієнтний спуск?
Я читаю корисну запис у Вікіпедії щодо збільшення градієнта ( https://en.wikipedia.org/wiki/Gradient_boosting ) і намагаюся зрозуміти, як / чому ми можемо наблизити залишки найкрутішим кроком спуску (також званий псевдоградієнтом ). Чи може хтось дати мені інтуїцію щодо того, як найкрутіший спуск пов’язаний / схожий на залишки? Допомога високо оцінена!

1
Коли неправильні лінійні моделі стають надійно красивими?
Запитання: Чи неправильні лінійні моделі використовуються на практиці чи це якась цікавість, яка час від часу описується в наукових журналах? Якщо так, то в яких районах вони використовуються? Чи є інші приклади таких моделей? Нарешті, чи були б стандартні помилки, -значення, тощо, взяті з OLS для таких моделей, правильними, чи …

5
Який хороший спосіб графічного представлення дуже великої кількості парних точок даних?
У моєму полі звичайний спосіб побудувати парні дані - це серія тонких похилих відрізків ліній, перекриваючи їх медіаною та CI медіани для двох груп: Однак подібний сюжет стає набагато складнішим для читання, оскільки кількість точок даних стає дуже великою (у моєму випадку я маю порядку 10000 пар): Скорочення альфа трохи …

4
Чи змінюється розподіл ймовірностей урни, коли ви берете з неї без заміни в середньому?
Припустимо, у мене є урна, що містить N різних кольорів кульок, і кожен різний колір може з’являтися різну кількість разів (якщо є 10 червоних кульок, також не повинно бути 10 синіх кульок). Якщо ми знаємо точний вміст урни перед малюванням, ми можемо сформувати дискретний розподіл ймовірностей, який повідомляє нам про …

1
Приборкання косого… Чому так багато функцій перекосу?
Я сподіваюся отримати більше розуміння чотирьох типів перекосів у цій громаді. Типи, про які я згадую, згадуються на http://www.inside-r.org/packages/cran/e1071/docs/skewness довідковій сторінці. Старий метод не згадувався на довідковій сторінці, але я все ж включаю його. require(moments) require(e1071) x=rnorm(100) n=length(x) hist(x) ###############type=1 e1071::skewness(x,type=1) sqrt(n) * sum((x-mean(x))^3)/(sum((x - mean(x))^2)^(3/2)) #from e1071::skewness source m_r=function(x,r) …
9 skewness 

1
Альтернативи для тестування хі-квадрата на незалежність для таблиць більше 2 х 2
Які існують альтернативи тесту чи-квадрата для категоричних змінних з таблицями, розмірами яких перевищують 2 х 2 та комірки з кількістю менше 5, якщо я не хочу об’єднувати класи?


7
Якщо всі 1000 пацієнтів з тестом не вилікуються препаратом, чи не можемо ми сказати, що ми приймаємо нульову гіпотезу?
У багатьох місцях я читав, що ніколи не можна сказати, що ми «приймаємо» нульову гіпотезу. Натомість треба сказати, що ми «не спромоглися відкинути» нульову гіпотезу. Але я не бачу, як це з цим простим прикладом: припустимо, ми тестуємо препарат, який повинен повністю вилікувати діабет протягом 24 годин. Ми пробуємо це …

1
Як застосувати регресію до основних компонентів для прогнозування вихідної змінної?
Я читав про основи основного компонентного аналізу з tutorial1 , link1 і LINK2 . У мене є набір даних зі 100 змінних (включаючи вихідну змінну Y), я хочу зменшити змінні до 40 за PCA, а потім передбачити змінну Y за допомогою цих 40 змінних. Проблема 1: Після отримання основних компонентів …
9 regression  pca 

1
Оцінка багаторівневих моделей логістичної регресії
Наступна багаторівнева логістична модель з однією пояснювальною змінною на рівні 1 (індивідуальний рівень) та однією пояснювальною змінною на рівні 2 (рівень групи): logit (pi j) =π0 j+π1 jхi j… ( 1 )logit(pij)=π0j+π1jхij…(1)\text{logit}(p_{ij})=\pi_{0j}+\pi_{1j}x_{ij}\ldots (1) π0 j=γ00+γ01zj+у0 j… ( 2 )π0j=γ00+γ01zj+у0j…(2)\pi_{0j}=\gamma_{00}+\gamma_{01}z_j+u_{0j}\ldots (2) π1 j=γ10+γ11zj+у1 j… ( 3 )π1j=γ10+γ11zj+у1j…(3)\pi_{1j}=\gamma_{10}+\gamma_{11}z_j+u_{1j}\ldots (3) де, залишки на …

1
Пакет Metafor: діагностика зміщення та чутливості
Я провожу багаторівневий метааналіз, який включає деякі статті з множинними результатами. Тому я використовую цю rma.mv()функцію. Приклад коду: test.main = rma.mv(yi,vi,random = ~1|ID, data = data) У мене є два питання: Я прочитав в попередньому запиті , що при використанні rma.mv(), ranktest()не є надійним тест воронки ділянки асиметрії. Однак, якщо …

2
Чергові схеми зважування для мета-аналізу випадкових ефектів: відсутні стандартні відхилення
Я працюю над метааналізом випадкових ефектів, що охоплює ряд досліджень, які не повідомляють про стандартні відхилення; у всіх дослідженнях робиться звіт про розмір вибірки. Я не вірю, що неможливо наблизити або замінити відсутні дані SD. Як має бути мета-аналіз, який використовує необроблені (нестандартні) середні відмінності як розмір ефекту, зважився, коли …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.