Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
"Найсильніший пароль"
У мене є додаток, захищений чотиризначним PIN-кодом, і користувач отримав п'ять спроб входу, перш ніж обліковий запис буде заблоковано. Тепер один з моїх клієнтів хоче "посилити" безпеку і виступає за інше рішення: шестизначний PIN-код НІ "однакові цифри поруч": наприклад: 11 3945 або 39 55 94 НІ "триразові числа": наприклад: 123 …

3
Чому термін зміщення у SVM оцінюється окремо, замість додаткового виміру у векторному характеристиці?
Оптимальний гіперплан у SVM визначається як: w⋅x+b=0,w⋅x+b=0,\mathbf w \cdot \mathbf x+b=0, де поріг. Якщо у нас є деяке відображення яке відображає вхідний простір до деякого простору , ми можемо визначити SVM в просторі , де оптимальною буде гіперплан:ϕ Z Zbbbϕϕ\mathbf \phiZZZZZZ w⋅ϕ(x)+b=0.w⋅ϕ(x)+b=0.\mathbf w \cdot \mathbf \phi(\mathbf x)+b=0. Однак ми завжди …
11 svm  threshold 

3
Візуалізуйте біваріантний біноміальний розподіл
Запитання: як виглядає двовимірний біноміальний розподіл у тривимірному просторі? Нижче наведена конкретна функція, яку я хотів би візуалізувати для різних значень параметрів; а саме , і .p 1 p 2нnnp1p1p_{1}p2p2p_{2} f( х1, х2) = n !х1! х2!pх11pх22,х1+ х2= n ,p1+ р2= 1.f(x1,x2)=n!x1!x2!p1x1p2x2,x1+x2=n,p1+p2=1.f(x_{1},x_{2}) = \frac{n!}{x_{1}!x_{2}!}p_{1}^{x_{1}}p_{2}^{x_{2}}, \qquad x_{1}+x_{2}=n, \quad p_{1}+p_{2}=1. Зауважте, що …

3
Чи корисні взаємодії лише в умовах регресії?
Я завжди читав термін взаємодія в контексті регресії. Чи слід також розглянути взаємодію з різними моделями, наприклад, knn або svm? Якщо є , або навіть більше функцій і дозволяють сказати спостережень, який звичайний спосіб знайти корисну взаємодію? Спробуйте всі комбінації? Або використовувати лише комбінації, які мають сенс?505050100100100100010001000

1
Апроксимаційний
Я випадково читав статтю (з економіки), яка мала наступне наближення для :журнал( Є( X) )журнал⁡(Е(Х))\log(E(X)) журнал( Є( X) ) ≈ E( журнал( X) ) + 0,5 v a r ( лог( X) )журнал⁡(Е(Х))≈Е(журнал⁡(Х))+0,5vаr(журнал⁡(Х))\log(E(X)) \approx E(\log(X))+0.5 \mathrm{var}(\log(X)) , який автор каже, що точний, якщо X - нормальний (що я знаю). Я …

3
Розуміння бета-кон'югату попереднього в байєсівському висновку про частоту
Далі - уривок із вступу Болстада до байєсівської статистики . Для всіх вас, фахівців, це може бути тривіально, але я не розумію, як автор робить висновок, що нам не потрібно робити ніякої інтеграції, щоб обчислити задню ймовірність деякого значення . Я розумію, другий вираз - пропорційність і звідки походять усі …

4
Чому заходи розсіювання менш інтуїтивні, ніж центральність?
Здається, у нашому людському розумінні є щось, що створює труднощі в інтуїтивному розумінні ідеї варіації. У вузькому розумінні відповідь негайна: квадратики відкидає нас від нашого рефлексивного розуміння. Але чи це лише дисперсія, яка представляє проблеми, чи це вся ідея поширення даних? Ми шукаємо притулку в полігоніабо просто зазначаючи мінімум і …

3
Ресурси для вивчення методик з декількома цілями?
Я шукаю ресурси (книги, конспекти лекцій тощо) про методи, які можуть обробляти дані, які мають кілька цілей (напр .: три залежної змінної: 2 дискретні та 1 безперервна). Хтось має ресурси / знання з цього приводу? Я знаю, що для цього можна використовувати нейронні мережі.

3
Результати графіку мають лише середнє та стандартне відхилення
Я намагаюся візуалізувати відповідний сюжет для спостережень у цій таблиці засобів та стандартних відхилень балів відкликання: RecallControlMean37SD8ExperimentalMean21SD6ControlExperimentalMeanSDMeanSDRecall378216\begin{array} {c|c c|c c|} & \text{Control} & & \text{Experimental} & \\ & \text{Mean} & \text{SD} &\text{Mean} &\text{SD} \\ \hline \text{Recall} & 37 & 8 & 21 & 6 \\ \hline \end{array} Який найкращий спосіб …

2
Асимптотичні препарати для взяття проб з гіперкуба
Я намагаюся створити доказ проблеми, над якою я працюю, і одне з припущень, які я роблю, - це те, що набір точок, з яких я відбираю, є щільним на всьому просторі. Практично я використовую відбір з латинських гіперкубів, щоб отримати мої точки за весь пробний простір. Що я хотів би …

2
Два визначення р-значення: як довести їх еквівалентність?
Я читаю книгу Ларрі Вассермана " Вся статистика" , а зараз про p-значення (стор. 187). Дозвольте спочатку представити деякі визначення (цитую): RRRβ(θ)=Pθ(X∈R)β(θ)=Pθ(X∈R)\beta(\theta)=P_{\theta}(X\in R)α=supθ∈Θ0β(θ)α=supθ∈Θ0β(θ)\alpha = \sup_{\theta\in\Theta_0}\beta(\theta)αα\alphaαα\alpha Це в основному говорить про те, що αα\alpha , розмір є "найбільшою" ймовірністю помилки типу I. Потім значення ppp значення визначається через (я цитую) Визначення …

2
Успіх випробувань Бернуллі з різною вірогідністю
Якщо проводиться 20 незалежних випробувань Бернуллі, кожне з різною вірогідністю успіху і, отже, невдало. Яка ймовірність того, що саме n із 20 випробувань пройшло успішно? Чи існує кращий спосіб обчислення цих ймовірностей, а не просто підсумовування комбінацій ймовірностей успіху та невдачі?

3
Чи завжди краще вилучати більше факторів, коли вони існують?
На відміну від аналізу основних компонентів, рішення моделей факторного аналізу не обов'язково вкладаються. Тобто, завантаження (наприклад) для першого коефіцієнта не обов'язково буде ідентичним, коли витягується лише перший коефіцієнт порівняно з колишніми двома чинниками. Зважаючи на це, розглянемо випадок, коли у вас є набір змінних маніфестів, які сильно корелюються і (за …

1
Як встановити приблизний PDF (тобто: оцінювання щільності), використовуючи перші k (емпіричні) моменти?
У мене є ситуація, коли я в змозі оцінити (перші) моменти набору даних, і хотів би використовувати його для оцінки функції функції щільності.kkk Я вже натрапив на розподіл Пірсона , але зрозумів, що він покладається лише на перші 4 моменти (з деякими обмеженнями на можливі поєднання моментів). Я також розумію, …

1
Алгоритми вбудовування в слово з точки зору продуктивності
Я намагаюся вкласти приблизно 60 мільйонів фраз у векторний простір , а потім обчислити схожість косинусів між ними. Я використовую sklearn CountVectorizerз спеціально вбудованою функцією токенізатора, яка створює уніграми та біграми. Виявляється, що для отримання значущих уявлень, я повинен передбачити величезну кількість стовпців, лінійних за кількістю рядків. Це призводить до …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.