Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Чи "справедливо" встановлювати насіння у випадковій регресії лісу, щоб отримати найвищу точність?
У мене є випадкова регресія лісу, побудована за допомогою skl, і зауважу, що я даю різні результати на основі встановлення випадкового насіння на різні значення. Якщо я використовую LOOCV, щоб встановити, яке насіння працює найкраще, чи це правильний метод?

2
Чи працює теорема Мерсера у зворотному напрямку?
Колега має функцію і для наших цілей це чорний ящик. Функція вимірює подібність s ( a , b ) двох об'єктів.сsss ( a , b )s(a,b)s(a,b) Ми точно знаємо, що має такі властивості:сss Оцінки подібності - це реальні числа від 0 до 1, включно. Тільки об'єкти, які є самоідентичними, мають …

2
Розуміння форми інтервалу довіри для поліноміальної регресії (MLR)
У мене є труднощі зрозуміти форму довірчого інтервалу поліноміальної регресії. Ось штучний приклад, . На лівій фігурі зображено UPV (немасштабна дисперсія прогнозу), а правий графік показує довірчий інтервал та (штучні) вимірювані точки при X = 1,5, X = 2 та X = 3.Y^= a + b ⋅ X+ c ⋅ …


2
Якщо і є незалежними звичайними змінними, кожна зі середнім нулем, то також є звичайною змінною
Я намагаюся довести твердження: Якщо і є незалежними випадковими змінними,X∼N(0,σ21)X∼N(0,σ12)X\sim\mathcal{N}(0,\sigma_1^2)Y∼N(0,σ22)Y∼N(0,σ22)Y\sim\mathcal{N}(0,\sigma_2^2) тоді також є Нормальною випадковою змінною.XYX2+Y2√XYX2+Y2\frac{XY}{\sqrt{X^2+Y^2}} Для особливого випадку (скажімо), маємо добре відомий результат, що кожного разу, коли X і Y є незалежними \ mathcal {N} (0, \ sigma ^ 2) . Насправді загальновідомо, що \ frac {XY} {\ sqrt …

5
Приховування регресійної моделі від професора (регресійний броненосець) [закрито]
Закрито . Це питання потребує деталей або ясності . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Додайте деталі та уточніть проблему, відредагувавши цю публікацію . Закрито 2 роки тому . Я працюю над домашнім завданням, де мій професор хотів би, щоб ми створили справжню регресійну модель, імітували вибірку даних, …

2
Обмеження суми iid змінних Gamma
Нехай є послідовністю незалежно та однаково розподілених випадкових величин з функцією щільності ймовірності; Покажіть, щоX1,X2,…X1,X2,…X_1,X_2,\ldotsf(x)={12x2e−x0if x>0;otherwise.f(x)={12x2e−xif x>0;0otherwise. f(x) = \left\{ \begin{array}{ll} \frac{1}{2}x^2 e^{-x} & \mbox{if $x>0$};\\ 0 & \mbox{otherwise}.\end{array} \right. limn→∞P[X1+X2+…+Xn≥3(n−n−−√)]≥12limn→∞P[X1+X2+…+Xn≥3(n−n)]≥12\lim_{n\to \infty} P[X_1+X_2+\ldots+X_n\ge 3(n-\sqrt{n})] \ge \frac{1}{2} Що я намагався З першого погляду я подумав, що він повинен використовувати нерівність Чебишева, …

3
Помер 100 рулонів без обличчя, з'явившись більше 20 разів
Я намагаюся обернути голову навколо цієї проблеми. Штамп котиться 100 разів. Яка ймовірність того, що жодне обличчя не з’явиться більше 20 разів? Першою моєю думкою було використання розподілу біномів P (x) = 1 - 6 cmf (100, 1/6, 20), але це, очевидно, неправильно, оскільки ми рахуємо деякі випадки не один …

2
Оцінювач Байєса несприйнятливий до вибору зміщення
Чи оцінювачі Байєса несприйнятливі до зміщення відбору? Більшість статей, в яких обговорюється оцінка високої розмірності, наприклад, дані про цілі послідовності геномів, часто порушують питання зміщення селекції. Відхилення відбору випливають з того, що, хоча у нас є тисячі потенційних прогнозів, буде вибрано лише декілька, і на декількох вибраних буде зроблено висновок. …

2
Підвищення логістичної моделі регресії
Adaboost - це ансамблевий метод, який поєднує багато слабких учнів, щоб сформувати сильний. Усі приклади adaboost, які я читав, використовують пні / дерева як слабкі студенти. Чи можу я використовувати різних слабких учнів у adaboost? Наприклад, як реалізувати adaboost (загальнозміцнюючий прискорення) для підвищення моделі логістичної регресії? Однією з головних відмінностей …

2
Чи введе це зміщення в те, якими мають бути випадкові числа?
Припустимо файл даних з 80+ мільйонами одиниць і нулями, генерованими випадковим чином. З цього файлу ми хочемо створити список випадкових десяткових чисел. Це план зробити це перетворення. Розділіть 80 мільйонів цифр на групи з 4 двійкових цифр. Перетворіть кожен чотиризначний двійковий код у десятковий. Відкиньте всі десяткові значення більше 9. …

1
Інтерпретація похідної Радона-Нікодима між мірами ймовірності?
Я бачив в деяких моментах використання похідної Радона-Нікодима однієї міри ймовірності відносно іншої, особливо це стосується розбіжності Куллбека-Лейблера, де це похідна від міри ймовірності моделі для якогось довільного параметра щодо реального параметра :θθ\thetaθ0θ0\theta_0 dPθdPθ0dPθdPθ0\frac {dP_\theta}{dP_{\theta_0}} Де ці обидві міри ймовірності на просторі точок даних, що залежать від значення параметра: .Pθ(D)=P(D|θ)Pθ(D)=P(D|θ)P_\theta(D)=P(D|\theta) …

1
Чи слід застосовувати виправлення ступенів свободи для висновку про параметри GLM?
Це питання натхнене відповіді Мартійна тут . Припустимо, ми підходимо до ГЛМ для одного сімейства параметрів, як біноміальна чи пуассонова модель, і що це повна ймовірність процедури (на відміну від сказати, квазіпоассон). Тоді дисперсія є функцією середнього. З двочленом: і з Пуассоном .var[X]=E[X]E[1−X]var[X]=E[X]E[1−X]\text{var}[X] = E[X]E[1-X]var[X]=E[X]var[X]=E[X]\text{var}[X] = E[X] На відміну від …

3
Чутливість до масштабної нейромережевої шкали
Для прикладу, припустимо, ми будуємо оцінку віку, грунтуючись на картині людини. Нижче у нас двоє людей у ​​костюмах, але перша явно молодша за другу. (джерело: tinytux.com ) Існує маса особливостей, які це натякають, наприклад, структура обличчя. Однак найбільш характерною особливістю є співвідношення розміру голови до розміру тіла : (джерело: wikimedia.org …

2
Чому Т-статистиці потрібні дані для нормального розподілу
Я дивився на цей зошит , і мене дивує це твердження: Коли ми говоримо про нормальність, то ми маємо на увазі, що дані повинні виглядати як звичайний розподіл. Це важливо, оскільки на цьому покладаються кілька статистичних тестів (наприклад, t-статистика). Я не розумію, навіщо T-статистиці потрібні дані для нормального розподілу. Дійсно, …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.