Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних


3
Як передбачити результат лише з позитивних випадків як навчання?
Для простоти, скажімо, я працюю на класичному прикладі спам / не-спам-листів. У мене є набір 20000 електронних листів. З них я знаю, що 2000 - це спам, але я не маю жодного прикладу не-спам-листів. Я хотів би передбачити, чи залишилися 18000 спамом чи ні. В ідеалі результат, який я шукаю, …

2
охоплення довірчих інтервалів з регульованими оцінками
Припустимо, я намагаюся оцінити велику кількість параметрів за деякими великомірними даними, використовуючи якісь регульовані оцінки. Регуляризатор вносить певні упередження до оцінок, але це все ще може бути гарним компромісом, оскільки зменшення дисперсії повинно перевищувати його. Проблема виникає, коли я хочу оцінити довірчі інтервали (наприклад, використовуючи наближення Лапласа або завантажуючи). Зокрема, …

1
Концептуально завантажувальний завантаження проти Bayesian Bootstrapping?
У мене виникають проблеми з розумінням того, що таке процес Bayesian Bootstrapping, і чим це буде відрізнятися від вашого звичайного завантаження. І якби хтось міг запропонувати інтуїтивний / концептуальний огляд та порівняння обох, це було б чудово. Візьмемо приклад. Скажімо, у нас є набір даних X, що становить [1,2,5,7,3]. Якщо …

1
Коли використовувати дані Пуассона проти геометричних та негативних біноміальних GLM для даних підрахунку?
Я намагаюся розмістити для себе, коли доречно використовувати тип регресії (геометричний, пуассонський, негативний двочлен) з даними підрахунку, в рамках GLM (лише 3 з 8 розподілів GLM використовуються для підрахунку даних, хоча більшість з них Я читав центри навколо негативних біноміальних та пуассонових розподілів). Коли використовувати дані Пуассона проти геометричних та …

1
Чи я просто винайшов байєсівський метод аналізу кривих ROC?
Преамбула Це довгий пост. Якщо ви перечитуєте це, зауважте, що я переглянув частину питання, хоча довідковий матеріал залишається тим самим. Крім того, я вважаю, що я розробив рішення проблеми. Це рішення з’являється внизу публікації. Дякую CliffAB, що вказав, що моє оригінальне рішення (відредаговане з цієї публікації; див. Історію редагування для …

2
Чому нормальність залишків "ледве важлива взагалі" для оцінки лінії регресії?
Гельман і Хілл (2006) на p46 пишуть, що: Припущення регресії, яке, як правило, є найменш важливим, полягає в тому, що помилки зазвичай розподіляються. Насправді, для оцінки лінії регресії (порівняно з прогнозуванням окремих точок даних) припущення про нормальність ледве важливе. Таким чином, на відміну від багатьох регресійних підручників, ми не рекомендуємо …

2
Які основні відмінності між рамками причинності Грейнджера та Перла?
Нещодавно я натрапив на кілька паперів та Інтернет-ресурсів, де згадується причинність Грейнджера . Короткий перегляд відповідної статті Вікіпедії залишив у мене враження, що цей термін стосується причинності в контексті часових рядів (або, загалом, стохастичних процесів ). Більше того, читання цієї приємної публікації в блозі створило додаткову плутанину в тому, як …

2
Методи збільшення даних для загальних наборів даних?
У багатьох програмах машинного навчання так звані методи збільшення даних дозволили створити кращі моделі. Наприклад, припустимо навчальний набір із зображень котів та собак. Обертанням, дзеркальним відображенням, регулюванням контрасту тощо можна створити додаткові зображення з оригінальних.100100100 Що стосується зображень, то доповнення даних є відносно простим. Однак припустимо (наприклад), що у кожного …

2
Чи має це дискретний розподіл назву?
Чи має це дискретний розподіл назву? Дляi ∈ 1 ... Ni∈1 ...Ni \in 1...N f( i ) = 1N∑Nj = i1jf(i)=1N∑j=iN1jf(i) = \frac{1}{N} \sum_{j = i}^N \frac{1}{j} Я натрапив на цей розподіл із наступного: у мене є список з NNN елементів, ранжируваних за деякою функцією утиліти. Я хочу випадковим чином …

3
Поширення найбільшого фрагмента зламаної палички (проміжки)
Нехай палиця довжиною 1 розбивається на фрагменти навмання рівномірно. Який розподіл довжини найдовшого фрагмента?k+1k+1k+1 Більш формально, нехай буде IID , і нехай є пов'язаною статистикою замовлення, тобто ми просто замовляємо зразок таким чином, що . Нехай .(U1,…Uk)(U1,…Uk)(U_1, \ldots U_k)U(0,1)U(0,1)U(0,1)(U(1),…,U(k))(U(1),…,U(k))(U_{(1)}, \ldots, U_{(k)})U(1)≤U(2)≤,…,≤U(k)U(1)≤U(2)≤,…,≤U(k)U_{(1)} \leq U_{(2)} \leq, \ldots , \leq U_{(k)}Zk=max(U(1),U(2)−U(1),…,U(k)−U(k−1),1−U(k))Zk=max(U(1),U(2)−U(1),…,U(k)−U(k−1),1−U(k))Z_k = \max …

1
інтерпретація оцінок засмічення логістичної регресії
Чи міг би хтось порадити мені, як інтерпретувати оцінки з логістичної регресії, використовуючи посилання забивання? Я встановив таку модель у lme4: glm(cbind(dead, live) ~ time + factor(temp) * biomass, data=mussel, family=binomial(link=cloglog)) Наприклад, оцінка часу - 0,015. Чи правильно сказати, що шанси смертності за одиницю часу множать на exp (0,015) = …

3
Від правила Perceptron до градієнтного походження: чим відрізняються перцептрони з сигмоїдною активаційною функцією від логістичної регресії?
По суті, моє питання полягає в тому, що в багатошарових перцептронах персептрони використовуються з функцією активації сигмоїдів. Так що в правилі поновлення у обчислюється якy^y^\hat{y} y^=11+exp(−wTxi)y^=11+exp⁡(−wTxi)\hat{y} = \frac{1}{1+\exp(-\mathbf{w}^T\mathbf{x}_i)} Чим цей «сигмоїдний» Перцепцепрон відрізняється від логістичної регресії тоді? Я б сказав , що одношаровий персептрон сигмовидної еквівалентно логістичної регресії в тому …

2
R-квадрат у квантильній регресії
Я використовую квантильну регресію, щоб знайти прогнози 90-х відсотків моїх даних. Я роблю це в R, використовуючи quantregпакет. Як я можу визначити для квантильної регресії, яка вказуватиме на скільки змінності пояснюються прогнозні величини?r2r2r^2 Що я дійсно хочу знати: "Будь-який метод, який я можу використовувати, щоб знайти, скільки змінності пояснюється?". Рівні …

1
Коли коли-небудь середня статистика є достатньою статистикою?
Я зіткнувся із зауваженням хімічного статистика, що медіана вибірки часто може бути вибором для достатньої статистики, але, крім очевидного випадку одного чи двох спостережень, коли вона дорівнює середній вибірці, я не можу придумати ще одне нетривіальне та iid випадок, коли медіана вибірки достатня.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.