Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Скорочене зменшення розмірів
Враховуючи кількість функцій постійними, Barnes-Hut t-SNE має складністьO(nlogn)O(nlog⁡n)O(n\log n), випадкові прогнози та PCA мають складністьO(n)O(n)O(n) робить їх "доступними" для дуже великих наборів даних. З іншого боку, методи, що спираються на багатовимірне масштабування, мають:O(n2)O(n2)O(n^2) складність. Чи існують інші прийоми зменшення розмірів (крім тривіальних, як дивитись на перший kkk колонки, звичайно), складність …

1
Я щойно пробіг два мільйони регресій - інтегрована ймовірність
Зараз я працюю над тим, щоб намагатися реалізувати метод, використаний у популярній роботі під назвою "Я просто перебіг регрес на два мільйони". Основна ідея, що стоїть за ним, полягає в тому, що є певні випадки, коли не очевидно, які елементи управління повинні бути включені в модель. Одне, що ви можете …

1
Інтервал прогнозування для майбутньої частки успіхів у біноміальних умовах
Припустимо, я підхожу до біноміальної регресії та отримаю точкові оцінки та дисперсійно-коваріантну матрицю коефіцієнтів регресії. Це дозволить мені отримати ІС для очікуваної частки успіхів у майбутньому експерименті,ppp, але мені потрібна ІС для спостережуваної пропорції. Було опубліковано кілька пов’язаних відповідей, включаючи моделювання (припустимо, я цього не хочу робити) та посилання на …


2
Що означає "шум Лапласа"?
В даний час я пишу алгоритм диференціальної конфіденційності за допомогою механізму Лапласа. На жаль, я не маю передумов у статистиці, тому багато термінів мені невідомі. Тож зараз я спотикаюся над терміном: Шум Лапласа . Щоб зробити диференціальний набір даних приватним, усі документи просто говорять про додавання шуму Лапласа відповідно до …

1
Можна стандартизувати
Я намагаюся інтерпретувати результати статті, де вони застосували багаторазову регресію для прогнозування різних результатів. Однакββ\beta's (стандартизовані коефіцієнти B, визначені як βх1=Бх1⋅S Dх1S Dуβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y} де уyy є залежною змінною і х1x1x_1 є прогнозом) повідомляється, схоже, не відповідає повідомленому R2R2R^2: Попри ββ\beta з -0,83, -0,29, -0,16, -0,43, 0,25 …

1
Наскільки ефективно Q-навчання за допомогою нейронних мереж, коли є одна вихідна одиниця на дію?
Передумови: Я використовую наближення значення нейронної мережі у своєму навчальному завданні з посиленням. Підхід точно такий, як описаний у цьому питанні , однак сам питання інший. У цьому підході кількість результатів - це кількість дій, які ми можемо вжити. Простими словами, алгоритм наступний: виконайте дію A, досліджуйте нагороду, попросіть NN …

2
Як обчислити довірчий інтервал x-перехоплення в лінійній регресії?
Оскільки звичайна помилка лінійної регресії зазвичай задається для змінної реакції, мені цікаво, як отримати довірчі інтервали в іншому напрямку - наприклад, для перехоплення x. Я вмію уявити, що це може бути, але я впевнений, що для цього повинен бути простий спосіб. Нижче наводиться приклад в R, як це візуалізувати: set.seed(1) …

1
Чи нейронні мережі використовують ефективне кодування?
Моє запитання стосується взаємозв'язку між гіпотезою ефективного кодування, яка викладена на сторінці Вікіпедії щодо ефективних алгоритмів навчання кодування та нейронної мережі. Який взаємозв'язок між гіпотезою ефективного кодування та нейронними мережами? Чи існують моделі нейронної мережі, явно натхненні гіпотезою ефективного кодування? Або було б справедливіше сказати, що всі алгоритми навчання нейронної …

1
Визначення найменш зважених квадратних ваг: R lm функція проти
Чи може хто-небудь сказати мені, чому я отримую різні результати від Rзважених найменших квадратів та ручного рішення за допомогою матриці ? Зокрема, я намагаюся вручну вирішити , де - діагональна матриця на вагах, - матриця даних, - відповідь вектор. WAx=WbWAx=Wb\mathbf W \mathbf A\mathbf x=\mathbf W \mathbf bWW\mathbf WAA\mathbf Abb\mathbf b …

2
Як відібрати вибірку усіченого багаточленного розподілу?
Мені потрібен алгоритм для вибірки усіченого багаточленного розподілу. Це є, х⃗ ∼1Zpх11…pхккх1! …хк!x→∼1Zp1x1…pkxkx1!…xk!\vec x \sim \frac{1}{Z} \frac{p_1^{x_1} \dots p_k^{x_k}}{x_1!\dots x_k!} де - константа нормалізації, має позитивних компонентів, а . Я вважаю лише значення у діапазоні .ZZZх⃗ x→\vec xкkk∑хi= n∑xi=n\sum x_i = nх⃗ x→\vec{x}а⃗ ≤х⃗ ≤б⃗ a→≤x→≤b→\vec a \le \vec x …

2
Незаангажований оцінювач параметра Пуассона
Кількість аварій на день - випадкова величина Пуассона з параметром , за 10 випадково вибраних днів кількість аварій спостерігалося як 1,0,1,1,2,0,2,0,0,1, яка буде бути неупередженим оцінювачем ?λλ\lambdaеλeλe^{\lambda} Я намагався спробувати таким чином: Ми знаємо, що , але . Тоді яким буде необхідний неупереджений оцінювач?Е(х¯) = λ = 0,8E(x¯)=λ=0.8E(\bar{x})=\lambda=0.8Е(ех¯) ≠ еλE(ex¯)≠ …

1
Чи нормальна сума великої кількості незалежних випадкових величин Коші?
За теоремою центрального ліміту функція густини ймовірності суми великих незалежних випадкових величин має тенденцію до нормальної. Тому чи можна сказати, що сума великої кількості незалежних випадкових змінних Коші також є нормальною?

1
Що звичайного, у звичайних найменших квадратиках?
Нещодавно мій друг запитав, що таке звичайне, про звичайні найменші квадрати. Ми, здається, ніде не потрапляли в дискусію. Ми обоє погодилися, що OLS - це особливий випадок лінійної моделі, він має багато застосувань, добре відомий і є особливим випадком багатьох інших моделей. Але це насправді все? Тому я хотів би …

1
Чи існує інша інтерпретація для розподілу Gamma з не цілим параметром форми?
Добре відомо, що випадкова величина - це гамма, розподілена з цілим параметром форми kkk еквівалентна сумі квадратів kkk нормально розподілені випадкові величини. Але що я можу сказати про гамма-розподілену випадкову змінну з не цілим числом kkk? Чи існує взагалі інша інтерпретація, крім дистрибуції Гамми?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.