Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Вимірювання подібності документа
Для кластеризації (текстових) документів потрібен спосіб вимірювання подібності між парами документів. Дві альтернативи: Порівняйте документи як термінові вектори, використовуючи косинулогічну подібність - і TF / IDF як коефіцієнти зважування для термінів. Порівняйте кожен розподіл вірогідності документів, використовуючи f-дивергенцію, наприклад, дивергенцію Куллбека-Лейблера Чи є якась інтуїтивна причина віддати перевагу одному методу …

4
Слабо інформативні попередні розподіли для параметрів шкали
Я використовую звичайні розподіли журналу як попередні розподіли для параметрів масштабу (для звичайних розподілів, t розподілів і т. Д.), Коли маю грубе уявлення про те, яким повинен бути масштаб, але хочу помилитися, сказавши, що я не знаю багато про це. Я використовую його, тому що таке використання має для мене …

2
Як виміряти / аргументувати корисність відповідності тенденції до закону про владу?
У мене є деякі дані, до яких я намагаюся відповідати тенденції. Я вважаю, що дані відповідають закону про владу, і тому я побудував дані на осях журналу журналу, шукаючи пряму лінію. Це призвело до (майже) прямої лінії, і тому в Excel я додав тенденцію до закону про владу. Будучи новичкою …

3
Коефіцієнт детермінації (
Я хочу повністю зрозуміти поняття описує величину варіації між змінними. Кожне веб-пояснення є дещо механічним і тупим. Я хочу «отримати» концепцію, а не просто механічно використовувати цифри.r2r2r^2 Напр .: Години, вивчені проти тестових балів = .8rrr = .64r2r2r^2 Отже, що це означає? 64% варіативності тестових балів можна пояснити годинами? Звідки …

2
Як вибрати між алгоритмами навчання
Мені потрібно реалізувати програму, яка класифікує записи на 2 категорії (правда / хибність) на основі деяких навчальних даних, і мені було цікаво, на який алгоритм / методологію я повинен дивитись. Здається, що їх вибирати дуже багато - штучна нейронна мережа, генетичний алгоритм, машинне навчання, байєсова оптимізація тощо тощо, і я …

5
Як зробити свою нейронну мережу кращою при прогнозуванні синусоїд?
Ось подивіться: Ви можете точно бачити, де закінчуються дані тренувань. Дані про навчання проходять від до .−1−1-1111 Я використовував Keras і щільну мережу 1-100-100-2 з активацією tanh. Я обчислюю результат з двох значень, p і q як p / q. Таким чином я можу отримати будь-який розмір числа, використовуючи лише …

1
Генерування корельованих біноміальних випадкових величин
Мені було цікаво, чи можливо генерувати корельовані випадкові біноміальні змінні після підходу лінійної трансформації? Нижче я спробував щось просто в R, і це дає певну кореляцію. Але мені було цікаво, чи існує принциповий спосіб цього зробити? X1 = rbinom(1e4, 6, .5) ; X2 = rbinom(1e4, 6, .5) ; X3 = …

3
Як інтерпретувати середньоквадратичну помилку (RMSE) проти стандартного відхилення?
Скажімо, у мене є модель, яка дає мені прогнозовані значення. Я обчислюю RMSE цих значень. А потім стандартне відхилення фактичних значень. Чи має сенс порівнювати ці два значення (дисперсії)? Я думаю, що якщо RMSE і стандартне відхилення схожі / однакові, то помилка / дисперсія моєї моделі є такою ж, як …

3
Чи потрібен нам тестовий набір при використанні перехресної перевірки k-кратної?
Я читав про перевірку k-fold, і хочу переконатися, що я розумію, як це працює. Я знаю, що для методу тримання дані розбиваються на три набори, а тестовий набір використовується лише в самому кінці для оцінки продуктивності моделі, тоді як набір перевірки використовується для настройки гіперпараметрів тощо. У методі k-fold ми …

4
Ентропія зображення
Який найбільш інформаційний / фізико-теоретичний правильний спосіб обчислити ентропію зображення? Мене зараз не хвилює ефективність обчислень - я хочу, щоб це було теоретично максимально правильним. Почнемо із зображення сірого масштабу. Один із інтуїтивно зрозумілих підходів - розглядати зображення як мішок пікселів і обчислювати Н= - ∑кpкл о г2( ск)Н=-∑кpклог2(pк) H …

2
Як узагальнити достовірні інтервали для медичної аудиторії
За допомогою пакетів Stan і Frontend rstanarmабо brmsя можу легко проаналізувати дані байєсівським способом, як я це робив раніше при змішаних моделях, таких як lme. Хоча я маю на своєму столі більшість книг та статей Крушке-Гельмана-Вагенмакера тощо, вони не розповідають, як підводити результати для медичної аудиторії, розірваної між гнівом Скілла …

5
Статистичний підхід для визначення, якщо дані відсутні випадково
У мене є великий набір функціональних векторів, які я буду використовувати для атаки на проблему бінарної класифікації (використовуючи scikit learn in Python). Перш ніж почати замислюватися над імпутацією, мені цікаво спробувати визначити з решти частин даних, чи відсутні дані "випадково відсутні" або відсутні як випадково. Який розумний спосіб підійти до …


3
Розподіл різниці між двома нормальними розподілами
У мене є дві функції щільності ймовірності нормальних розподілів: f1(x1|μ1,σ1)=1σ12π−−√e−(x−μ1)22σ21f1(x1|μ1,σ1)=1σ12πe−(x−μ1)22σ12f_1(x_1 \; | \; \mu_1, \sigma_1) = \frac{1}{\sigma_1\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_1)^2}{2\sigma_1^2} } і f2(x2|μ2,σ2)=1σ22π−−√e−(x−μ2)22σ22f2(x2|μ2,σ2)=1σ22πe−(x−μ2)22σ22f_2(x_2 \; | \; \mu_2, \sigma_2) = \frac{1}{\sigma_2\sqrt{2\pi} } \; e^{ -\frac{(x-\mu_2)^2}{2\sigma_2^2} } Я шукаю функцію щільності ймовірності поділу між та . Я думаю, це означає, що …

2
Як працює метод зворотного перетворення?
Як працює метод інверсії? Скажімо , у мене випадкову вибірку X1,X2,...,XnX1,X2,...,XnX_1,X_2,...,X_n з щільністю f(x;θ)=1θx(1−θ)θf(x;θ)=1θx(1−θ)θf(x;\theta)={1\over \theta} x^{(1-\theta)\over \theta} над 0&lt;x&lt;10&lt;x&lt;10<x<1і тому з cdfFX(x)=x1/θFX(x)=x1/θF_X(x)=x^{1/\theta}on(0,1)(0,1)(0,1). Тоді методом інверсії я отримую розподілXXXякF−1X(u)=uθFX−1(u)=uθF_X^{-1}(u)=u^\theta. Так само uθuθu^\theta має розподіл XXX ? Так працює метод інверсії? u&lt;-runif(n) x&lt;-u^(theta)

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.