Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Чому не всі виправлення гіпотез застосовуються до всіх експериментів з самого світанку?
Ми знаємо, що ми повинні застосувати подібні до Беняміні Хохберга виправлення для тестування численних гіпотез до експериментів, заснованих на єдиному наборі даних, щоб контролювати швидкість виявлення помилок, інакше всі експерименти, що дають позитивний результат, можуть бути помилковими. Але чому ми не застосовуємо цей самий принцип до всіх експериментів з початку …

1
Розрахунок граничної ймовірності зразків MCMC
Це питання, що повторюється (див. Цю публікацію , цю публікацію та цю публікацію ), але у мене інший виток. Припустимо, у мене є купа зразків із загального пробовідбору MCMC. Для кожного зразка я знаю значення ймовірності журналу та журналу попереднього . Якщо це допомагає, я також знаю значення ймовірності журналу …

3
Оцінка логістичної регресії та інтерпретації Хосмера-Лемешоу Goodness of Fit
Як ми всі знаємо, існує 2 методи оцінки логістичної регресійної моделі, і вони тестують дуже різні речі Прогнозова сила: Отримайте статистику, яка вимірює, наскільки добре ви можете передбачити залежну змінну на основі незалежних змінних. Добре відомі псевдо R ^ 2 - Макфадден (1974) і Кокс і Снелл (1989). Статистика придатності …

4
ANOVA проти множинної лінійної регресії? Чому ANOVA так часто використовується в експериментальних дослідженнях?
ANOVA проти множинної лінійної регресії? Я розумію, що обидва ці методи, здається, використовують однакову статистичну модель. Однак за яких обставин слід використовувати який метод? Які переваги та недоліки цих методів у порівнянні? Чому ANOVA так часто використовується в експериментальних дослідженнях, і я навряд чи знайду регресійне дослідження?

2
Мішок слів для класифікації тексту: Чому б не просто використовувати частоту слова замість TFIDF?
Поширеним підходом до класифікації тексту є підготовка класифікатора від «мішечок слів». Користувач приймає текст для класифікації та підраховує частоти слів у кожному об'єкті з подальшим обрізанням, щоб зберегти отриману матрицю керованого розміру. Часто я бачу, як користувачі конструюють свій функціональний вектор за допомогою TFIDF. Іншими словами, зазначені вище частоти тексту …

3
Чому силові або журнальні перетворення мало навчаються в машинному навчанні?
Машинне навчання (МЛ) активно використовує лінійні та логістичні методи регресії. Він також спирається на особливість інженерних методів ( feature transform, kernel, і т.д.). Чому нічого не згадується про variable transformation(наприклад power transformation) в ML? (Наприклад, я ніколи не чую про те, щоб увімкнути або ввійти до функцій; вони, як правило, …

1
Яка ймовірність того, що
Враховуючи nnn точок даних, кожна з яких має ddd функції, n/2n/2n/2 позначаються як 000 , інші n/2n/2n/2 позначаються як 111 . Кожна функція приймає значення від [0,1][0,1][0,1] випадковим чином (рівномірний розподіл). Яка ймовірність існування гіперплану, який може розділити два класи? Розглянемо спочатку найпростіший випадок, тобто d=1d=1d = 1 .

4
Що ми можемо дізнатися про людський мозок із штучних нейронних мереж?
Я знаю, що моє запитання / назва не дуже конкретне, тому я спробую його прояснити: Штучні нейронні мережі мають відносно суворі конструкції. Звичайно, загалом на них впливає біологія і намагаються побудувати математичну модель реальних нейронних мереж, але наше розуміння реальних нейронних мереж недостатнє для побудови точних моделей. Тому ми не …

2
Байєсське ласо проти звичайного ласо
Для програми lasso доступні різні програми для впровадження . Я знаю, що багато обговорювалося про байєсівський підхід і частолістський підхід на різних форумах. Моє запитання дуже специфічне для лассо - Які відмінності чи переваги баснійського ласо проти звичайного ласо ? Ось два приклади реалізації в пакеті: # just example data …

4
Алгоритми виявлення аномалії часових рядів
Зараз я використовую AnomalyDetection Twitter в R: https://github.com/twitter/AnomalyDetection . Цей алгоритм забезпечує виявлення аномалії часових рядів для даних із сезонністю. Питання: чи існують подібні алгоритми, подібні до цього (контроль за сезонністю не має значення)? Я намагаюся оцінити якомога більше алгоритмів часових рядів на моїх даних, щоб я міг вибрати найкращий …


1
Геометрична інтерпретація коефіцієнта множинної кореляції
Мене цікавить геометричне значення множинної кореляції RRR та коефіцієнт визначення R2R2R^2 в регресії yi=β1+β2x2,i+⋯+βkxk,i+ϵiyi=β1+β2x2,i+⋯+βkxk,i+ϵiy_i = \beta_1 + \beta_2 x_{2,i} + \dots + \beta_k x_{k,i} + \epsilon_i , або у векторних позначеннях , y=Xβ+ϵy=Xβ+ϵ\mathbf{y} = \mathbf{X \beta} + \mathbf{\epsilon} Тут проектна матриця XX\mathbf{X} має nnn рядків і kkk стовпців, з яких …

1
Чи можна мультиноміал (1 / n,…, 1 / n) охарактеризувати як дискретизований Діріхле (1, .., 1)?
Тож це питання злегка безладний, але я включаю барвисті графіки, щоб компенсувати це! Спочатку передумови, а потім питання. Фон Скажімо, у вас -вимірний мультиноміальний розподіл з рівними ймовірностями по категоріям. Нехай π = ( π 1 , … , π n ) - нормовані відліки ( c ) від цього …

2
Автокодекси не можуть вивчити значущі функції
У мене є 50 000 таких зображень: Вони зображують графіки даних. Я хотів отримати функції з цих зображень, тому я використав код автокодування, наданий Theano (deeplearning.net). Проблема полягає в тому, що ці автокодери, схоже, не вивчають жодних функцій. Я спробував RBM, і це те саме. Набір даних MNIST забезпечує приємні …

3
Зовнішнє виявлення на перекошених дистрибутивах
За класичним визначенням зовнішньої форми як точки даних, що витісняє 1,5 * IQR від верхнього або нижнього кватилі, існує припущення про несказаний розподіл. Для косих розподілів (Експоненціальна, Пуассонова, Геометрична тощо) найкращий спосіб виявити сторонність шляхом аналізу перетворення вихідної функції? Наприклад, дистрибутиви, керовані експоненціальним розподілом, можуть бути перетворені за допомогою функції …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.