Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Важливість вузла зміщення в нейронних мережах
Мені цікаво знати, наскільки важливим є упереджений вузол для ефективності сучасних нейронних мереж. Я легко можу зрозуміти, що це може бути важливо в неглибокій мережі з лише кількома вхідними змінними. Однак у сучасних нейронних мереж, таких як у глибокому навчанні, часто є велика кількість вхідних змінних, щоб вирішити, чи спрацьовує …

3
Юлія: Підвівши підсумки того, як це було
Ця публікація стосується події, що швидко змінюється. Я наштовхнувся на питання 2012 року, в якому було дуже добре обговорювати Юлію як альтернативу R / Python для різних видів статистичної роботи. Тут лежить оригінальний запитання 2012 року про обіцянку Джулії На жаль, тоді Юлія була зовсім новою, і набори інструментів, необхідні …
19 r  python  computing  julia 

1
Використання кругових предикторів при лінійній регресії
Я намагаюся підігнати модель, використовуючи дані про вітер (0, 359) та час доби (0, 23), але я стурбований тим, що вони погано впишуться в лінійну регресію, оскільки самі по собі не є лінійними параметрами. Я хотів би перетворити їх за допомогою Python. Я бачив деякі згадки про обчислення середнього вектора …

3
Використання RNN (LSTM) для прогнозування векторів таймсерій (Theano)
У мене дуже проста проблема, але я не можу знайти правильний інструмент для її вирішення. У мене є деяка послідовність векторів однакової довжини. Тепер я хотів би навчити LSTM RNN на зразку поїздів цих послідовностей, а потім змусити його передбачити нову послідовність векторів довжиною на основі декількох векторів праймінгу .ннn …

1
Геометричне розуміння PCA у предметному (подвійному) просторі
Я намагаюся зрозуміти, як працює аналіз основних компонентів (PCA) у предметному (подвійному) просторі . Розглянемо 2D набір даних з двома змінними, x1x1x_1 і , і точок даних (матриця даних дорівнює та передбачається центром). Звичайна презентація PCA полягає в тому, що ми розглядаємо точок у , записуємо матрицю коваріації та знаходимо …

5
Як використовувати розклад Холеського або альтернативу для моделювання корельованих даних
Я використовую розклад Холеського для імітації корельованих випадкових змінних із заданою кореляційною матрицею. Вся справа в тому, що результат ніколи не відтворює кореляційну структуру, як це дано. Ось невеликий приклад в Python для ілюстрації ситуації. import numpy as np n_obs = 10000 means = [1, 2, 3] sds = [1, …

1
Що робити висновок із цього сюжету ласо (glmnet)
Далі наводиться графік glmnet з альфа-замовчуванням (1, отже, і ласо), використовуючи mtcarsнабір даних у R mpgяк DV та інші як змінні прогнозувальника. glmnet(as.matrix(mtcars[-1]), mtcars[,1]) Що можна зробити з цього сюжету стосовно різних змінних, особливо am, cylта wt(червоних, чорних та світло-синіх ліній)? Як би ми сформулювали висновок у звіті, який публікується? …

3
Плутанина з помилковою швидкістю виявлення та багаторазовим тестуванням (на Colquhoun 2014)
Я прочитав цей чудовий документ Девіда Колхуна: Дослідження рівня помилкового виявлення та неправильного тлумачення p-значень (2014). По суті, він пояснює, чому показник помилкового виявлення (FDR) може досягати навіть якщо ми контролюємо помилку I типу з .30 %30%30\%α = 0,05α=0,05\alpha=0.05 Однак я все ще плутаюсь щодо того, що станеться, якщо я …

3
Чому параметричний Пірсон, а Спірман - непараметричний
Мабуть, коефіцієнт кореляції Пірсона є параметричним, а rho Спірмена - непараметричним. У мене виникають проблеми з розумінням цього. Як я розумію, Пірсон обчислюється як і Spearman обчислюється так само, за винятком того, як ми замінюємо всі значення їхніми рядами.rxy=cov(X,Y)σxσyrxy=cov(X,Y)σxσу r_{xy} = \frac{cov(X,Y)}{\sigma_x\sigma_y} У Вікіпедії йдеться Різниця між параметричною моделлю і …

3
Як працює формула для генерації корельованих випадкових змінних?
Якщо у нас є 2 нормальних, некоррельовані випадкові величини ми можемо створити 2 корельовані випадкові величини за формулоюX1,X2X1,X2X_1, X_2 Y=ρX1+1−ρ2−−−−−√X2Y=ρX1+1−ρ2X2Y=\rho X_1+ \sqrt{1-\rho^2} X_2 і тоді матиме кореляцію з .YYYρρ\rhoX1X1X_1 Чи може хтось пояснити, звідки береться ця формула?

5
Чи є версії t-SNE для потокового передавання даних?
Моє розуміння t-SNE та наближення Барнса-Хата полягає в тому, що потрібні всі точки даних, щоб можна було обчислити всі силові взаємодії одночасно, і кожну точку можна відрегулювати на 2d (або нижній розмірній) карті. Чи існують версії t-sne, які можуть ефективно справлятися з потоковими даними? Тож якщо мої спостереження надходять одне …

1
Інтервал прогнозування на основі перехресної перевірки (CV)
У підручниках та лекціях на ютубі я дізнався багато про ітеративні моделі, такі як прискорення, але я ніколи нічого не бачив, як вивести інтервал передбачення. Перехресне підтвердження використовується для наступного: Вибір моделі : Спробуйте різні моделі та виберіть ту, яка найкраще підходить. У разі збільшення, використовуйте CV для вибору параметрів …

1
Чому ціни на акції ненормальні, але прибутковість акцій нормальна
За винятком того, що прибуток може бути негативним, тоді як ціни повинні бути позитивними, чи є якась інша причина моделювання цін акцій як нормального розподілу журналу, але моделювання повернення акцій як нормального розподілу?

2
Еластичний / гребінний / ласо-аналіз, що тоді?
Мене дуже цікавить процедура еластичної сітки для усадки / відбору прогнозів. Це здається дуже потужним. Але з наукової точки зору я не знаю добре, що робити, коли отримав коефіцієнти. На яке питання я відповідаю? Це ті змінні, які найбільше впливають на цей результат, і це коефіцієнти, які дають найкраще співвідношення …

2
Як можна повторно використовувати нейромережі для класифікації послідовностей?
RNN може бути використаний для прогнозування або відображення послідовності послідовностей. Але як RNN можна використовувати для класифікації? Я маю на увазі, ми даємо цілій послідовності одну мітку.

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.