Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
Функція втрати для автокодерів
Я експериментую трохи автокодерами, і за допомогою tensorflow я створив модель, яка намагається відновити набір даних MNIST. Моя мережа дуже проста: X, e1, e2, d1, Y, де e1 і e2 - це кодуючі шари, d2 і Y - декодуючі шари (а Y - реконструйований вихід). X має 784 одиниці, e1 …

4
Як створити довільну матрицю коваріації
Наприклад, в R, MASS::mvrnorm()функція корисна для генерації даних для демонстрації різних речей у статистиці. Він бере обов'язковий Sigmaаргумент, який є симетричною матрицею, що визначає коваріаційну матрицю змінних. Як би я створив симетричну матрицю з довільними записами?n×nn×nn\times n

2
Чому для обчислення ймовірностей використовується функція softmax, хоча ми можемо розділити кожне значення на суму вектора?
Застосування функції softmax на вектор призведе до "ймовірностей" і значень між і . 000111 Але ми також можемо розділити кожне значення на суму вектора, що призведе до ймовірностей і значень між і .000111 Я читаю відповідь тут, але в ній сказано, що причина полягає в тому, що вона відрізняється, хоча …

2
Яка різниця між ініціалізатором масштабності дисперсії та ініціалізатором xavier?
Під час впровадження ResNet Tensorflow я вважаю, що вони використовують ініціалізатор дисперсійного масштабування, а також ініціалізатор xavier є популярним. Я не маю надто багато досвіду щодо цього, що краще на практиці?

1
lme () та lmer (), що дають суперечливі результати
Я працював з деякими даними, які мають певні проблеми з повторними вимірюваннями. Роблячи це, я помітив дуже різну поведінку між lme()і lmer()використовуючи свої тестові дані, і хочу знати, чому. Створений мною підроблений набір даних містить вимірювання висоти та ваги для 10 предметів, зроблених двічі кожен. Я встановив дані, щоб між …

5
Яке інтуїтивне значення має лінійний зв’язок між журналами двох змінних?
У мене є дві змінні, які не показують особливої ​​кореляції, коли будуються одна проти одної, але дуже чітке лінійне співвідношення, коли я будую журнали кожної змінної, починаючи з іншої. Тому я закінчую модель типу: log(Y)=alog(X)+blog⁡(Y)=alog⁡(X)+b\log(Y) = a \log(X) + b , що є великим математично, але, схоже, не має пояснювального …

3
Пошук способу моделювання випадкових чисел для цього розподілу
Я намагаюся написати програму на R, яка імітує псевдо випадкові числа з розподілу з функцією кумулятивного розподілу: F(x)=1−exp(−ax−bp+1xp+1),x≥0F(x)=1−exp⁡(−ax−bp+1xp+1),x≥0F(x)= 1-\exp \left(-ax-\frac{b}{p+1}x^{p+1}\right), \quad x \geq 0 деa,b>0,p∈(0,1)a,b>0,p∈(0,1)a,b>0, p \in (0,1) Я спробував обернути відбір проб, але зворотний не здається аналітично вирішим. Буду радий, якби ви могли запропонувати вирішення цієї проблеми

9
Переобладнання та недооцінка
Я провів декілька досліджень щодо пристосування та недоопрацювання, і зрозумів, що вони саме є, але не можу знайти причин. Які основні причини перевиконання та недоотримання? Чому ми стикаємося з цими двома проблемами при навчанні моделі?

2
FPR (хибний позитивний показник) проти FDR (помилковий показник виявлення)
Наступна цитата походить з відомого дослідницького документу Статистичне значення для широких досліджень геному Storey & Tibshirani (2003): Наприклад, хибнопозитивна ставка 5% означає, що в середньому 5% справді нульових ознак у дослідженні будуть називатися значущими. FDR (показник помилкового виявлення) 5% означає, що серед усіх функцій, які називаються значущими, 5% з них …

4
Приклад невід'ємного дискретного розподілу, де середнє значення (або інший момент) не існує?
Я робив певну роботу в науці, і розмова прийшла з членом основної групи наукових досліджень, чи може негативна дискретна випадкова величина мати не визначений момент. Я думаю, що він правильний, але не має доказів. Чи може хтось показати / довести це твердження? (або якщо ця претензія не відповідає дійсності) У …

1
Регресія для категоричних незалежних змінних та безперервно залежної
Я просто зрозумів, що завжди працював з проблемою регресії, де незалежні змінні завжди були числовими. Чи можу я використовувати лінійну регресію у випадку, коли всі незалежні змінні є категоричними?

4
Чи є повсякденна ймовірність лише способом поводження з невідомим (тут не йдеться про квантову фізику)?
Здається, що за повсякденної ймовірності (а не квантової фізики) ймовірності насправді є лише заміною невідомого. Візьміть, наприклад, монетку. Ми кажемо, що це "випадково", 50% зміна голови та 50% шанс хвостів. Однак, якби я точно знав щільність, розмір та форму монети; щільність повітря; з якою силою монета перевернулася; куди саме була …

3
Розуміння параметра input_shape в LSTM з Keras
Я намагаюся використовувати приклад, описаний в документації Keras під назвою "Складений LSTM для класифікації послідовностей" (див. Код нижче) і не можу визначити input_shapeпараметр у контексті моїх даних. Я маю на увазі матрицю послідовностей з 25 можливих символів, закодованих цілими числами, до вкладеної послідовності максимальної довжини 31. В результаті мій x_trainмає …
20 lstm  keras  shape  dimensions 

1
Чому LASSO не знаходить мою ідеальну пару передбачувачів у високій розмірності?
Я проводжу невеликий експеримент з регресією LASSO в R, щоб перевірити, чи зможе він знайти ідеальну пару передбачувачів. Пара визначається так: f1 + f2 = результат Результатом цього є заздалегідь визначений вектор, який називається "вік". F1 і f2 створюються, беручи половину вікового вектора і встановлюючи решта значень 0, наприклад: age …

1
Від Байєсівських мереж до Нейронних мереж: як багатоваріантну регресію можна перенести в мережу з декількома виходами
Я маю справу з Баєсовою ієрархічною лінійною моделлю , тут мережа описує її. YYY являє собою щоденний продаж товару в супермаркеті (спостерігається). ХXX - відома матриця регресорів, що включає ціни, акції, день тижня, погоду, свята. 1SSS - невідомий латентний рівень запасів кожного товару, який викликає найбільшу кількість проблем і який …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.