Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

6
Помилковість техаського стрільця в дослідницькому аналізі даних
Я читав цю статтю в "Природі", в якій деякі помилки пояснюються в контексті аналізу даних. Я помітив, що помилок техаських стрільців було особливо важко уникнути: Пізнавальна пастка, яка чекає під час аналізу даних, ілюструється байкою техаського стрільця: невмілий стрілець, який вистрілює випадковим малюнком кульок збоку від сараю, малює ціль навколо …
23 eda  fallacy 

2
Чи можемо ми використовувати MLE для оцінки ваги нейронної мережі?
Я тільки почав вивчати інформацію про статистику та моделі. В даний час я розумію, що ми використовуємо MLE для оцінки найкращих параметрів для моделі. Однак, коли я намагаюся зрозуміти, як працюють нейронні мережі, здається, що вони зазвичай використовують інший підхід для оцінки параметрів. Чому ми не використовуємо MLE або взагалі …

4
Чи зробили недостатньо досліджені дослідження ймовірність помилкових позитивних результатів?
Це питання вже задавались тут і тут, але я не думаю, що відповіді стосуються цього питання безпосередньо. Чи зробили недостатньо досліджені дослідження ймовірність помилкових позитивних результатів? Деякі статті новин висловлюють це твердження. Для прикладу : Низька статистична потужність - погана новина. Дослідження з недостатнім рівнем ймовірності пропускають справжні наслідки, і …

4
Вступ до машинного навчання математиків
У певному сенсі це мій перехрестя з math.stackexchange , і я маю відчуття, що цей сайт може забезпечити широку аудиторію. Шукаю математичне вступ до машинного навчання. Зокрема, багато літератури, яку можна знайти, є відносно неточною, і багато сторінок витрачаються без будь-якого змісту. Однак, виходячи з такої літератури, я відкрив курси …

3
Яка архітектура складеного згорткового автокодера?
Тому я намагаюся провести пошук зображень людей за допомогою звивистих сіток. Я читав документи ( Paper1 і Paper2 ) і цю посилання StackOverflow , але я не впевнений , я розумію структуру мережі (вона не визначена в роботах). Запитання: Я можу мати свій вхід, після якого проходить шар шуму, а …

2
Різниця двох ідентичних лонормальних випадкових величин
Нехай X1X1X_1 і - 2 iidrv, де . Я хотів би знати розподіл для .X2X2X_2log(X1),log(X2)∼N(μ,σ)log⁡(X1),log⁡(X2)∼N(μ,σ)\log(X_1),\log(X_2) \sim N(\mu,\sigma)X1−X2X1−X2X_1 - X_2 Найкраще, що я можу зробити, це взяти ряд Тейлора обох і зрозуміти, що різниця - це сума різниці між двома нормальними rv і двома r-chi квадратами на додаток до решти різниці …

3
Розкладання MSE до варіації та квадратичного зміщення
Показавши, що MSE можна розкласти на дисперсію плюс квадрат Біаса, доказ у Вікіпедії має крок, виділений на малюнку. Як це працює? Як очікування підштовхується до продукту від 3-го до 4-го кроку? Якщо два терміни незалежні, чи не слід застосовувати очікування до обох термінів? а якщо їх немає, чи дійсний цей …

4
Точні дві пропорції вибірки біноміального тесту в R (і деякі дивні p-значення)
Я намагаюся вирішити таке питання: Гравець A виграв 17 з 25 ігор, а гравець B виграв 8 із 20 - чи є значна різниця між обома співвідношеннями? Що потрібно зробити в R, що спадає на думку: > prop.test(c(17,8),c(25,20),correct=FALSE) 2-sample test for equality of proportions without continuity correction data: c(17, 8) …


1
Нелінійна та узагальнена лінійна модель: як ви ставитесь до логістичної, пуассонової регресії тощо?
У мене є питання щодо семантики, на яке я хотів би думати колеги-статистики. Ми знаємо, що такі моделі, як логістична, пуассонова тощо, потрапляють під парасольку узагальнених лінійних моделей. Модель включає нелінійні функції параметрів, які можуть, в свою чергу, моделюватися за допомогою лінійної рамки моделі за допомогою відповідної функції зв'язку. Мені …

10
Чи є у вас рекомендації щодо книг для самонавчання прикладної статистики на рівні випускників?
Я взяв декілька курсів статистики в коледжі, але виявив, що моя освіта дуже керована теорією. Мені було цікаво, чи хтось із вас мав текст прикладної статистики (на рівні випускників), який ви рекомендуєте, або маєте хороший досвід роботи.

6
Чому ми зазвичай обираємо мінімізувати суму квадратних помилок (SSE) під час встановлення моделі?
Питання дуже просте: чому, намагаючись пристосувати модель до наших даних, лінійних чи нелінійних, ми зазвичай намагаємось мінімізувати суму квадратів помилок, щоб отримати наш оцінювач для параметра моделі? Чому б не вибрати якусь іншу цільову функцію для мінімізації? Я розумію, що з технічних причин квадратична функція є кращою, ніж деякі інші …

1
Чи є спосіб використовувати коваріаційну матрицю для пошуку коефіцієнтів для множинної регресії?
Для простої лінійної регресії коефіцієнт регресії обчислюється безпосередньо з матриці дисперсії-коваріації через де - індекс залежної змінної, а - індекс пояснювальної змінної.C d , eCCC deCd,eCe,eCd,eCe,e C_{d, e}\over C_{e,e} dddeee Якщо є лише матриця коваріації, чи можна обчислити коефіцієнти для моделі з кількома пояснювальними змінними? ETA: Для двох пояснювальних змінних …

7
Що не так з коригуваннями Bonferroni?
Я прочитав наступний документ: Perneger (1998) Що не так з коригуваннями Bonferroni . Автор підсумував, сказавши, що коригування Бонферроні мають, у кращому випадку, обмежене застосування у біомедичних дослідженнях і не повинні використовуватися при оцінці доказів конкретної гіпотези: Підсумки: Регулювання статистичної значущості кількості тестів, проведених за даними дослідження - метод Бонферроні …

1
Інвертування перетворення Фур'є для розподілу Фішера
Характерною функцією розподілу Фішера є: де є злита гіпергеометрична функція . Я намагаюся вирішити зворотне перетворення Фур'є з -сверткі , щоб відновити щільність змінної , тобто: з метою отримання розподілу сумиC ( t ) = Γ ( α + 1Ж( 1 , α )Ж(1,α)\mathcal{F}(1,\alpha)UС( t ) = Γ ( α …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.