Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Чому середня тенденція є більш стійкою у різних пробах, ніж середня?
Розділ 1.7.2 Розкриття статистики за допомогою R Енді Філдса та ін., Перераховуючи середні чесноти проти медіани, констатує: ... середнє значення має стійкість у різних зразках. Це після пояснення багатьох чеснот медіани, наприклад ... На медіану відносно не впливають екстремальні бали на будь-якому кінці розподілу ... Зважаючи на те, що на …
22 mean  median 

1
Скільки разів я повинен котити штамп, щоб впевнено оцінити його справедливість?
(Заздалегідь вибачтесь за використання простої мови, а не статистичної мови.) Якщо я хочу виміряти шанси прокатки кожної сторони певного фізичного шестигранного штампу до приблизно +/- 2% з розумною впевненістю, скільки потрібно було б зразків валків? тобто скільки разів мені знадобиться прокатати штамп, підраховуючи кожен результат, щоб бути на 98% впевненим, …

7
Чи є теплові карти «одним з найменш ефективних видів візуалізації даних»?
Питання: Коли (для яких типів проблем із візуалізацією даних) теплові карти є найбільш ефективними? (Зокрема, ефективніше, ніж усі інші можливі методи візуалізації?) Коли теплові карти найменш ефективні? Чи існують якісь загальні шаблони чи правила, за допомогою яких можна визначити, чи може теплова карта бути ефективним способом візуалізації даних, і коли …

1
Поширення градієнта через пропускні з'єднання ResNet
Мені цікаво, як градієнти розповсюджуються назад через нейронну мережу за допомогою модулів ResNet / пропускають з'єднання. Я бачив кілька запитань щодо ResNet (наприклад, нейромережа зі зв’язками пропускового шару ), але це запитує конкретно про зворотне поширення градієнтів під час тренування. Основна архітектура тут: Я читаю цю статтю « Вивчення залишкових …

7
Чи рівномірно розподілені відмінності між рівномірно розподіленими числами?
Велику кількість разів катаємо 6-сторонні штампи. Обчислюючи різницю (абсолютне значення) між рулоном та його попереднім рулоном, чи очікується, що різниці розподіляться рівномірно? Для ілюстрації з 10 рулонів: roll num result diff 1 1 0 2 2 1 3 1 1 4 3 2 5 3 0 6 5 2 7 …


2
Чи існує така річ, як скоригований
Включивши в статтю модель кількісної регресії, рецензенти хочуть, щоб я включив у документ коригуваний . Я обчислив псевдо- R 2 с (з документа JASA Koenker і Machado 1999 року)R2R2R^2R2R2R^2 ) Для трьох квантилів, що цікавлять моє дослідження. Однак я ніколи не чув про скориговану для кількісної регресії і не знав …

3
Relu vs Sigmoid vs Softmax як нейрони прихованого шару
Я грав у простій Нейронній мережі з лише одним прихованим шаром, від Tensorflow, і тоді я спробував різні активації для прихованого шару: Relu Сигмоїдний Softmax (ну зазвичай softmax використовується в останньому шарі ..) Relu забезпечує найкращу точність поїздів та точність перевірки. Я не впевнений, як це пояснити. Ми знаємо, що …


4
Чи завжди неупереджений оцінювач максимальної ймовірності є найкращим об'єктивним оцінювачем?
Я знаю, що для регулярних проблем, якщо у нас найкращий регулярний неупереджений оцінювач, він повинен бути максимальним імовірністю оцінки (MLE). Але взагалі, якщо у нас є неупереджений MLE, чи був би він також найкращим неупередженим оцінювачем (чи, можливо, я повинен його називати UMVUE, якщо він має найменшу дисперсію)?

4
Чому методи Байєса не потребують декількох виправлень випробувань?
Ендрю Гелман написав обширну статтю про те, чому для тестування Байєса АБ не потрібна корекція багаторазових гіпотез: чому ми (як правило) не повинні турбуватися про багаторазові порівняння , 2012 рік. Я не зовсім розумію: чому методи Байєса не вимагають багаторазових виправлень випробувань? A ~ Distribution1 + Common Distribution B ~ …

3
Навіщо використовувати спуск градієнта з нейронними мережами?
Під час тренування нейронної мережі з використанням алгоритму зворотного розповсюдження використовується метод градієнтного спуску для визначення оновлень ваги. Моє запитання: Замість того, щоб використовувати метод градієнтного спуску, щоб повільно знаходити мінімальну точку щодо певної ваги, чому ми не просто встановимо похідну , і знайти значення вагиw,яке мінімізує помилку?d(Error)dw=0d(Error)dw=0\frac{d(\text{Error})}{dw}=0www Крім того, …

1
Мостовий штраф проти регуляризації еластичної мережі
Деякі штрафні функції та наближення добре вивчені, такі як LASSO ( L1L1L_1 ) та Хребет ( L2L2L_2 ), і як вони порівнюються в регресії. ∑∥βj∥γ∑‖βj‖γ\sum \|\beta_{j}\|^{\gamma}γ=1γ=1\gamma = 1γ=2γ=2\gamma = 2 Веньцзян [ 1 ] порівнював Бридж-штраф, коли з LASSO, але я не зміг знайти порівняння з регуляризацією Еластичної мережі, комбінацією …

3
Негативний біноміальний розподіл проти біноміального розподілу
Яка різниця між негативним біноміальним розподілом і біноміальним розподілом? Я спробував читати в Інтернеті, і виявив, що негативний біноміальний розподіл використовується, коли точки даних дискретні, але я думаю, що навіть біноміальний розподіл можна використовувати для дискретних точок даних.

2
Як отримати функцію вірогідності розподілу біномів для оцінки параметрів?
Згідно з вірогідністю та статистикою Міллера та Фрейнда для інженерів, 8ed (pp.217-218), функція ймовірності буде максимально використана для розподілу біномів (випробування Бернуллі) задається як L(p)=∏ni=1pxi(1−p)1−xiL(p)=∏i=1npxi(1−p)1−xiL(p) = \prod_{i=1}^np^{x_i}(1-p)^{1-x_i} Як дійти до цього рівняння? Мені здається досить зрозумілим щодо інших дистрибуцій, Пуассона та Гаусса; L(θ)=∏ni=1PDF or PMF of dist.L(θ)=∏i=1nPDF or PMF of …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.