Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Керас: чому зменшення втрат при збільшенні val_loss?
Я налаштовую пошук в сітці для групи парам. Я намагаюся знайти найкращі параметри нейронної мережі Кераса, яка робить бінарну класифікацію. Вихід або 1, або 0. Є близько 200 функцій. Коли я здійснив пошук по сітці, я отримав купу моделей та їх параметрів. Найкраща модель мала ці параметри: Epochs : 20 …

2
Чому неправильно зупиняти тест A / B до досягнення оптимального розміру вибірки?
Я відповідаю за те, щоб представити результати моїх / тестових робіт (на веб-сайтах) у моїй компанії. Ми проводимо тест протягом місяця, а потім перевіряємо р-значення через рівні проміжки часу, поки не досягнемо значущості (або відмовляємося, якщо значущість не буде досягнута після тривалого запуску тесту), те, що я зараз з’ясовую, є …

2
Яка різниця між випадковою змінною та випадковою вибіркою?
Ці два вирази мене сильно збентежили, коли я вивчав статистику. Мені здається, це абсолютно різні речі. Випадкова вибірка є випадковим чином взяти пробу з популяції, в той час як випадкова величина , як функція , яка відображає безліч всіх можливих результатів експерименту з реальним числом. Однак скажіть, якщо я малюю …

1
Загалом, чи зробити висновок складніше, ніж робити прогнозування?
Моє запитання випливає з наступного факту. Я читав дописи, блоги, лекції, а також книги про машинне навчання. Моє враження, що практикуючі машинного навчання, здається, байдужі до багатьох речей, про які піклуються статистики / економетрики. Зокрема, фахівці з машинного навчання наголошують на точності прогнозування щодо висновку. Один із таких прикладів трапився, …

2
Чому логістична регресія виробляє добре калібровані моделі?
Я розумію, що однією з причин логістичної регресії часто використовується для прогнозування частоти кліків в Інтернеті є те, що вона створює добре калібровані моделі. Чи є хороше математичне пояснення цьому?

4
Чому показник схильності відповідає результату причинного висновку?
Відповідність показника схильності використовується для причинно-наслідкових висновків у спостережних дослідженнях (див. Статтю Розенбаум / Рубін ). Яка проста інтуїція, за якою вона працює? Іншими словами, чому, якщо ми впевнені, що ймовірність участі в лікуванні є рівною для двох груп, сумнівні наслідки зникають, і ми можемо використати результат, щоб зробити причинно-наслідкові …

1
Як виправити неконвергенцію в LogisticRegressionCV
Я використовую scikit-learn для виконання логістичної регресії з перехресною валідністю на наборі даних (близько 14 параметрів з> 7000 нормалізованими спостереженнями). У мене також є цільовий класифікатор, який має значення або 1, або 0. Проблема в тому, що незалежно від використовуваного рішення, я продовжую отримувати попередження про конвергенцію ... model1 = …

4
Отримання правильних вихідних значень для nls-моделі в R
Я намагаюся пристосувати просту модель закону про владу до набору даних таким чином: mydf: rev weeks 17906.4 1 5303.72 2 2700.58 3 1696.77 4 947.53 5 362.03 6 Мета полягає в тому, щоб пропустити лінію електропередачі і використовувати її для прогнозування revвластей на майбутні тижні. Купка досліджень привела мене до …

2
Чому регресія хребта не може забезпечити кращу інтерпретацію, ніж LASSO?
У мене вже є уявлення про плюси і мінуси регресії хребта та LASSO. Для LASSO штрафний термін L1 дасть вектор розрідженого коефіцієнта, який можна розглядати як метод вибору функції. Однак для LASSO є деякі обмеження. Якщо функції мають високу кореляцію, LASSO вибере лише одну з них. Крім того, для проблем, …

4
Яка мета нормалізації рядків
Я розумію міркування щодо нормалізації стовпців, оскільки це призводить до того, що характеристики зважуються однаково, навіть якщо вони не вимірюються в одній шкалі - проте, часто в найближчій сусідній літературі обидва стовпці та рядки нормалізуються. Для чого / для чого нормалізувати рядки? Зокрема, як результат нормалізації рядків впливає на подібність …


4
Як слід перевірити припущення про лінійність logit для безперервних незалежних змінних в аналізі логістичної регресії?
Я плутаю припущення про лінійність logit для безперервних змінних прогнозів в аналізі логістичної регресії. Чи потрібно перевіряти лінійну залежність під час скринінгу на потенційних прогнокторів, використовуючи невідмінний логістичний регресійний аналіз? У моєму випадку я використовую багаторазовий логістичний регресійний аналіз для виявлення факторів, пов’язаних із статусом харчування (дихотомічним результатом) серед учасників. …

2
Упереджена завантажувальна програма: чи добре зосереджувати ІП навколо спостережуваної статистики?
Це схоже на Bootstrap: оцінка знаходиться за межами довірчого інтервалу У мене є деякі дані, які представляють кількість генотипів у популяції. Я хочу оцінити генетичне різноманіття за допомогою індексу Шеннона, а також генерувати довірчий інтервал, використовуючи завантажувальний інструмент. Я помітив, однак, що оцінка за допомогою завантажувальної програми, як правило, є …

1
Налаштування гіперпараметра в регресії Гауссового процесу
Я намагаюся налаштувати гіперпараметри алгоритму регресії гауссового процесу, який я реалізував. Я просто хочу максимально збільшити граничну ймовірність журналу, задану формулою де K - матриця коваріації з елементи K_ {ij} = k (x_i, x_j) = b ^ {- 1} \ exp (- \ frac {1} {2} (x_i-x_j) ^ TM (x_i-x_j)) …

1
Як працює розмноження спини в сіамській нейронній мережі?
Я вивчав архітектуру сіамської нейронної мережі, запровадженої Яном Лекуном та його колегами в 1994 році для розпізнавання підписів ( "Перевірка підписів за допомогою нейронної мережі затримки в часі сіамської " .pdf , NIPS 1994) Я зрозумів загальну ідею цієї архітектури, але насправді не можу зрозуміти, як працює розмноження в цьому …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.