Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Плюси і мінуси мета-аналізу
Я розглядав можливість зробити якийсь метааналіз для певної галузі дослідження в еволюції, але перш ніж піти далі, хотів би знати; які позитивні та негативні процеси? Наприклад, відсутність необхідності у практичному експерименті є перевагою (час та гроші), але буде зміщення публікації (публікуються більш захоплюючі результати), що буде недоліком. Які статті в …

2
Чи використання даних підрахунку як незалежної змінної порушує будь-які припущення GLM?
Я хотів би використовувати дані підрахунку як коваріати під час встановлення логістичної регресійної моделі. Моє запитання: Чи я порушую будь-яке припущення про логістичні (і, загалом, загальні, лінійні) моделі, використовуючи підрахунок невід'ємних цілих змінних як незалежних змінних? Я знайшов у літературі багато посилань на гарячі для використання дані підрахунку як результати, …

4
Як виміряти форму кластера?
Я знаю, що це питання недостатньо чітко визначено, але деякі кластери, як правило, еліптичні або лежать у просторі нижнього розміру, а інші мають нелінійні форми (у 2D або 3D прикладах). Чи є міра нелінійності (або "форми") кластерів? Зауважте, що у 2D та 3D просторі не проблема бачити форму будь-якого кластера, …

5
Чи існує простий спосіб виявлення людей, що пережили?
Мені цікаво, чи існує простий спосіб виявлення людей, що вижили. Для одного з моїх проектів, який, в основному, був співвідношенням кількості разів, коли респонденти беруть участь у фізичних навантаженнях за тиждень, і кількістю разів, коли вони їдять поза домом (фаст-фуд) протягом тижня, я намалював розсип і буквально видалив точки даних, …

1
Чи відомий цей метод перекомпонування часових рядів у літературі? Чи має це ім’я?
Нещодавно я шукав способи повторного втілення часових рядів у такий спосіб Приблизно зберігають автоматичну кореляцію довгих процесів пам'яті. Збережіть область спостережень (наприклад, повторно впорядкований часовий ряд цілих чисел - це ще й цілий ряд цілих чисел). Може впливати лише на деякі ваги, якщо потрібно. Я придумав таку схему перестановки для …

2
Як довести, що для ядра Гауссова RBF немає кінцевомірного простору?
Як довести, що для радіальної основи функція не існує конечномерное простір ознакНтакимщопротягом деякогоФ:Rп→Hми маємоK(х,у)=⟨Ф(х),Ф(у)⟩?k(x,y)=exp(−||x−y||2)2σ2)k(x,y)=exp⁡(−||x−y||2)2σ2)k(x, y) = \exp(-\frac{||x-y||^2)}{2\sigma^2})HHHΦ:Rn→HΦ:Rn→H\Phi: \text{R}^n \to Hk(x,y)=⟨Φ(x),Φ(y)⟩k(x,y)=⟨Φ(x),Φ(y)⟩k(x, y) = \langle \Phi(x), \Phi(y)\rangle

5
Як здійснити однокласну класифікацію тексту?
Я маю справу з проблемою класифікації тексту. Веб-сканер сканує веб-сторінки певного домену, і для кожної веб-сторінки я хочу з’ясувати, належить вона лише одному певному класу чи ні. Тобто, якщо я називаю цей клас Позитивним , кожна сканована веб-сторінка належить або до класу Позитивний, або до класу Непозитивний . У мене …

3
Вибір прихованої функції активації нейронної мережі
Я читав в інших місцях, що вибір функції активації прихованого шару в NN повинен базуватися на потребі , тобто якщо вам потрібні значення в діапазоні від -1 до 1, використовуйте tanh і використовуйте сигмоїд для діапазону від 0 до 1. Моє запитання - як можна знати, у чому полягає потреба …

1
Чи існує альтернатива тесту Колмогорова-Смірнова для прив’язки даних з корекцією?
У мене є маса даних з двох зразків (контрольних та оброблених), кожен з яких містить кілька тисяч значень, які підлягають тестуванню на значущість у Р. Теоретично, значення повинні бути безперервними, але завдяки округленню, проведеному за допомогою програмного забезпечення для вимірювання, вони не є ' t і вони мають зв’язки. Розподіли …

2
Як на виборах можна сказати, наскільки впевнені, що кандидат буде переможцем?
Вчора я прожив загальні вибори, де телевізійна мережа почала називати переможців задовго до відкриття всіх бюлетенів. Вони виявилися правильно на всіх рахунках, і я не дуже здивований, що вони це зробили. Я знаю, що статистика абсолютно життєздатна. Все-таки мені цікаво. Припустимо: ми відкрили з j бюлетенів;iiijjj ми маємо кандидатів яких …
14 elections 

5
Чому застосування вибору моделі за допомогою AIC дає мені незначні значення p для змінних
У мене є питання щодо АПК і сподіваюся, що ви можете мені допомогти. Я застосував вибір моделі (назад або вперед) на основі АПК на моїх даних. І деякі з обраних змінних закінчилися значеннями p> 0,05. Я знаю, що люди говорять, що ми повинні вибирати моделі на основі AIC замість p-значення, …

2
Діагностика MCMC Geweke
Я запускаю пробовідбірник Metropolis (C ++) і хочу використовувати попередні зразки для оцінки швидкості конвергенції. Одним із найпростіших для впровадження діагностики, який я знайшов, є діагностика Geweke , яка обчислює різницю між двома вибірковими засобами, поділеними на оціночну стандартну помилку. Стандартна похибка оцінюється із спектральної щільності в нулі. Zn=θ¯A−θ¯B1nASAθ^(0)+1nBSBθ^(0)−−−−−−−−−−−−−−−−√,Zn=θ¯A−θ¯B1nASθA^(0)+1nBSθB^(0),Z_n=\frac{\bar{\theta}_A-\bar{\theta}_B}{\sqrt{\frac{1}{n_A}\hat{S_{\theta}^A}(0)+\frac{1}{n_B}\hat{S_{\theta}^B}(0)}}, де …
14 mcmc  diagnostic 

5
Видалення сторонніх точок поблизу центру QQ-ділянки
Я намагаюся побудувати QQ-графік з двома наборами даних приблизно 1,2 мільйона пунктів, в R (використовуючи qqplot та вводячи дані в ggplot2). Розрахунок досить простий, але отриманий графік завантажується болісно повільно, оскільки там так багато очок. Я намагався лінійного наближення зменшити кількість точок до 10000 (це все одно, що робить функція …

1
Чи існує оптимальна пропускна здатність для оцінки щільності ядра похідних?
Мені потрібно оцінити функцію щільності на основі набору спостережень за допомогою оцінювача щільності ядра. Спираючись на той самий набір спостережень, мені також потрібно оцінити перший та другий похідні щільності за допомогою похідних оцінювача щільності ядра. Пропускна здатність, безумовно, матиме великий вплив на кінцевий результат. По-перше, я знаю, що є пара …

1
Інтерпретація виходу регресії зі змішаної моделі, коли включаються взаємодії між категоричними змінними
У мене є питання щодо мого використання змішаної моделі / лмера. Основна модель така: lmer(DV ~ group * condition + (1|pptid), data= df) Група і стан - це обидва фактори: група має два рівні (група A, група B), а стан має три рівні (умова1, умова2, умова3). Це дані від людських …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.