Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Регресія для моделі форми ?
У мене є набір даних, який є статистикою з веб-форуму для обговорення. Я дивлюся на розподіл кількості відповідей, на які очікується тема. Зокрема, я створив набір даних, у якому є перелік кількості відповідей на теми, а потім кількість тем, що мають таку кількість відповідей. "num_replies","count" 0,627568 1,156371 2,151670 3,79094 4,59473 …

2
Машини Больцмана з обмеженою частотою проти багатошарових нейронних мереж
Я хотів експериментувати з нейронною мережею щодо проблеми класифікації, з якою я стикаюся. Я зіткнувся з паперами, які розповідають про УЗМ. Але від того, що я можу зрозуміти, вони нічим не відрізняються від наявності багатошарової нейронної мережі. Це точно? Більше того, я працюю з R і не бачу жодних консервованих …

5
Коли квантильна регресія гірша за OLS?
Окрім деяких унікальних обставин, коли ми абсолютно повинні розуміти умовно-середній взаємозв'язок, які існують ситуації, коли дослідник повинен обрати OLS над квантильною регресією? Я не хочу, щоб відповідь була "якщо немає користі в розумінні хвостових відносин", оскільки ми могли просто використовувати середню регресію в якості замінника OLS.

3
Безпечне визначення розміру вибірки для тестування A / B
Я інженер програмного забезпечення, який прагне створити інструмент для тестування а / б . У мене немає твердої статистики, але я читав зовсім небагато читань протягом останніх кількох днів. Я дотримуюсь описаної тут методики і підсумую відповідні моменти нижче. Інструмент дозволить дизайнерам та експертам домену налаштувати веб-сайт для розподілу трафіку, …

2
Корекція зміщення у зваженій дисперсії
Для незваженої дисперсії існує дисперсія виправленої вибірки з ухилом, коли середнє значення оцінюється з одних і тих же даних: Вар ( X) : = 1н∑i( хi- мк )2Вар(Х): =1н∑i(хi-мк)2\text{Var}(X):=\frac{1}{n}\sum_i(x_i - \mu)^2Вар ( X) : = 1n - 1∑i( хi- Е[ X] )2Вар(Х): =1н-1∑i(хi-Е[Х])2\text{Var}(X):=\frac{1}{n-1}\sum_i(x_i - E[X])^2 Я вивчаю середньозважену середню величину …

4
Очікуване значення природного логарифму
Я знаю, що з константами , тому дано , це легко вирішити. Я також знаю, що ви не можете застосувати це, коли його нелінійна функція, як у цьому випадку , і для того, щоб вирішити це, я повинен зробити наближення з Тейлором. Отже, моє запитання - як я вирішую ?? …

3
Керована кластеризація чи класифікація?
Друге питання полягає в тому, що я виявив, що в дискусії десь в Інтернеті говорив про "контрольовану кластеризацію", наскільки я знаю, кластеризація без нагляду, тож який саме сенс стоїть під "контрольованим кластеризацією"? Яка різниця щодо "класифікації"? Про це багато посилань: http://www.cs.uh.edu/docs/cosc/technical-reports/2005/05_10.pdf http://books.nips.cc/papers/files/nips23/NIPS2010_0427.pdf http://engr.case.edu/ray_soumya/mlrg/supervid_clustering_finley_joachims_icml05.pdf http://www.public.asu.edu/~kvanlehn/Stringent/PDF/05CICL_UP_DB_PWJ_KVL.pdf http://www.machinelearning.org/proceedings/icml2007/papers/366.pdf http://www.cs.cornell.edu/~tomf/publications/supervid_kmeans-08.pdf http://jmlr.csail.mit.edu/papers/volume6/daume05a/daume05a.pdf тощо ...

3
Регресійне моделювання з неоднаковою дисперсією
Я хотів би помістити лінійну модель (lm), де дисперсія залишків явно залежить від пояснювальної змінної. Я знаю, як це зробити, використовуючи glm з сімейством Gamma для моделювання дисперсії, а потім вводять його обернення у вагах у функції lm (приклад: http://nitro.biosci.arizona.edu/r/chapter31 .pdf ) Мені було цікаво: Це єдиний прийом? Які ще …


4
Як написати формулу лінійної моделі зі 100 змінними в R
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Чи є в R простий спосіб створити лінійну регресію над моделлю зі 100 параметрами в R? Скажімо, у нас є вектор Y з 10 значеннями та …
22 r 

1
Чи завжди переважні непослідовні оцінки?
Послідовність, очевидно, є природним і важливим оцінювачем властивостей, але чи існують ситуації, коли може бути краще використовувати невідповідний оцінювач, а не послідовний? Більш конкретно, чи є приклади непослідовного оцінювача, який перевершує розумний послідовний оцінювач для всіх кінцевих (стосовно якоїсь відповідної функції втрат)?nnn

4
Що сказати клієнту, який вважає, що інтервали довіри занадто широкі, щоб бути корисними?
Припустимо, я консультант і хочу пояснити своєму клієнту корисність довірчого інтервалу. Клієнт каже мені, що мої інтервали занадто широкі, щоб бути корисними, і він вважає за краще використовувати їх наполовину ширше. Як я повинен відповісти?

1
У R, отриманий вихід з оптимуму з матрицею гессіана, як обчислити довірчі інтервали параметрів за допомогою гессіанової матриці?
З огляду на вихід з оптимуму з матрицею гессіана, як обчислити довірчі інтервали параметрів за допомогою гессіанової матриці? fit<-optim(..., hessian=T) hessian<-fit$hessian Мене найбільше цікавить контекст аналізу максимальної вірогідності, але мені цікаво дізнатися, чи можна розширити метод за його межами.

3
Стабільність моделі при вирішенні великої , малої проблеми
Вступ: У мене є набір даних із класичною "великою р, малою російською проблемою". Кількість доступних вибірок n = 150, тоді як кількість можливих предикторів p = 400. Результатом є суцільна змінна. Я хочу знайти найважливіші дескриптори, тобто ті, які є найкращими кандидатами для пояснення результату та допомоги в побудові теорії. …

1
Як розкласти часовий ряд з кількома сезонними компонентами?
У мене є часовий ряд, який містить подвійні сезонні компоненти, і я хотів би розкласти серії на наступні компоненти часових рядів (тренд, сезонний компонент 1, сезонний компонент 2 та неправильний компонент). Наскільки мені відомо, процедура STL для розкладання серії в R дозволяє лише один сезонний компонент, тому я спробував розкласти …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.