Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

1
k-означає || ака масштабований K-засоби ++
Бахман Бахмані та ін. введено k-означає ||, що є більш швидкою версією k-означає ++. Цей алгоритм взято зі сторінки 4 своєї статті , Бахмані, Б., Мозелі, Б., Ваттані, А., Кумар, Р., та Васильвіцький, С. (2012). Масштабований k-означає ++. Праці Фонду VLDB , 5 (7), 622-633. На жаль, я не розумію …

1
Яка різниця між "тестуванням гіпотез" та "вибором моделі"?
У літературі обидва терміни часто вживаються синонімічно або переплітаються. Зараз я намагаюся знайти чітке розмежування обох термінів. З моєї точки зору, гіпотеза зазвичай виражається за допомогою моделі. Тож навіть якщо ми перевіряємо гіпотезу нуля проти альтернативи, з моєї точки зору ми робимо вибір моделі. Чи може хтось дати мені інтуїтивну …

2
Як знайти
Як я можу це вирішити? Мені потрібні проміжні рівняння. Можливо, відповідь −tf(x)−tf(x)-tf(x) . ddt[∫∞txf(x)dx]ddt[∫t∞xf(x)dx] \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] f(x)f(x)f(x) - функція щільності ймовірності. limx→∞f(x)=0limx→∞f(x)=0\lim\limits_{x \to \infty} f(x) = 0limx→∞F(x)=1limx→∞F(x)=1\lim\limits_{x \to \infty} F(x) = 1 джерело: http://www.actuaries.jp/lib/collection/books/H22/H22A.pdf p.40 Спробуйте проміжні рівняння нижче: ddt[∫∞txf(x)dx]=ddt[[xF(x)]∞t−∫∞tF(x)dx]??ddt[∫t∞xf(x)dx]=ddt[[xF(x)]t∞−∫t∞F(x)dx]?? \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] …

3
Як вибрати рівень довіри?
Я часто використовую 90% рівень довіри, приймаючи, що це має більшу ступінь невизначеності, ніж 95% або 99%. Але чи є вказівки щодо вибору правильного рівня довіри? Або вказівки щодо рівня довіри, які використовуються в різних сферах? Також, інтерпретуючи та представляючи рівні довіри, чи є посібники для перетворення числа на мову? …

2
Відступ від припущення щодо нормальності в ANOVA: чи важливіший куртоз чи косостість?
Прикладні лінійні статистичні моделі від Kutner et al. йдеться про наступне, що стосується відхилень від норми припущення щодо моделей ANOVA: Куртоз розподілу помилок (або більше, або максимум, ніж звичайний розподіл) важливіший, ніж спотвореність розподілу з точки зору впливу на умовиводи . Я трохи спантеличений цим твердженням і не встиг знайти …

3
Умовна ймовірність безперервної змінної
Припустимо, що випадкова величина слідує за безперервним рівномірним розподілом з параметрами 0 і 10 (тобто )U ∼ U ( 0 , 10 )UUUU∼U(0,10)U∼U(0,10)U \sim \rm{U}(0,10) Тепер позначимо A подію, що = 5 і B подія, що дорівнює або або 6. За моїм розумінням, обидві події мають нульову ймовірність.U 5UUUUUU555 Тепер, …

3
Потенційна плутанина в дизайні експерименту
Огляд питання Попередження: Це питання потребує багато налаштування. Будь ласка, нехай мене. Я та моя колега працюємо над розробкою експерименту. Дизайн повинен обходити велику кількість обмежень, які я перелічу нижче. Я розробив дизайн, який задовольняє обмеженням і дає нам неупереджені оцінки наших ефектів, що цікавлять. Однак мій колега вважає, що …

1
Відмінності між рандомізованою логістичною регресією та рівнинно-ванільною логістичною регресією
Мені хотілося б знати відмінності між рандомізованою логістичною регресією (RLR) та простою логістичною регресією (LR), тому я читаю статтю "Вибір стабільності" від Meinshausen et al. ; проте я не розумію, що таке RLR і чим відрізняються RLR від LR. Чи може хтось вказати на те, що я повинен прочитати, щоб …

1
Як читати результати тесту Данна?
Як я читаю результати тесту Данна ? Зокрема, про що мені відповідають значення, наведені в таблиці нижче? У мене є непараметричні дані у 4 групах, і я спершу зробив тест Крускала-Уолліса, щоб підтвердити, що розподіли груп не відрізняються один від одного та сукупного набору даних. Потім я використав тест Данна, …

2
Які параметри задньої частини Вішарта-Вішарта?
При виведенні матриці точності ΛΛ\boldsymbol{\Lambda} нормального розподілу, що використовується для генерування NNN D-розмірних векторів x1,..,xNx1,..,xN\mathbf{x_1},..,\mathbf{x_N} xi∼N(μ,Λ−1)xi∼N(μ,Λ−1)\begin{align} \mathbf{x_i} &\sim \mathcal{N}(\boldsymbol{\mu, \Lambda^{-1}}) \\ \end{align} ми зазвичай ставимо Wishart перед ΛΛ\boldsymbol{\Lambda} оскільки розподіл Wishart є кон'югатом до точність багатоваріантного нормального розподілу з відомою середньою і невідомою дисперсією: Λ∼W(υ,Λ0)Λ∼W(υ,Λ0)\begin{align} \mathbf{\Lambda} &\sim \mathcal{W}(\upsilon, \boldsymbol{\Lambda_0}) \\ …

1
Чи є різниця між віддаленим наглядом, самонавчанням, самонавідним навчанням та слабким наглядом?
З того, що я прочитав: Далекий нагляд : A Distant supervision algorithm usually has the following steps: 1] It may have some labeled training data 2] It "has" access to a pool of unlabeled data 3] It has an operator that allows it to sample from this unlabeled data and …

3
Які існують популярні варіанти візуалізації 4-мірних даних?
Скажімо, у мене є наступні чотири розмірні дані, де перші три можна вважати координатами, а останню можна вважати значеннями. c1, c2, c3, value 1, 2, 6, 0.456 34, 34, 12 0.27 12, 1, 66 0.95 Як краще візуалізувати вплив перших трьох координат на останнє значення? Я знаю три методи. Один …

3
Максимальна оцінка вірогідності спільного розподілу з урахуванням лише граничних підрахунків
Нехай - спільний розподіл двох категоріальних змінних , з . Скажімо, вибірок було взято з цього розподілу, але нам дано лише граничні підрахунки, а саме для : X , Y x , y ∈ { 1 , … , K } n j = 1 , … , Kpx,ypx,yp_{x,y}X,YX,YX,Yx,y∈{1,…,K}x,y∈{1,…,K}x,y\in\{1,\ldots,K\}nnnj=1,…,Kj=1,…,Kj=1,\ldots,K Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j),Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j), …

1
Логістична регресія з регресійними сплайнами в R
Я розробляю логістичну модель регресії на основі ретроспективних даних із національної бази травм травми голови у Великобританії. Основним результатом є смертність за 30 днів (позначена як міра "вижити"). Інші заходи з опублікованими доказами значного впливу на результати попередніх досліджень включають: Year - Year of procedure = 1994-2013 Age - Age …

1
Як інтерпретувати графік автокореляції в MCMC
Я знайомлюсь із статистикою Байєса, читаючи книгу " Проведення байєсівського аналізу даних " Джона К. Крушке, також відомого як "цуценя книга". У розділі 9 ієрархічні моделі знайомляться з цим простим прикладом: а спостереження Бернуллі - 3 монети, кожні 10 фліп. Один показує 9 голів, інший 5 голів та інший 1 …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.