Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

4
Очікуване число я буду набирати після малювання карт, поки я не отримаю туза, 2, 3 тощо
У мене виникають проблеми з вирішенням наступного. Ви малюєте карти зі стандартної колоди на 52 картки без заміни, поки не отримаєте туза. Ви отримуєте з того, що залишилося, поки не отримаєте 2. Ви продовжуєте роботу з 3. Яке очікуване число ви будете мати після закінчення всієї колоди? Це було природно …

1
Перші кроки навчання для прогнозування фінансових часових періодів за допомогою машинного навчання
Я намагаюся зрозуміти, як використовувати машинне навчання для прогнозування фінансових часових серій 1 або більше кроків у майбутнє. У мене є фінансові часописи з деякими описовими даними, і я хотів би сформувати модель, а потім використовувати модель для прогнозування n-кроків вперед. Що я робив поки що: getSymbols("GOOG") GOOG$sma <- SMA(Cl(GOOG)) …


2
Яка описова статистика не є розмірами ефектів?
У Вікіпедії йдеться розмір ефекту - це міра сили явища чи оцінка на основі вибірки цієї кількості. Розмір ефекту, обчислений на основі даних, є описовою статистикою, яка передає оцінену величину взаємозв'язку, не роблячи жодних тверджень про те, чи відображається очевидний зв'язок у даних справжніх стосунків у сукупності. Щоб краще зрозуміти, …

2
Відношення суми Нормального до суми кубів Нормального
Будь ласка, допоможіть мені знайти обмежуючий розподіл (як ) з наступного: де - iid .U n = X 1 + X 2 + … + X nn → ∞n→∞n \rightarrow \inftyXiN(0,1)Uн= X1+ X2+ … + XнХ31+ X32+ … X3н,Un=X1+X2+…+XnX13+X23+…Xn3, U_n = \frac{X_1 + X_2 + \ldots + X_n}{X_1^3 + X_2^3 …

2
Назва "парадокса", про який повідомив Гельман
У книзі Ендрю Гелмана "Червона держава, Блакитна держава" він аналізує той факт, що багаті люди в певних штатах прагнуть голосувати більше за республіканців, ніж за бідних людей, але заможні держави схильні голосувати більш демократично, ніж бідні. Чи є назва цього парадоксу? Мені здається, це пов'язане з екологічним парадоксам, але не …
12 paradox 

2
Як перевірити на наддисперсію в Poisson GLMM з lmer () в R?
У мене є така модель: > model1<-lmer(aph.remain~sMFS1+sAG1+sSHDI1+sbare+season+crop +(1|landscape),family=poisson) ... і це підсумок. > summary(model1) Generalized linear mixed model fit by the Laplace approximation Formula: aph.remain ~ sMFS1 + sAG1 + sSHDI1 + sbare + season + crop + (1 | landscape) AIC BIC logLik deviance 4057 4088 -2019 4039 Random …

2
Коли дані мають гаусовий розподіл, скільки зразків буде характеризувати їх?
Для гауссових даних, що поширюються в одному вимірі, потрібні два параметри для їх характеристики (середня величина, дисперсія), і подейкують, що для оцінювання цих параметрів з достатньо високою достовірністю зазвичай вистачає приблизно 30 випадково вибраних зразків. Але що відбувається, коли кількість розмірів збільшується? У двох вимірах (наприклад, висота, вага) потрібно 5 …

2
Який очікуваний розподіл залишків у узагальненій лінійній моделі?
Я виконую узагальнену лінійну модель, де мені потрібно вказати сім’ю, відмінну від звичайної. Який очікуваний розподіл залишків? Наприклад, чи слід нормально розподіляти залишки?

3
У Naive Bayes характерні ймовірності: чи слід подвоїти кількість слів?
Я прототипував свою власну модель Naive Bayes o 'слова слів, і у мене виникло питання щодо обчислення ймовірностей функції. Скажімо, у мене два класи, я буду просто використовувати спам та не-спам, оскільки саме цим користуються всі. І візьмемо для прикладу слово "віагра". У мене в навчальному наборі 10 електронних листів, …

5
Пакети вибору функцій в R, які регресують і класифікують
Заблокований . Це запитання та його відповіді заблоковано, оскільки це питання поза темою, але має історичне значення. Наразі не приймає нових відповідей чи взаємодій. Я дуже новачок у Р. Я зараз навчаюсь машинного навчання. Дуже шкода, якщо це питання видається дуже основним. Я намагаюся знайти гарний пакет вибору функцій у …


3
Чи застосовується процедура Mundlak з фіксованими ефектами для логістичної регресії з манекенами?
У мене є набір даних із 8000 кластерами та 4 мільйонами спостережень. На жаль, моє статистичне програмне забезпечення, Stata, працює досить повільно, коли використовує свою панельну функцію даних для логістичної регресії: xtlogitнавіть з 10% підпробою. Однак при використанні непанельної logitфункції результати з’являються набагато швидше. Тому я можу отримати користь від …

5
Чи чарівне число 20?
У мене є посилання, які радили враховувати розмір вибірки мінімум 20 для розподілу відповідних даних. Чи є в цьому сенс? Дякую

3
Прогнозування даних підрахунку з випадковим лісом
Чи можна навчитись випадковому лісу для відповідного прогнозування даних підрахунку? Як би це діяло? У мене досить широкий діапазон значень, тому класифікація насправді не має сенсу. Якби я застосував регресію, я б просто врізав результати? Я тут зовсім загубився. Будь-які ідеї?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.