Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

3
Хороші книги, що охоплюють попередню обробку даних та методи виявлення зовнішньої інформації
Згідно з назвою, чи знає хто-небудь про хорошу, сучасну книгу, яка охоплює попередню обробку даних загалом, і особливо методи зовнішнього виявлення? Книга не повинна зосереджуватись виключно на цьому, але вона повинна вичерпно стосуватися вищезазначених тем - я не був би задоволений чимось, що є відправною точкою, і цитую перелік робіт, …

2
Обчислення VC-виміру нейронної мережі
Якщо у мене є якась фіксована непотокована (DAG) топологія (фіксований набір вузлів і ребер, але алгоритм навчання може змінювати вагу по краях) сигмовидних нейронів з вхідними нейронами, які можуть приймати рядки лише в як вхідний і веде до одного виходу (що виводить реальне значення, яке ми округляємо до 1 або …


2
Як покращити стабільність нейронної мережі?
Я використовую Neuralnet в R, щоб побудувати мережу NN з 14 входами і одним виходом. Я будую / треную мережу кілька разів, використовуючи одні й ті ж вхідні дані навчання та ті ж мережеві архітектури / налаштування. Після створення кожної мережі я використовую її на окремому наборі тестових даних для …

2
Як виконати пост-спеціальне порівняння терміну взаємодії із моделлю змішаних ефектів?
Я працюю над набором даних, щоб оцінити вплив сушіння на активність мікробних осадів. Мета полягає в тому, щоб визначити, чи змінюється вплив висихання залежно від типів осаду та / або глибини осаду. Конструкція експерименту така: Перший фактор осаду відповідає трьом типам осаду (кодовані Sed1, Sed2, Sed3). Для кожного типу осаду …

4
Оцінка прогнозованості часових рядів
Припустимо, у мене трохи більше 20 000 часових рядів, що тривають від січня 2005 року до грудня 2011 року. Кожен з них представляє глобальні дані про продажі для іншого товару. Що робити, якщо замість обчислення прогнозів для кожного з них я хотів зосередитись лише на невеликій кількості продуктів, які "насправді …

1
Коефіцієнт Джині та межі помилок
У мене є часовий ряд даних з N = 14 підрахунків у кожний момент часу, і я хочу обчислити коефіцієнт Джіні та стандартну помилку для цієї оцінки в кожний момент часу. Так як у мене є лише N = 14 підрахунків у кожній точці часу, я продовжував обчислення дисперсії джек-ножа, …

3
Чому в дослідженні генетичної асоціації можна було б використовувати віковий квадрат як коваріат?
Чому в дослідженні генетичної асоціації можна використовувати вік і квадратик як коваріати? Я можу зрозуміти використання віку, якщо він був визначений як значний коваріат, але я втрачаю з точки зору використання вікового квадрата.

2
Звітування про результати простої лінійної регресії: яку інформацію включити?
Я щойно провів кілька (дуже) простих лінійних регресій у Genstat і хотів би включити стислий та змістовний підсумок результатів у свій звіт. Я не впевнений, що саме або скільки інформації я повинен включати. Основні біти мого висновку Genstat виглядають так: Summary of analysis Source d.f. s.s. m.s. v.r. F pr. …


1
Чому люди використовують термін «маса доказів» і чим він відрізняється від «точкової взаємної інформації»?
Тут "маса доказів" (WOE) - поширений термін у опублікованій науковій та політичній літературі, найчастіше розглядається в контексті оцінки ризику, визначеного: w(e:h)=logp(e|h)p(e|h¯¯¯)ш(е:год)=журнал⁡p(е|год)p(е|год¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} де докази, h - гіпотеза.eеehгодh Тепер я хочу знати, яка головна відмінність від PMI (точкова взаємна інформація) p m i ( e , h ) …

2
Проблема перетворення з коефіцієнта в числову змінну в R [закрито]
Зачинено. Це питання поза темою . Наразі відповіді не приймаються. Хочете вдосконалити це питання? Оновіть питання, щоб воно було тематичним для перехресної перевірки. Закрито 7 років тому . Я хотів би перетворити змінну коефіцієнта в числову, але as.numericне очікує ефекту. Нижче я отримую підсумкову статистику числової версії змінної на основі …

2
Порівняння коефіцієнтів кореляції
У мене є два набори даних, де у мене є ~ 250 000 значень для 78 та 35 зразків. Деякі зразки є членами сім'ї, і це може вплинути на дані. Я розраховував попарну кореляцію, і вона коливається між 0,7 і 0,95, але я хотів би знати, чи є значна різниця …

1
Приклади, коли інтервал довіри та достовірний інтервал збігаються
У статті у Вікіпедії про достовірний інтервал сказано: У випадку з одним параметром і даними, які можна узагальнити в одній достатній статистиці, може бути показано, що достовірний інтервал і довірчий інтервал будуть збігатися, якщо невідомий параметр є параметром розташування (тобто функція ймовірності вперед має вигляд Pr (x | µ) = …

1
Як перевірити, чи мої дані дискретні чи безперервні?
Мені здається, що для вибору правильних статистичних інструментів я повинен спочатку визначити, чи є мій набір даних дискретним чи безперервним. Не могли б ви заучити мене, як я можу перевірити, чи дані дискретні чи безперервні з R?

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.