Статистика та великі дані

Питання та відповіді для людей, зацікавлених у статистиці, машинному навчанні, аналізі даних, інтелектуальному аналізу даних та візуалізації даних

2
Поступова регресія Гаусса
Я хочу здійснити поступову регресію процесу гауса, використовуючи розсувне вікно над точками даних, які надходять по черзі через потік. Дозволяє гddпозначають розмірність вхідного простору. Отже, кожен пункт даниххixix_i має гdd кількість елементів. Дозволяє нnn бути розміром розсувного вікна. Для того, щоб робити прогнози, мені потрібно обчислити зворотну грамматрицю КKK, де …

2
Різниця в засобах проти середньої різниці
Вивчаючи два незалежні засоби вибірки, нам кажуть, що ми дивимось на "різницю двох засобів". Це означає, що ми беремо середнє значення від сукупності 1 ( ) і віднімаємо з нього середнє значення від сукупності 2 ( ). Отже, наша "різниця у двох засобах" - це ( - ).у¯1у¯1\bar y_1у¯2у¯2\bar y_2у¯1у¯1\bar …

1
Розуміння дробово-диференціальної формули
У мене є часовий ряд і я хотів би моделювати його як процес ARFIMA (він же FARIMA). Якщо інтегрований у (дробовий) порядок , я хотів би дробово відрізнити його, щоб зробити його нерухомим.утyty_tутyty_tгdd Запитання : чи правильна наступна формула, що визначає дробову диференціацію? Δгут: =ут- дуt - 1+г( д- 1 …

1
Різниця між обертаннями варімаксу та обліміну в факторному аналізі
Яка різниця між обертанням варімакса і обертанням обліміна в факторному аналізі? Також мене плутає взаємозв'язок між аналізом основних компонентів, обертанням варімакса та аналітичним факторним аналізом, як теоретично, так і в SPSS. Як вони пов'язані?

5
Статистика тесту Дурбіна Уотсона
Я застосував тест DW до моєї регресійної моделі в R, і я отримав статистику тесту DW 1,78 і p-значення 2,2e-16 = 0. Чи означає це, що між залишками не існує автокореляції, тому що stat близький до 2 з невеликим p-значенням чи це означає, хоча stat є близьким до 2, p-значення …

1
Чи не пов'язані оцінки коефіцієнтів регресії?
Розглянемо просту регресію (нормальність не передбачається): Yi= a + bХi+еi,Yi=a+bXi+ei,Y_i = a + b X_i + e_i, де еieie_i з середнім значенням 000 і стандартне відхилення σσ\sigma. Оцінки найменших квадратнихаaa і бbb некорельований?

2
Чому PCA максимізує загальну дисперсію проекції?
Крістофер Бішоп пише у своїй книзі Розпізнавання візерунків та машинне навчання доказом того, що кожен послідовний головний компонент максимізує дисперсію проекції до одного виміру після того, як дані проектуються в ортогональний простір до вибраних раніше компонентів. Інші демонструють подібні докази. Однак це лише доводить, що кожна послідовна складова є найкращою …

2
Чи f-міра є синонімом точності?
Я розумію, що f-міра (заснована на точності та відкликання) - це оцінка того, наскільки точним є класифікатор. Крім того, f-міра віддається перевазі точності, коли у нас є неврівноважений набір даних. У мене просте запитання (яке стосується скоріше використання правильної термінології, ніж щодо технології). У мене незбалансований набір даних і я …

2
Розподіл за процентними даними
У мене є питання про правильний розподіл, який потрібно використовувати для створення моделі з моїми даними. Я провів лісову інвентаризацію на 50 ділянок, кожна ділянка розміром 20м × 50м. Для кожної ділянки я оцінив відсоток козирка дерев, що затінює землю. Кожна ділянка має одне значення, у відсотках, для покриття навісом. …

3
Чому я отримую ентропію інформації більше 1?
Я реалізував таку функцію для обчислення ентропії: from math import log def calc_entropy(probs): my_sum = 0 for p in probs: if p > 0: my_sum += p * log(p, 2) return - my_sum Результат: >>> calc_entropy([1/7.0, 1/7.0, 5/7.0]) 1.1488348542809168 >>> from scipy.stats import entropy # using a built-in package # …

1
Параметр нецентральності - що це таке, що він робить, що було б запропонованим значенням?
Я намагався підняти свої статистичні знання, особливо стосовно визначення розміру вибірки та статистичного аналізу потужності. Але здається, що чим більше я читаю, тим більше мені потрібно читати. У будь-якому випадку я знайшов інструмент під назвою G * Power, який, здається, робить усе, що мені потрібно, але у мене виникає проблема, …

1
Припущення про нормальність при лінійній регресії
Як припущення про лінійну регресію, нормальність розподілу помилки іноді помилково "розширюється" або трактується як потреба в нормальності y або x. Чи можливо побудувати сценарій / набір даних, що там, де X і Y ненормальні, але термін помилки є, і тому отримані оцінки лінійної регресії є дійсними?

3
Чи можуть значення масштабування в лінійному дискримінантному аналізі (LDA) використовуватися для побудови пояснювальних змінних лінійних дискримінантів?
Використовуючи біплот значень, отриманих за допомогою аналізу основних компонентів, можна досліджувати пояснювальні змінні, що складають кожен компонент принципу. Чи можливо це також за допомогою лінійного дискримінаційного аналізу? Наведені приклади використання даних "Дані Іриса Едгара Андерсона" ( http://en.wikipedia.org/wiki/Iris_flower_data_set ). Ось дані райдужки : id SLength SWidth PLength PWidth species 1 5.1 …

2
Кореляція між двома колодами карт?
Я написав програму для імітації перемикання накладних карт. Кожна карта пронумерована, з костюмом, що йде від CLUBS, DIAMONDS, HEARTS, SPADESта до двох до десяти, потім Джек, Королева, Кінг та Ейс. Таким чином, два клуби мають число 1, три клуби - 2 .... туз клубів - 13 ... туз піки - …

3
Як правильно застосувати постмеханічний тест Nemenyi після тесту Фрідмана
Я порівнюю продуктивність декількох алгоритмів у кількох наборах даних. Оскільки ці показники ефективності не гарантуються нормально розподіленими, я обрав тест Фрідмана за допомогою спеціального тесту Nemenyi на основі Демшара (2006) . Потім я знайшов ще один документ, який, окрім запропонованих інших методів, таких як тест Quade з подальшим пост-хоковим тестом …

Використовуючи наш веб-сайт, ви визнаєте, що прочитали та зрозуміли наші Політику щодо файлів cookie та Політику конфіденційності.
Licensed under cc by-sa 3.0 with attribution required.