Навчальний простір / Python
Основи штучного інтелекту

EDA: розподіли, зв’язки та перевірювані гіпотези

EDA пов’язує питання з конкретними спостереженнями.

Зміст матеріалу

Що ви опануєте

Ви навчитеся досліджувати дані через конкретні питання, описувати розподіли та зв’язки й формулювати гіпотези без передчасного причинного висновку. EDA, exploratory data analysis, — дослідницький аналіз даних. Він допомагає знайти помилки, структуру й напрями наступної перевірки, а не автоматично підтверджує всі побачені закономірності.

Питання до аналізу

Спочатку визначте одиницю спостереження й походження колонок. Запитайте: чи є пропуски, чи збігаються одиниці, які класи представлені, чи є повтори та крайні значення. Потім сформулюйте предметне питання: «чи відрізняється розподіл довжини пелюстки між видами Iris?» Воно задає потрібні групи й вимірювання.

Гіпотеза — твердження, яке можна перевірити за визначеною процедурою. Дослідницька гіпотеза виникає після перегляду даних; підтверджувальна перевірка потребує врахування того, що питання вже було обране за спостереженням. Велика кількість пошуків збільшує ймовірність випадкових яскравих зв’язків. Тому журнал питань важливий для інтерпретації.

Розподіл і описові показники

Середнє описує арифметичний центр, медіана — середню позицію у впорядкованому наборі. Квантіль задає значення, нижче якого лежить певна частка даних за визначеним правилом обчислення. Стандартне відхилення характеризує розкид відносно середнього. Для асиметричних розподілів і крайніх значень ці показники можуть давати різні акценти.

Гістограма групує числові значення в інтервали. Вибір ширини бінів змінює вигляд, тому одна картинка не доводить форму розподілу. Boxplot показує медіану, квартилі та визначене правило whiskers. Точки за whiskers є кандидатами на дослідження, а не автоматично помилками для видалення.

Виконуваний приклад Iris

python
from sklearn.datasets import load_iris
import matplotlib.pyplot as plt

iris = load_iris(as_frame=True)
df = iris.frame
feature = "petal length (cm)"
print(df.groupby("target")[feature].agg(["count", "mean", "median", "std"]))
for target, group in df.groupby("target"):
    plt.hist(group[feature], bins=10, alpha=0.5,
             label=iris.target_names[int(target)])
plt.xlabel(feature)
plt.ylabel("Кількість вимірювань")
plt.legend()
plt.tight_layout()
plt.show()

as_frame=True повертає pandas представлення з назвами. groupby розділяє записи за ціллю, agg виконує кілька узагальнень. Назви target_names надають зміст числовим міткам. Очікуються три групи по 50 рядків. Графік показує відмінності й перекриття; він не встановлює причинний вплив ознаки на вид.

Зв’язки та кореляція

Кореляція описує певний вид статистичного зв’язку. Коефіцієнт Pearson оцінює лінійну залежність і лежить між −1 та 1 для ненульової дисперсії. Слабка лінійна кореляція не виключає нелінійного зв’язку. Висока кореляція не доводить причинності: обидві змінні можуть залежати від третього чинника або від способу збору.

Scatterplot показує пари значень і допомагає побачити нелінійність, групи та крайні точки. Загальний зв’язок може відрізнятися від зв’язку всередині кожної групи. Для Iris колір виду може пояснювати кластери вимірювань. Якщо ціль використано для EDA, це не означає, що вона дозволена серед вхідних ознак прогнозу.

Викиди та якість

Викид — спостереження, яке суттєво відрізняється за визначеним правилом. Причиною може бути помилка одиниць, рідкісний коректний об’єкт або зміна процесу. Перевірте первинний запис і предметний діапазон. Видалення всіх незручних точок може приховати важливу частину задачі й завищити метрику.

Порівняйте аналіз до й після обґрунтованого очищення. Збережіть кількість змінених записів і причину. Якщо рішення про видалення спирається на ціль або весь test, воно може створити витік. Для ML експерименту EDA, що впливає на вибір ознак, виконують у межах навчальної частини або за заздалегідь визначеним протоколом.

Інтерпретація гіпотези

Запишіть твердження, показник, спосіб порівняння й можливі пояснення. Наприклад, різниця середніх може бути пов’язана з групою, але діапазони можуть перекриватися. Звіт має показувати число спостережень і розкид. Формальний статистичний тест потребує власних припущень і перевірки умов; значення p не є ймовірністю істинності гіпотези.

Практична значущість стосується величини ефекту й його користі для рішення. Маленька різниця може бути статистично помітною на великій вибірці й не допомагати прогнозу. Навпаки, маленький набір може дати непевну оцінку важливої різниці. Збережіть обидві частини інтерпретації та межі узагальнення.

Типові помилки та практика

Помилки: unlabeled осі, прихований розмір груп, причинні висновки з кореляції, добір лише красивих графіків і очищення без журналу. Кожен графік має відповідати питанням і містити одиниці. Проміжні знахідки позначайте як дослідницькі, а подальший експеримент плануйте окремо.

Практичне осмислення

Порівняйте petal width і sepal width між видами. Яка характеристика має більше перекриття? Перевірте її scatterplot з petal length. Сформулюйте дві дослідницькі гіпотези й опишіть, які незалежні дані потрібні для їх перевірки. Поясніть, чому графік не доводить точність класифікатора.

Гіпотеза, описові дані та незалежна перевірка

Дослідницька гіпотеза формулює очікуваний зв’язок, який можна спостерігати за визначеною характеристикою. Наприклад, медіана попиту у робочі дні може відрізнятися від вихідних. Спочатку задайте групи й показник, потім обчисліть таблицю. Якщо вибрати показник лише після пошуку найвиразнішого графіка, висновок потребує особливо обережної незалежної перевірки.

У таблиці для груп збережіть кількість, медіану та розкид. Група з кількома спостереженнями дає менш стабільний опис, ніж велика за подібних умов. На графіку позначте одиниці, масштаб і період. Для часового набору додайте тренд, бо зміна між роками може пояснювати частину групової різниці.

Кореляція описує спільну зміну показників у цих даних. Вона може виникати через спільну причину, спосіб відбору або прямий зв’язок. Для висновку про причинний ефект потрібна відповідна постановка, контроль змішувальних факторів або експеримент. EDA допомагає знайти питання й перевірити правдоподібність, не встановлюючи механізм автоматично.

Перед моделюванням визначте, яка частина даних доступна для EDA. Детальне вивчення фінального test із ціллю може вплинути на вибір ознак і моделей. Для навчального описового аналізу всього набору це дозволено за іншої мети, але отримані спостереження не є незалежною оцінкою майбутнього класифікатора. У звіті явно назвіть мету аналізу та які висновки потребують нового набору. Це допомагає узгодити дослідження й процедуру оцінювання.

Схема процесу

EDA: розподіли, зв’язки та перевірювані гіпотезиОберіть елемент, щоб побачити пояснення

Визначаємо предметну гіпотезу.

Самоперевірка

Перевірте розуміння
Чи доводить висока кореляція причинність?
Як обґрунтувати відповідь своїми словами?
Кореляція описує статистичний зв’язок. Причинний висновок потребує окремої постановки й доказів.

Підсумок

EDA пов’язує питання з конкретними спостереженнями. Розподіли, групи й кореляції допомагають сформувати гіпотези та знайти помилки. Причинність, значущість і якість прогнозу потребують окремих перевірок.

Джерела

Опрацювали матеріал?

Збережіть цей крок у своєму прогресі.

← Повернутися до дисципліни
© 2026 Анастасія Іскандарова-МалаЕлектронний навчальний посібник · ДДТУ

Пошук у посібнику

Спробуйте «C++», «RAII» або «бази даних».