Що ви опануєте
Ви навчитеся описувати задачу машинного навчання через одиницю спостереження, ознаки, ціль і спосіб оцінювання. Зможете розрізняти класифікацію, регресію та кластеризацію, визначати baseline і виявляти витік інформації. Приклади використовують навчальні набори з вимірюваннями об’єктів; висновки стосуються лише визначеної задачі.
AI та машинне навчання
Штучний інтелект охоплює методи створення систем, що виконують задачі сприйняття, пошуку, міркування, планування чи генерації. Машинне навчання використовує дані для побудови моделі закономірностей. Модель відображає вхідні ознаки в прогноз або інше представлення. Навчання визначає параметри, а використання застосовує вже визначене правило до нового входу.
Ознака — характеристика, доступна на момент прогнозу. Ціль — величина, яку потрібно передбачити за supervised learning. Спостереження — один рядок даних із визначеним змістом. Для вимірювань квітки ознаками можуть бути довжини й ширини частин, ціллю — вид. ID рядка може допомагати обліку й не бути корисною предметною ознакою.
Види задач
Класифікація прогнозує категорію: один із видів квітки. Регресія прогнозує числову величину. Кластеризація групує схожі спостереження без заданих класових міток. Supervised learning використовує приклади ознак і відомої цілі. Unsupervised learning шукає структуру без такої цілі. Назва методу має відповідати результату, потрібному користувачу.
Одна предметна потреба може мати кілька формулювань. Передбачення точного часу виконання завдання є регресією, а категорії «вчасно/із затримкою» — класифікацією. Категоризація втрачає частину інформації й змінює метрики. Спочатку визначте рішення, яке буде прийнято за прогнозом, і ціну різних помилок.
Постановка й доступність ознак
Запишіть: хто використовує результат, для якого об’єкта й моменту, що відомо на вході та як перевіряється відповідь. Якщо ознака з’являється після події, її використання створює витік інформації. Приклад — підсумкова оцінка як вхід для прогнозу успішності до іспиту. Така модель може показати високу якість на таблиці й бути непридатною у визначений момент.
Окремо перевірте, як зібрано вибірку. Повторні записи одного об’єкта можуть потрапити і до train, і до test. Тоді перевірка частково вимірює запам’ятовування об’єкта. Поділ має відповідати майбутньому використанню: за часом, групами або незалежними спостереженнями.
Baseline і чесне оцінювання
Baseline — простий відтворюваний орієнтир, з яким порівнюють модель. Для класифікації можна завжди прогнозувати найчастіший клас; для регресії — середню ціль train. Якщо складна модель не перевищує baseline за релевантною метрикою, потрібно перевірити дані, постановку й процедуру навчання.
from sklearn.datasets import load_iris
from sklearn.model_selection import train_test_split
from sklearn.dummy import DummyClassifier
from sklearn.metrics import accuracy_score
data = load_iris()
X_train, X_test, y_train, y_test = train_test_split(
data.data, data.target, test_size=0.2, random_state=42,
stratify=data.target,
)
model = DummyClassifier(strategy="most_frequent")
model.fit(X_train, y_train) # Правило визначається лише за train.
predicted = model.predict(X_test)
print(accuracy_score(y_test, predicted))
X містить матрицю ознак, y — мітки. train_test_split створює незалежні частини за заданим seed. stratify підтримує пропорції класів. DummyClassifier не шукає складну закономірність: він задає орієнтир. Для збалансованого Iris очікується accuracy близько третини. Це ще не оцінювання навченого предметного алгоритму.
Train, validation і test
Train використовується для визначення параметрів моделі. Validation допомагає обирати налаштування. Test дає фінальну оцінку після завершення вибору. Якщо багато разів підбирати модель за test, він перестає бути незалежним. Навіть звичайне рішення «залишити той seed, де результат вищий» може спотворити оцінювання.
Процедура має бути відтворюваною: збережіть джерело й версію даних, спосіб поділу, параметри та метрику. Випадковий seed контролює певні випадкові операції, але не гарантує ідентичність у всіх версіях бібліотек і платформах. Фіксація середовища й протоколу залишається потрібною.
Межі та відповідальність
Прогноз має невизначеність і помилки. Метрика на test описує конкретну вибірку й процедуру, а не всіх майбутніх користувачів. Зміна джерела даних або умов вимірювання може погіршити результат. Для рішень із високою ціною помилки потрібні додаткові перевірки, людина в контурі й визначені умови відмови.
Дані можуть містити персональну інформацію. Використовуйте набори з дозволеним навчальним використанням і не публікуйте приватні записи. Наявність файлу на Kaggle не скасовує перевірки ліцензії та походження. Для навчання корисно обирати доступні перевірені datasets з документацією.
Типові помилки й практика
Помилки: ціль не відповідає потребі, ознака недоступна під час прогнозу, оцінка лише на train і відсутній baseline. Перший робочий notebook має показувати одиницю спостереження, поділ і простий орієнтир. Це допомагає перевірити постановку до витрат на складні моделі.
Практичний аналіз
Сформулюйте задачу прогнозу потреби в обладнанні до початку тижня. Які дані вже відомі? Які з’являються пізніше? Визначте ціль і baseline. Поясніть, чому підсумкова кількість звернень за цей тиждень не може бути вхідною ознакою такого прогнозу.
Як перейти до роботи з відкритими каталогами
Відкритий dataset — набір, для якого визначено умови доступу й використання. Сторінка у Kaggle або UCI має допомогти знайти автора, першоджерело, ліцензію, опис полів та спосіб отримання. Сам факт безкоштовного завантаження не описує всі дозволи. Перевіряйте конкретну ліцензію й умови зазначення авторства до публікації власного notebook.
Почніть із паспорта: одиниця спостереження, спосіб збору, період, географія, ознаки, ціль, пропуски та версія файла. Два набори з однаковими назвами колонок можуть описувати різні процеси. Наприклад, один рядок може представляти людину, її відвідування або сумарний день. Це впливає на незалежність спостережень і спосіб поділу.
У Kaggle зручно поєднати dataset і виконаний notebook. Збережіть посилання на обрану версію, пояснення джерела та середовище. Для UCI можна читати конкретний CSV з архіву або використовувати документований клієнт. Лабораторні цієї дисципліни використовують зовнішні набори UCI та власний вибір із Kaggle/UCI; вбудований Iris у лекції лише робить короткий приклад відтворюваним.
Після завантаження поставте предметне питання. Для Bike Sharing можна прогнозувати кількість оренд наступного дня; для Bank Marketing — імовірність згоди до дзвінка. В обох випадках момент прогнозування визначає дозволені ознаки. Поле, яке з’являється після результату, треба виключити навіть за його високої кореляції з ціллю. У паспорті позначте час доступності кожної потрібної ознаки та спосіб перевірки цього твердження.
Схема процесу
Визначаємо рішення, яке підтримує прогноз.
Самоперевірка
Як обґрунтувати відповідь своїми словами?
Підсумок
ML починається з перевірюваної постановки й доступних даних. Baseline та незалежний поділ допомагають оцінити користь навчання. Витік інформації й зміна умов обмежують інтерпретацію метрик.