Оцінка моделей: precision, recall та F1-міра
3 вересня 2026 р.

Ви навчили модель класифікації, і вона показує 95% точності. Звучить чудово — але це може бути повним провалом. Щоб розуміти, наскільки модель справді хороша, потрібні правильні метрики, і точність (accuracy) серед них далеко не завжди головна.
Чому точності недостатньо
Уявіть задачу виявлення рідкісного захворювання, яке трапляється в 1% людей. Модель, що завжди каже «здоровий», матиме 99% точності — і при цьому буде абсолютно марною, бо не виявить жодного хворого. Це проблема незбалансованих класів, і саме тут точність оманлива.
Матриця невідповідностей
Щоб зрозуміти поведінку моделі, будують матрицю невідповідностей (confusion matrix). Вона розкладає всі прогнози на чотири типи:
- True Positive (TP) — модель сказала «так», і це правда.
- True Negative (TN) — модель сказала «ні», і це правда.
- False Positive (FP) — модель сказала «так», але помилилася (хибна тривога).
- False Negative (FN) — модель сказала «ні», але пропустила реальний випадок.
Саме з цих чотирьох чисел виводять усі корисні метрики.
Precision
Precision (точність прогнозу) відповідає на питання: серед усіх випадків, які модель позначила як позитивні, скільки насправді позитивні? Формально це TP поділене на суму TP і FP.
Висока precision важлива, коли дорого коштує хибна тривога. Наприклад, якщо спам-фільтр позначить важливий лист як спам (FP), користувач його не побачить — тому тут precision критична.
Recall
Recall (повнота) відповідає на інше питання: серед усіх справді позитивних випадків, скільки модель знайшла? Це TP поділене на суму TP і FN.
Високий recall важливий, коли дорого пропустити реальний випадок. У виявленні захворювання пропустити хворого (FN) значно небезпечніше, ніж зайвий раз перестрахуватися, тому тут головне — recall.
Компроміс між ними
Precision і recall зазвичай тягнуть у різні боки. Якщо зробити модель обережнішою й позначати «так» лише за повної впевненості, зросте precision, але впаде recall. І навпаки. Тому важливо заздалегідь розуміти, що дорожче для вашої задачі — хибні тривоги чи пропущені випадки.
F1-міра
Коли потрібен баланс, використовують F1-міру — гармонійне середнє precision і recall. Вона висока лише тоді, коли обидві метрики хороші, і різко падає, якщо хоч одна з них низька. F1 зручна як єдиний показник для порівняння моделей, особливо на незбалансованих даних.
Як обрати метрику
Універсальної відповіді немає — усе залежить від задачі. Запитайте себе: що коштує дорожче — хибна тривога чи пропуск? Якщо перше — дивіться на precision, якщо друге — на recall, якщо важливі обидва — на F1. А для незбалансованих класів точність краще не використовувати як головну метрику взагалі.
Підсумок
Точність — оманлива метрика, особливо на незбалансованих даних. Матриця невідповідностей розкладає прогнози на TP, TN, FP і FN, а з них виводять precision (наскільки можна довіряти позитивним прогнозам) і recall (скільки реальних випадків знайдено). F1-міра поєднує їх в одне число. Вибір правильної метрики під конкретну задачу — навичка, що відрізняє зрілого фахівця від новачка.