← Назад к списку
ТехническаяData Science и MLJunior

Объясните precision и recall. В каких задачах важнее одна метрика, а в каких другая?

Короткий ответ

  • Precision — доля верных среди предсказанных положительных
  • Recall — доля найденных среди всех реальных положительных
  • Между ними компромисс через порог классификации
  • Recall важнее, когда пропуск дорог: болезни, фрод
  • Precision важнее, когда дорога ложная тревога: спам, блокировки
  • F1 — гармоническое среднее, когда важны обе
  • Accuracy обманчива при дисбалансе классов

Precision отвечает за чистоту положительных предсказаний, recall — за полноту охвата, и выбор приоритета диктуется ценой ошибок в конкретной задаче.

Как сказать вслух

пример ответа

Precision — это насколько можно верить положительным ответам модели: из всего, что она пометила как позитив, какая доля действительно позитив. Recall — какую долю всех реальных позитивов модель нашла. Если пропустить случай дорого, например в диагностике болезни, важнее recall. Если дорого ошибочно обвинить, например заблокировать честного клиента, важнее precision.

Подробный ответ

Основной ответ

Precision = TP / (TP + FP) — доля истинно положительных среди всех предсказанных положительными. Recall = TP / (TP + FN) — доля найденных положительных среди всех реальных. Между ними компромисс: снижая порог, поднимаем recall и роняем precision, и наоборот. Выбор приоритета определяется ценой ошибок. Recall критичен там, где пропуск объекта дорог: медицинский скрининг, поиск мошенничества, отток клиентов. Precision — там, где дорога ложная тревога: спам-фильтр (нельзя терять важные письма), автоматические блокировки. Когда важны обе, используют F1 или F-beta с весом в нужную сторону, а порог подбирают по precision-recall-кривой под бизнес-ограничения.

Ключевые моменты

  • Матрица ошибок. Обе метрики выводятся из confusion matrix; полезно уметь нарисовать её и назвать FP и FN словами задачи.
  • Порог — бизнес-решение. Модель выдаёт вероятности; порог выбирают под требования, например recall не ниже 0.9 при максимальном precision.
  • F-beta. F1 уравнивает метрики, F2 смещает вес к recall, F0.5 — к precision.
  • Дисбаланс классов. При редком положительном классе accuracy почти бесполезна, а precision и recall остаются информативными.

Практический контекст

Один из самых частых вопросов на любом грейде: у junior проверяют формулы, у middle — умение выбрать метрику под задачу. Сильный ход — самому привести пару контрастных примеров и объяснить цену FP и FN в деньгах или рисках. На практике это ежедневная работа: согласовать с бизнесом допустимый уровень ложных срабатываний и зафиксировать его как ограничение при подборе порога.

Частые ошибки

  • Путают формулы местами или не могут объяснить метрики словами без формул
  • Отвечают про метрики, но не привязывают выбор к цене ошибок в задаче
  • Предлагают accuracy для несбалансированных классов

ИП Кочкин Алексей Сергеевич · ИНН 390509026279 · ОГРНИП 325390000030973 · jiniys2005@yandex.ru