Как мы искали лучшие AI-модели (Часть 3)
«Часть 3» серии на
Хабре — практическое руководство по выбору и сравнительному тестированию AI-моделей. Авторы расширили каталог метрик и показали, как строить воспроизводимую оценку качества ответов и калибровки вероятностей.
- Качество классификации: F-β, MCC, Precision@Recall, Recall@Precision, Sensitivity/Specificity, Sensitivity@Specificity, Specificity@Sensitivity.
- Сходство текстов: BLEU/SacreBLEU, ROUGE, BERTScore, InfoLM.
- Ошибки текста: CER, ChrF, Edit/Extended Edit Distance, TER, WER, WIL/WIP.
- Вероятностные и ранжирующие: Cross-Entropy, авторская SACEL, LRAP, Label Ranking Loss, LogAUC, Calibration Error.
В бенчмарке из 15 AI-продуктов лишь 3 показали топовый precision; по recall лидируют 4. Лучший MRR — 0.866 из 1. Максимальную specificity получили 6 продуктов. Типовые сбои: галлюцинации на культурных темах, смешение юридических терминов (реальный ущерб vs упущенная выгода), ложные срабатывания безопасностных фильтров («бомбардир»), устаревшие данные и ошибки в порядках списков.
Команда демонстрирует анализ по логитам/логвероятностям и работу с фиксированными порогами, что позволяет автоматизировать сравнение моделей и искать первопричины неверных ответов (через SACEL и калибровку).