Как мы искали лучшие AI-модели (Часть 3)

«Часть 3» серии на — практическое руководство по выбору и сравнительному тестированию AI-моделей. Авторы расширили каталог метрик и показали, как строить воспроизводимую оценку качества ответов и калибровки вероятностей.

  • Качество классификации: F-β, MCC, Precision@Recall, Recall@Precision, Sensitivity/Specificity, Sensitivity@Specificity, Specificity@Sensitivity.
  • Сходство текстов: BLEU/SacreBLEU, ROUGE, BERTScore, InfoLM.
  • Ошибки текста: CER, ChrF, Edit/Extended Edit Distance, TER, WER, WIL/WIP.
  • Вероятностные и ранжирующие: Cross-Entropy, авторская SACEL, LRAP, Label Ranking Loss, LogAUC, Calibration Error.

В бенчмарке из 15 AI-продуктов лишь 3 показали топовый precision; по recall лидируют 4. Лучший MRR — 0.866 из 1. Максимальную specificity получили 6 продуктов. Типовые сбои: галлюцинации на культурных темах, смешение юридических терминов (реальный ущерб vs упущенная выгода), ложные срабатывания безопасностных фильтров («бомбардир»), устаревшие данные и ошибки в порядках списков.

Команда демонстрирует анализ по логитам/логвероятностям и работу с фиксированными порогами, что позволяет автоматизировать сравнение моделей и искать первопричины неверных ответов (через SACEL и калибровку).

← Назад в лентуЧитать оригинал →
✈️ Подписывайтесь на мой Telegram-канал — там еще больше интересного про AdTech, MarTech, AI и многое другое!