2026-04-28

Eval harness v2: почему мы выкинули LLM-as-judge на 40% задач

#AI #LLM #eval

Что было раньше

Шаблонный LLM-as-judge: gpt-4o оценивал ответы агента по rubric (correctness, helpfulness, format). Делал ~9000 проверок в неделю. Кореляция с человеком — 0.71 (acceptable).

Что мы заметили

На задачах с коротким ответом (< 60 токенов) корреляция упала до 0.52. Judge стал систематически переоценивать ответы с уверенным тоном даже при фактических ошибках. На 40% наших задач этот класс ошибок недопустим.

Что сделали

  • Для задач с verifiable answer (SQL, JSON, calculations) — deterministic checker (parse + compare).
  • Для open-ended — оставили LLM-judge, но добавили confidence calibration: ответы с judge confidence < 0.8 уходят в human review.
  • Сложили eval-набор как датасет с golden answers + edge-cases. Версионируется в git.

← все заметки