Eval harness v2: почему мы выкинули LLM-as-judge на 40% задач
Что было раньше
Шаблонный LLM-as-judge: gpt-4o оценивал ответы агента по rubric (correctness, helpfulness, format). Делал ~9000 проверок в неделю. Кореляция с человеком — 0.71 (acceptable).
Что мы заметили
На задачах с коротким ответом (< 60 токенов) корреляция упала до 0.52. Judge стал систематически переоценивать ответы с уверенным тоном даже при фактических ошибках. На 40% наших задач этот класс ошибок недопустим.
Что сделали
- Для задач с verifiable answer (SQL, JSON, calculations) — deterministic checker (parse + compare).
- Для open-ended — оставили LLM-judge, но добавили confidence calibration: ответы с judge confidence < 0.8 уходят в human review.
- Сложили eval-набор как датасет с golden answers + edge-cases. Версионируется в git.