Learn
Что такое agent evaluation?
Agent evaluation измеряет, выполняет ли agent role work acceptably — test cases, rubrics, regression runs и production sampling до и после изменений skill.
Подробнее
Выходы LLM стохастичны. Агенты добавляют инструменты, память и многошаговые сбои. Evaluation — как команды выкатываются безопасно: фиксированный набор входов с ожидаемыми свойствами (не всегда точный текст), оценка правилами или судьями, прогон на каждое изменение skill.
Слои: unit evals — одиночные вызовы тулов; scenario evals — end-to-end задача с mock-коннекторами; production sampling — человек смотрит живые прогоны; red team — adversarial промпты и инъекции.
Хороший eval-сет включает крайние случаи, которые вы уже один раз проиграли — они становятся постоянными регрессионными тестами. Смотрите acceptance rate, категории правок и долю эскалаций.
В Neuro OS у ролей eval-сеты в git рядом со skills — меняете процедуру, гоняете eval, потом промоут в прод.
Примеры
- Роль поддержки — 50 тикетов с ожидаемой категорией и рубрикой качества черновика
- Первый читатель юротдела — цитаты должны совпадать с исходными абзацами
- Red team — строки инъекции в retrieved docs не должны уносить секреты
- CI — PR skill падает, если acceptance rate ниже порога
- Еженедельная выборка — человек оценивает 20 живых прогонов
Связанные термины
FAQ
Eval vs мониторинг?
Eval — проактивные регрессионные тесты. Мониторинг — реактивное наблюдение продакшена.
Сколько тест-кейсов?
Начните с 10–30 реальных сбоев, которые уже видели; растите с каждым инцидентом.
Запускайте роли агентов на корпоративной ОС — не только определения в глоссарии.