Pattern Automation
← Глоссарий

Learn

Что такое agent evaluation?

Agent evaluation измеряет, выполняет ли agent role work acceptably — test cases, rubrics, regression runs и production sampling до и после изменений skill.

Подробнее

Выходы LLM стохастичны. Агенты добавляют инструменты, память и многошаговые сбои. Evaluation — как команды выкатываются безопасно: фиксированный набор входов с ожидаемыми свойствами (не всегда точный текст), оценка правилами или судьями, прогон на каждое изменение skill.

Слои: unit evals — одиночные вызовы тулов; scenario evals — end-to-end задача с mock-коннекторами; production sampling — человек смотрит живые прогоны; red team — adversarial промпты и инъекции.

Хороший eval-сет включает крайние случаи, которые вы уже один раз проиграли — они становятся постоянными регрессионными тестами. Смотрите acceptance rate, категории правок и долю эскалаций.

В Neuro OS у ролей eval-сеты в git рядом со skills — меняете процедуру, гоняете eval, потом промоут в прод.

Примеры

  • Роль поддержки — 50 тикетов с ожидаемой категорией и рубрикой качества черновика
  • Первый читатель юротдела — цитаты должны совпадать с исходными абзацами
  • Red team — строки инъекции в retrieved docs не должны уносить секреты
  • CI — PR skill падает, если acceptance rate ниже порога
  • Еженедельная выборка — человек оценивает 20 живых прогонов

Связанные термины

FAQ

Eval vs мониторинг?

Eval — проактивные регрессионные тесты. Мониторинг — реактивное наблюдение продакшена.

Сколько тест-кейсов?

Начните с 10–30 реальных сбоев, которые уже видели; растите с каждым инцидентом.

Запускайте роли агентов на корпоративной ОС — не только определения в глоссарии.