Learn
Что такое agent failure recovery?
Agent failure recovery — как roles resume после tool errors, model timeouts, bad outputs или human rejection — checkpoints, retries, fallbacks и escalation вместо silent failure или infinite loops.
Подробнее
Failure recovery — как роль продолжает после ошибки тула, таймаута модели, плохого выхода или отказа человека: чекпоинты, ретраи, fallback и эскалация вместо тихого сбоя или бесконечного цикла.
Паттерн: сохранить состояние → классифицировать ошибку (сеть / политика / качество) → ретрай с backoff, другой тул или человеку → записать причину в лог.
Neuro OS роли должны уметь встать с последнего чекпоинта задачи, а не начинать кампанию заново после 500 от API.
Примеры
- Таймаут CRM — ретрай 3 раза, затем задача blocked + человек
- Плохой черновик — verification не пускает send, роль переписывает один раз, потом Ask
- Человек отклонил — причина в логе, skill не «успешен»
- Частичный прогон — чекпоинт после research, copy начинается оттуда
Связанные термины
FAQ
Сколько ретраев нормально?
На сети — мало и с backoff. На качестве выхода — один перепис, затем человек. Бесконечный цикл — баг.
Что логировать?
Код ошибки, попытка, вход, какой тул, кто эскалировал.
Запускайте роли агентов на корпоративной ОС — не только определения в глоссарии.