Pattern Automation
← Глоссарий

Learn

Что такое AI guardrails?

AI guardrails — runtime policies, которые ограничивают output и actions модели или agent: unsafe content, PII, prompt injections и out-of-scope tool calls. В Neuro OS — input filters, output checks и action-level Ask gates перед external writes.

Подробнее

Обучение на alignment делает модели полезными по умолчанию, но в продакшене нужен отдельный слой безопасности. Guardrails исходят из того, что модель иногда ошибётся — и останавливают вред до пользователей и систем.

Четыре слоя: (1) Вход — блокировать инъекции, off-topic запросы и чувствительные данные до запуска модели. (2) Выход — проверять ответы на нарушения политик, утечки PII, ошибки схемы. (3) Действие — критичный слой для агентов: allow-list инструментов, лимиты, потолки затрат и подтверждение человека перед send/post/pay. (4) Диалог — границы темы и эскалация к людям.

Продакшен сочетает быстрые фильтры на горячем пути и более медленные проверки для высоких ставок. Defense in depth — несколько независимых проверок — надёжнее одного классификатора.

В Neuro OS guardrails — продуктовая поверхность: Управление даёт Ask как default-deny для внешних действий, scoped connectors и бюджеты.

Примеры

  • Ask gate — агент готовит письмо клиенту; человек подтверждает отправку
  • Allow-list инструментов — роль читает CRM, но не удаляет записи
  • Редакция PII — email и карты вырезаются из логов прогонов
  • JSON-схема — структурированный вывод агента должен совпадать с формой
  • Скан RAG-чанков — документы проверяют на injection
  • Потолок бюджета — роль останавливается при лимите на inference

Связанные термины

FAQ

Разве aligned-модели сами не отказываются от опасных запросов?

В основном да — но jailbreak, инъекции из retrieved-документов и случайные утечки PII всё ещё бывают. Guardrails держат ваши политики, даже если модель скомпрометирована.

Чем alignment отличается от guardrails?

Alignment — поведение на этапе обучения. Guardrails — runtime-код: узкий, собираемый и аудируемый. Для продакшен-агентов нужны оба.

Не замедляют ли guardrails ответы?

Быстрые фильтры добавляют десятки миллисекунд. LLM-проверки политик — секунды и нужны только на высоких ставках. Явное «нужно одобрение» лучше тихого отказа.

Запускайте роли агентов на корпоративной ОС — не только определения в глоссарии.