Learn
Что такое AI guardrails?
AI guardrails — runtime policies, которые ограничивают output и actions модели или agent: unsafe content, PII, prompt injections и out-of-scope tool calls. В Neuro OS — input filters, output checks и action-level Ask gates перед external writes.
Подробнее
Обучение на alignment делает модели полезными по умолчанию, но в продакшене нужен отдельный слой безопасности. Guardrails исходят из того, что модель иногда ошибётся — и останавливают вред до пользователей и систем.
Четыре слоя: (1) Вход — блокировать инъекции, off-topic запросы и чувствительные данные до запуска модели. (2) Выход — проверять ответы на нарушения политик, утечки PII, ошибки схемы. (3) Действие — критичный слой для агентов: allow-list инструментов, лимиты, потолки затрат и подтверждение человека перед send/post/pay. (4) Диалог — границы темы и эскалация к людям.
Продакшен сочетает быстрые фильтры на горячем пути и более медленные проверки для высоких ставок. Defense in depth — несколько независимых проверок — надёжнее одного классификатора.
В Neuro OS guardrails — продуктовая поверхность: Управление даёт Ask как default-deny для внешних действий, scoped connectors и бюджеты.
Примеры
- Ask gate — агент готовит письмо клиенту; человек подтверждает отправку
- Allow-list инструментов — роль читает CRM, но не удаляет записи
- Редакция PII — email и карты вырезаются из логов прогонов
- JSON-схема — структурированный вывод агента должен совпадать с формой
- Скан RAG-чанков — документы проверяют на injection
- Потолок бюджета — роль останавливается при лимите на inference
Связанные термины
FAQ
Разве aligned-модели сами не отказываются от опасных запросов?
В основном да — но jailbreak, инъекции из retrieved-документов и случайные утечки PII всё ещё бывают. Guardrails держат ваши политики, даже если модель скомпрометирована.
Чем alignment отличается от guardrails?
Alignment — поведение на этапе обучения. Guardrails — runtime-код: узкий, собираемый и аудируемый. Для продакшен-агентов нужны оба.
Не замедляют ли guardrails ответы?
Быстрые фильтры добавляют десятки миллисекунд. LLM-проверки политик — секунды и нужны только на высоких ставках. Явное «нужно одобрение» лучше тихого отказа.
Запускайте роли агентов на корпоративной ОС — не только определения в глоссарии.