

“Em três anos, desenvolvemos mais de cem agentes. A principal lição: sem limites rígidos, até o bot mais inteligente é apenas um gerador caro de problemas” — Fundador da ASCN.AI
Vamos direto ao ponto. Diretrizes para agentes de IA são, essencialmente, limitadores. Imagine que você deu a um estagiário acesso a todo o banco de dados da empresa. Ele é rápido e inteligente, mas pode, por erro, vazar dados para concorrentes ou excluir um arquivo importante. É aí que os diretrizes para agentes de IA entram em cena, para impedir que esse "estagiário" faça besteira.
A situação é a seguinte: o agente está integrado ao seu CRM, e-mail e sistemas de pagamento. Um prompt mal formulado, uma falha lógica, e a confidencialidade vai por água abaixo. Assustador? Com certeza. Por isso, quaisquer agentes de IA para empresas exigem uma estrutura rigorosa. Não é um recurso extra, é o básico.
Tivemos um caso no setor de fintech. O cliente quase perdeu alguns milhões devido a um vazamento. Implementamos um sistema simples de restrições — e o problema desapareceu. Simplesmente porque proibimos fisicamente o agente de fazer o que não era permitido.
Quando há muitos agentes, a segurança deixa de ser teoria. Barreiras de segurança protegem contra o que está quebrando agora mesmo.
Onde esperar armadilhas? Primeiro, Injeção de Prompt e jailbreaking. Atacantes aprenderam a enganar os modelos com frases astutas. Segundo, vazamento de PII (dados pessoais). O agente pode deixar escapar informações acidentalmente. Terceiro, acesso à API sem autorização. E, finalmente, ética — quando o bot começa a ser rude com os clientes.
Os números falam por si: em 2026, os incidentes aumentaram 67%. Vimos um caso em que um bot de leads começou a enviar spam para clientes da concorrência. Implementamos barreiras de segurança para agentes de IA — e silêncio. Zero problemas em três semanas. Funciona.
Um bom framework de barreiras para agentes de IA funciona como um bolo de várias camadas. Três níveis, cada um cobrindo suas próprias brechas.
Barreiras de Entrada ficam na entrada. Filtram os prompts do usuário. Toxicidade, tentativas de invasão, absurdos — tudo é bloqueado imediatamente. Segundo nossos dados, esse nível elimina cerca de 40% do lixo antes mesmo que o modelo seja ativado.
Barreiras de Processo monitoram o agente em tempo real. O que ele está fazendo? Onde está acessando? Aqui funcionam a sandbox (sandboxing) e o controle de ferramentas. O agente fica isolado, cada ação é registrada em log. Como sob vigilância constante.
Barreiras de Saída — filtro final. Antes que a resposta seja enviada ao usuário, ela é verificada. Há segredos expostos? Os fatos estão corretos? O tom da marca foi respeitado? Esta etapa previne até 95% dos erros críticos (dados da ASCN.AI, 2024).
A proteção deve ser de ponta a ponta. Se você verifica apenas a entrada, fica cego durante o processo. Sem verificação na saída, os erros chegam ao cliente. A abordagem end-to-end é mais complexa, mas vale a pena.
Escolher a ferramenta é sempre um equilíbrio entre flexibilidade e dor de cabeça. Veja o que está em alta agora:
NVIDIA NeMo Guardrails — uma solução poderosa para diálogos complexos. Regras programáveis e fluxos sob controle. Porém, a implementação é demorada e exige expertise na arquitetura do NeMo.
LangChain e LCEL — os favoritos dos desenvolvedores. Integração flexível e documentação abundante. Ideal para startups que precisam agir rápido e prototipar sobre a marcha.
Microsoft Guidance — controle no nível de tokens. Máxima precisão, mas com alta barreira de entrada. Adequado para casos em que o custo do erro supera o custo do desenvolvimento.
Soluções Personalizadas — quando as soluções prontas não atendem. Desenvolvemos uma solução personalizada para um projeto de cripto: era necessária especificidade de blockchain e tempo real. As opções prontas não davam conta.
| Nome | Tipo de proteção | Complexidade | Melhor caso de uso | Preço | Código aberto |
|---|---|---|---|---|---|
| NVIDIA NeMo Guardrails | Fluxos de diálogo, regras | Média | Bots de atendimento ao cliente | Empresarial | Sim |
| LangChain / LCEL | Cadeias de chamadas | Baixa | Protótipos, startups | Gratuito / Pago | Sim |
| Microsoft Guidance | Nível de token | Alta | Finanças, medicina | Gratuito | Sim |
| Soluções Personalizadas (ASCN.AI) | Personalização total | Alta (Low Code) | Setores específicos | Sob demanda | Não |
A propósito, analistas da Gartner (2024) afirmam: até 2026, 75% das empresas usarão guardrails especializados. Hoje, são apenas 15%. A tendência é clara.
Para quem gosta de mexer no código, aqui está um exemplo. Implementamos duas coisas: proteção contra vazamento de e-mail (PII) e confirmação obrigatória por humano (Human-in-the-Loop).
from langchain.agents import create_agent
from langchain.agents.middleware import PIIMiddleware, HumanInTheLoopMiddleware
agent = create_agent(
model="gpt-4o",
tools=[customer_service_tool, email_tool],
middleware=[
# Гардрейл 1: Маскировка email в запросах
PIIMiddleware(
"email",
strategy="redact", # Заменяет email на [REDACTED_EMAIL]
apply_to_input=True,
),
# Гардрейл 2: Требование подтверждения человека для отправки писем
HumanInTheLoopMiddleware(
interrupt_on={"send_email": True},
),
],
)
result = agent.invoke({
"messages": [{"role": "user", "content": "Send report to john.doe@example.com"}]
})
No grande negócio, as regras são outras. Guardrails para agentes de IA Enterprise — tratam de escala, conformidade (compliance) e reputação. Automação de processos de negócios não perdoa erros aqui.
GDPR, HIPAA, SOC2 — não são apenas siglas. São dinheiro. Um agente na área médica não pode discutir diagnósticos sem criptografia. Um bot financeiro deve cumprir o KYC. A violação acarreta multas que anulam toda a economia gerada pela automação. As multas do HIPAA, por exemplo, podem chegar a 1,5 milhão de dólares por ano. Números expressivos.
Configurar cinco agentes é fácil. Cinquenta já dão dor de cabeça. São necessárias políticas centralizadas. Criamos um sistema em que a alteração de uma regra de segurança é aplicada a todos os agentes de uma vez. Isso economiza muito tempo e estresse para a equipe de segurança.
Quer entender como construir isso? Leia o guia: criar um funcionário de IA.
O vazamento de documentação interna por meio de IA é um suicídio reputacional. Os guardrails impedem que os dados deixem o perímetro. Em um projeto, bloqueamos 127 tentativas de exportar a base interna no primeiro mês. Imagine se esses dados tivessem vazado?
Sem métricas, você está cego. Implementamos dashboards (Grafana, Datadog) e analisamos três aspectos:
Além disso, alertas no PagerDuty. Para reagir instantaneamente, e não depois do fato consumado.
Aqui está o dinheiro. Agentes financeiros verificam contrapartes e processam transações. Riscos em criptomoedas são enormes, por isso o controle é rigoroso.
Os guardrails garantem que cada operação passe pela verificação AML. Nenhum pagamento sem verificação KYC. Os logs são registrados de forma padronizada.
Para traders, há nuances específicas: limites de slippage (deslizamento), proibição de saques para carteiras não autorizadas e proteção das chaves de API. O agente não deve ter acesso irrestrito à conta sem autorização prévia.
Caso ASCN.AI durante a queda da Falcon Finance: Utilizamos guardrails para gerar sinais durante a turbulência. O agente agiu com precisão, gerando US$ 1.000 de lucro em dois prompts e evitando posições tóxicas. Detalhes aqui: Caso ASCN.AI durante a queda da Falcon Finance (FF).
A área médica exige alta responsabilidade. Os dados dos pacientes são criptografados, o acesso é baseado em funções e cada clique é registrado. O agente não pode simplesmente compartilhar o histórico médico com terceiros. Apenas com consentimento.
Validação na entrada. O sistema verifica: quem é você? O que deseja? Tem permissão? Se a solicitação for ambígua, o agente nem sequer inicia. Isso bloqueia prompts maliciosos. Para testes, recomendo automatização de testes com IA.
Monitoramento em tempo real. O agente opera em um ambiente isolado (sandbox). O sistema detecta anomalias: chamadas de API estranhas ou tentativas de acesso indevido. Se algo sair do padrão, a ação é interrompida.
Filtragem da resposta. Antes do envio, o conteúdo é verificado quanto à conformidade com as políticas. Se a resposta for inadequada, ela é limpa ou substituída por uma mensagem padrão: "Não posso fornecer essa informação".
Autonomia total é um mito. A presença humana é necessária. O sistema define limiares de confiança: se o agente estiver em dúvida (abaixo de, digamos, 80%), ele aciona um operador. Isso equilibra velocidade e qualidade. Em nossos projetos de suporte, o HITL reduziu erros em 89%, mantendo 70% de automação. Assistentes de IA para suporte sem humanos — isso é um risco.
Regras determinísticas (regex) são rígidas, mas confiáveis. Baseadas em modelo (LLM) são flexíveis, mas podem apresentar falhas. A melhor combinação: verifique valores e acessos rigidamente (regex) e confie à modelo o tom e o contexto.
O conjunto mínimo inclui criptografia de dados em repouso e em trânsito, controle de acesso baseado em funções, registro de todas as operações com dados e detecção automática de PII nas saídas do agente. Sem essas políticas básicas, o risco de vazamento permanece crítico.
A automação total só é possível para cenários de baixo risco. Para tarefas críticas, é necessário Human-in-the-Loop. O equilíbrio depende do setor e dos casos de uso específicos. Finanças e saúde exigem mais controle humano do que marketing ou geração de conteúdo.
Os guardrails adicionam uma latência de 50 a 500 milissegundos por nível de verificação. Para a maioria das tarefas empresariais, isso é imperceptível. A criatividade é limitada apenas nos aspectos de segurança — o agente permanece criativo dentro dos limites permitidos.
Prompts de sistema são instruções para o modelo em linguagem natural. Guardrails são verificações programáticas no nível do código. Prompts podem ser contornados por meio de injeções; os guardrails exigem alteração de código para serem burlados. Um sistema confiável usa ambas as abordagens.
Segurança não é uma ação única, mas um processo. Os guardrails adequados permitem escalar a automação, sem o medo de que tudo desabe de repente.
Quem investe em segurança agora sairá na frente depois. Vimos isso no caso do flash crash de 11 de outubro: uma infraestrutura confiável gerou lucro onde outros entraram em pânico. Saiba mais: Caso de ganho com o flash crash.