Cibernética imunológica digital
A empresa agêntica precisa de um sistema imunológico
Como projetar agentes de IA capazes de agir sem concentrar toda a confiança: identidade, privilégio mínimo, contenção, supervisão e recuperação.

Agentes de IA transformam instruções em ações. Para governá-los, não basta filtrar o que dizem: é preciso limitar o que podem fazer, detectar quando se desviam e conter o dano antes que se propague.
Imagine um agente conectado ao e-mail, ao CRM e ao faturamento. Sua tarefa parece simples: ler solicitações de clientes, preparar respostas e processar reembolsos dentro de certos limites. Certa manhã, ele encontra em uma mensagem uma instrução oculta que manda ignorar as regras, procurar dados sensíveis e enviá-los a um endereço externo.
O modelo não se tornou mal-intencionado de repente. O sistema confundiu dados com autoridade, e suas ferramentas converteram essa confusão em poder operacional. A distinção é essencial. O software tradicional expõe caminhos definidos previamente em código. Um agente escolhe o caminho durante a execução, muitas vezes atravessando várias ferramentas e com base em um contexto que pode ser hostil.
O problema de governança já não é apenas saber se a resposta é aceitável. É saber se uma entrada não confiável pode adquirir os privilégios do agente, se o agente consegue ultrapassar seu mandato e se a organização pode reconstruir, interromper e reverter a sequência resultante.
Do sistema que responde ao sistema que age
Um agente combina um modelo com instruções, memória, ferramentas e um ciclo de controle. Pode planejar etapas, consultar dados, executar código, alterar registros ou coordenar-se com outros agentes. Protocolos abertos como o Model Context Protocol (MCP) e o Agent2Agent (A2A) facilitam essas conexões: o MCP padroniza a relação com ferramentas e fontes de dados; o A2A, a comunicação entre agentes independentes.
Esses protocolos não são vulnerabilidades por si mesmos. O risco surge quando sistemas são conectados sem que as fronteiras de confiança tenham sido resolvidas: quem autentica cada ator, o que autoriza cada chamada, quais dados podem cruzar a fronteira e qual é o impacto máximo de uma credencial comprometida.
A superfície de ataque, portanto, não termina no prompt. Ela inclui o catálogo de ferramentas, permissões, memória, servidores externos, identidades de serviço, saída para a internet e cadeias de agentes que reutilizam um resultado sem verificar sua origem. Em outras palavras, é um problema de harness engineering: tudo o que se constrói ao redor do modelo para transformar capacidade em um sistema confiável e governável.
Quatro maneiras de adoecer
Falhas agênticas não têm todas a mesma origem. Misturá-las gera controles vagos. Convém separar pelo menos quatro classes.
Instruções ocultas em dados
Um e-mail, uma página, um documento recuperado ou a saída de uma ferramenta contém instruções que o agente interpreta como autoridade. O ataque entra durante a operação normal, não no treinamento.
Agência excessiva
O agente dispõe de mais funções, privilégios ou autonomia do que precisa. O modelo pode falhar, mas a arquitetura de permissões decide o raio de impacto.
Desvio de objetivo
Uma instrução incompleta é otimizada por uma via não pretendida: reduzir custos enfraquecendo um controle, fechar casos não resolvidos ou cumprir uma métrica ocultando exceções.
Propagação entre componentes
Um resultado contaminado passa a outro agente, entra na memória e reaparece como contexto aparentemente confiável. A confiança não deve ser herdada só porque outro agente enviou a mensagem.

Um sistema imunológico para a empresa agêntica
A biologia oferece uma metáfora útil: um organismo não depende de uma única muralha. Ele combina barreiras, vigilância distribuída, respostas rápidas, memória e adaptação. Proponho chamar de cibernética imunológica digital o uso disciplinado desse padrão no desenho da segurança de sistemas agênticos.
Não é um padrão técnico nem substitui Zero Trust, gestão de identidades, desenvolvimento seguro ou resposta a incidentes. É uma forma de organizar esses controles em torno de uma pergunta: como a organização detecta, contém e aprende quando um de seus agentes — ou algo consumido por ele — se comporta como uma ameaça?
| Componente biológico | Equivalente operacional | Função verificável |
|---|---|---|
| Barreiras epiteliais | Identidade, autorização, validação e listas permitidas | Impedir acessos e ações fora da política antes que cheguem ao modelo ou à ferramenta. |
| Microbioma | Agentes e serviços autorizados | Definir uma linha de base de atores, fluxos e comportamentos esperados; não é uma defesa por si só. |
| Vigilância imunológica | Traços, registros, detectores e avaliações | Reconstruir o que o agente decidiu, qual contexto recebeu e com que identidade chamou uma ferramenta. |
| Resposta efetora | Playbooks determinísticos | Bloquear uma chamada, limitar velocidade, suspender uma credencial, isolar uma execução ou entrar em estado seguro. |
| Memória adaptativa | Testes, assinaturas, regras e procedimentos | Transformar cada incidente confirmado em avaliação e controle reutilizáveis. |

A distinção mais importante é entre detectar e autorizar. Um segundo modelo pode ajudar a classificar uma anomalia, mas não deveria ter a palavra final sobre uma transferência, uma exclusão ou uma ordem enviada a um sistema físico. A autoridade deve residir em controles determinísticos externos ao modelo: políticas de acesso, limites de gasto, listas de destinos, separação entre leitura e escrita e estados de operação segura.
Os guardrails também importam, mas como defesa em profundidade. Um filtro semântico pode reduzir ataques conhecidos; não é uma fronteira de segurança infalível. Se uma injeção o atravessar, privilégio mínimo, autorização independente e isolamento ainda devem impedir que uma instrução vire um incidente grave.
A supervisão humana não desaparece: muda de nível
Um analista não consegue aprovar cada consulta, etapa de raciocínio e chamada de API em um sistema de alto volume. Tentar fazer isso gera latência e fadiga de aprovação: pessoas passam a confirmar automaticamente decisões que já não têm tempo de avaliar. Mas eliminar o humano não é a resposta. A supervisão eficaz é distribuída de acordo com o risco.
| Tipo de ação | Regime recomendado |
|---|---|
| Leitura de baixo impacto ou ação reversível | Autonomia dentro de permissões estreitas, com rastreabilidade completa. |
| Operação frequente com impacto limitado | Autorização determinística, limites quantitativos, monitoramento e revisão por amostragem. |
| Ação de alto impacto, regulada ou difícil de reverter | Aprovação humana informada antes da execução. |
| Sinal de ataque ou comportamento fora da política | Contenção automática reversível, notificação e escalonamento a um responsável nomeado. |

A máquina oferece velocidade; a pessoa define a autoridade.
O objetivo não é colocar um humano em cada etapa. É garantir que uma pessoa competente possa compreender, intervir, anular e responder pelo sistema quando isso realmente importa.
O que muda em infraestruturas críticas
Em bancos, energia, saúde ou logística, uma resposta ruim não termina na tela. Pode movimentar dinheiro, afetar um tratamento, alterar estoque ou tocar um processo físico. Nesses casos, a metáfora imunológica só é útil quando se converte em controles verificáveis.
Bancos. Um agente transacional deve operar com beneficiários permitidos, limites de valor e frequência, credenciais próprias e autorização reforçada ao cruzar um limite. A detecção de anomalias pode pausar uma operação; não deve substituir regras determinísticas de liquidação nem a aprovação de movimentos de alto impacto.
Energia e sistemas OT/SCADA. O plano agêntico precisa permanecer separado dos intertravamentos de segurança e do controle determinístico. Diante de dados incoerentes ou perda de confiança, deve degradar de forma segura. O NIST desenvolve um perfil do AI Risk Management Framework para infraestruturas críticas com ênfase em falha segura, robustez adversarial e testes rigorosos.
Saúde. Um assistente pode resumir um prontuário com acesso restrito de leitura. Alterar uma prescrição, compartilhar dados ou executar uma decisão clínica requer outra identidade, validação de domínio, registro e supervisão proporcional ao risco.
Varejo e cadeia de suprimentos. Agentes podem ajustar estoque ou preparar pedidos dentro de faixas autorizadas. Alterar preços em massa, cadastrar um fornecedor ou redirecionar pagamentos exige controles diferentes. Reversibilidade e impacto econômico — não o rótulo “IA” — devem determinar a autonomia.

Onde a metáfora falha
Todo marco biológico convida ao exagero. Um sistema imunológico pode atacar tecido saudável, reagir tarde ou causar mais dano do que a ameaça. Seu equivalente digital bloqueia operações legítimas, revoga credenciais críticas ou isola serviços demais após um falso positivo.
Além disso, um agente que vigia outros agentes pode compartilhar as mesmas vulnerabilidades. Se todos usam o mesmo modelo, memória ou fornecedor, a aparente diversidade pode esconder uma monocultura. E um sistema que “aprende” automaticamente com cada incidente também pode aprender com evidências manipuladas.
A adaptação deve ser governada. Novas assinaturas, avaliações e políticas precisam de procedência, validação, versão, responsável e possibilidade de reversão. A metáfora só se transforma em arquitetura quando cada função tem um controle, uma métrica, um teste e um proprietário.

Medir a imunidade sem fingir precisão
O marco propõe dois instrumentos de trabalho. O FIT-Eval, resumido por um FIT-Score, descreve o poder operacional observável de um agente em cinco dimensões: persistência de propósito, capacidade de antecipação, autonomia para escolher ações, compromisso temporal e coerência entre plano, traços e comportamento. Ele não tenta adivinhar uma “intenção” psicológica nem depende de cadeias de pensamento privadas; mede o que o sistema pode fazer e o que efetivamente faz.
O segundo instrumento é a Margem de Resiliência.
É uma métrica proposta, não um padrão do setor. Para ser comparável, cada termo precisa ser normalizado e apoiado em medidas observáveis: tempo médio de detecção e contenção, proporção de ações reversíveis, ferramentas com permissão de escrita, cobertura de traços, taxa de falsos positivos, eficácia do mecanismo de parada e tempo de recuperação.
A direção importa mais do que uma casa decimal. Um sistema melhora quando reduz o impacto máximo que um agente pode causar e, ao mesmo tempo, aumenta sua capacidade demonstrada de detectar, conter e se recuperar.

Sete decisões para começar agora
- Inventariar cada agente, suas ferramentas, credenciais, dados, responsável e ações possíveis.
- Separar leitura e escrita em ferramentas e identidades distintas; remover permissões concedidas “por precaução”.
- Autorizar fora do modelo cada ação relevante por meio de políticas e limites determinísticos.
- Registrar toda a trajetória: contexto relevante, versão, chamadas de ferramentas, identidade, resultado, aprovação e anulação.
- Avaliar ataques e falhas antes da produção, incluindo injeção indireta, abuso de ferramentas, repetição, recuperação e parada.
- Distribuir a supervisão pelo risco, reservando aprovação humana para ações de alto impacto em vez de barreiras simbólicas em toda parte.
- Preparar contenção e recuperação com procedimentos testados, reversíveis e um responsável com poder para interromper o sistema.
A empresa agêntica não precisa de uma frota ilimitada de agentes vigiando uns aos outros. Precisa de uma arquitetura em que nenhum componente — humano, modelo ou ferramenta — concentre toda a confiança.
Esse é o valor real do pensamento imunológico: sair de uma defesa que tenta impedir toda falha e construir um sistema que limita a exposição, reconhece sinais, contém rapidamente, preserva memória e melhora sem perder o controle.
Fontes e método
Este artigo apresenta a cibernética imunológica digital como um marco proposto e separa suas hipóteses das práticas consolidadas.
- OWASP — LLM01: Prompt Injection.
- OWASP — LLM06: Excessive Agency.
- MITRE ATLAS — matriz de ameaças contra sistemas de IA.
- Model Context Protocol — Authorization.
- A2A Protocol — especificação e considerações de segurança.
- NIST — AI RMF Profile on Trustworthy AI in Critical Infrastructure.
- Kay Smarsly, Digital Immune Systems for Civil Infrastructure, IEEE Access, 2026.