Líder de seguros da Anthropic mostra como criar agentes de IA em que uma seguradora possa confiar

Em uma masterclass, Tom Deaney, líder de IA aplicada a Seguros da Anthropic, dona do Claude, mostrou como construir e avaliar um agente de inteligência artificial para a regulação de sinistros, segundo reportagem do 100% SEGURO. Além da tecnologia, o foco esteve em uma questão central para as seguradoras: como gerar a confiança necessária para levar esses sistemas à produção.

A inteligência artificial já está sendo incorporada a diversos processos do setor segurador, mas passar de uma prova de conceito a um agente capaz de atuar em operações reais traz um desafio diferente. Na regulação de sinistros, onde cada caso pode envolver múltiplos documentos, regras, fontes de informação e decisões sensíveis, demonstrar que um sistema funciona em alguns exemplos não basta.

Esse foi um dos principais eixos da masterclass “Claims Agent Masterclass: How to Build an Agent You’d Trust with a Claim”, apresentada na ITC Vegas 2026 por Tom Deaney, líder de IA aplicada para Seguros da Anthropic.

Com oito anos de experiência em insurtech e seis dedicados ao desenvolvimento e à implementação de IA empresarial aplicada a seguros, Deaney trabalhou durante a sessão sobre um caso concreto: a construção de um agente capaz de auxiliar na gestão de um sinistro. Ele mostrou, passo a passo, de que informações o agente precisa, quais ferramentas pode utilizar, em que ponto uma pessoa deve intervir e como avaliar se ele de fato está funcionando.

A conclusão que atravessa toda a apresentação é que construir um agente pode ser relativamente simples, mas construir um em que uma seguradora possa confiar exige muito mais trabalho.

Um agente não é apenas um modelo de IA

Deaney explicou que um agente combina um modelo de linguagem com ferramentas que lhe permitem consultar informações, executar determinadas ações e tomar decisões dentro de certos limites. Mas, especialmente em um setor regulado, a arquitetura e os controles em torno do modelo são tão importantes quanto sua capacidade de raciocínio.

Uma das primeiras distinções que ele apresentou foi entre o “cérebro” e as “mãos” do agente. Enquanto o modelo se encarrega de interpretar o contexto e decidir o que precisa fazer, as ferramentas executam as ações concretas. Essa separação permite limitar o acesso do modelo a informações sensíveis e reduzir riscos como a exposição de credenciais ou certas formas de manipulação por meio dos documentos recebidos. Também permite manter um registro do que ocorreu.

“A rastreabilidade é fundamental em um ambiente regulado: deve ser possível reconstituir que decisão o agente tomou, quais ferramentas utilizou e que informações participaram do processo”, afirmou Deaney.

Mas o desafio não termina em desenhar essa arquitetura. O verdadeiro problema surge quando é preciso responder a uma pergunta muito mais simples: como saber que o agente realmente funciona?

Um caso correto não basta

Um dos conceitos sobre os quais o especialista mais insistiu foram as avaliações (evals). O fato de um agente ter processado corretamente um sinistro não demonstra que ele consiga fazê-lo de maneira consistente.

“One claim isn’t anecdote” (“um sinistro não é uma anedota”), disse durante a demonstração. Ou seja, um único caso correto não constitui evidência suficiente. Até dois acertos podem ser fruto do acaso. A confiança começa a ser construída quando o agente é submetido a um conjunto representativo de casos em que especialistas da companhia já definiram o que deveria ocorrer.

Esse conjunto pode incluir o número do sinistro, os documentos de entrada, os resultados esperados, os desvios que deveriam ser feitos, níveis de investigação, tolerâncias de reserva e outros critérios específicos de cada processo.

Assim, os evals se tornam uma espécie de bancada de testes permanente. Cada alteração no modelo, nas instruções, nas ferramentas ou no conhecimento incorporado ao agente pode ser reavaliada sobre esse conjunto para verificar se realmente representa uma melhora. Para Deaney, essa capacidade de avaliação deveria começar a ser construída o quanto antes.

“A única maneira de ter confiança nos agentes de IA é submetê-los a avaliações”, afirmou.

Os métodos de avaliação podem variar conforme a tarefa. Alguns resultados admitem uma verificação direta de aprovação ou reprovação; outros exigem checar se o agente usou as ferramentas adequadas ou seguiu a estrutura esperada. Em casos mais complexos, pode ser necessário até avaliar a resposta gerada frente a um resultado esperado usando outro modelo como instância avaliadora. Mas o princípio é o mesmo: definir previamente o que significa fazer bem uma tarefa e medir o agente contra esse padrão.

Dos SOPs ao conhecimento operacional

O passo seguinte é dar ao agente o conhecimento necessário para trabalhar. Em uma seguradora, boa parte desse conhecimento já existe: manuais de sinistros, procedimentos internos, critérios de escalonamento e documentação usada pelas equipes.

Deaney propõe transformar esses SOPs (Standard Operating Procedures, ou procedimentos operacionais padrão) em skills: unidades de conhecimento operacional que podem ser incorporadas ao agente, atualizadas e reutilizadas.

“Deve-se começar pelos SOPs e construir a partir daí”, resumiu durante a sessão, de caráter técnico e com a sala lotada.

No entanto, advertiu, a documentação interna não necessariamente contém todas as respostas. Ela pode estar incompleta, desatualizada ou cobrir apenas parte das situações que aparecem na operação cotidiana.

É aí que os evals voltam a entrar em jogo. Se os testes mostram que o agente falha reiteradamente diante de determinados cenários, esses casos permitem identificar que conhecimento falta e ajustar o sistema. O processo, portanto, deixa de ser linear: a documentação alimenta o agente, os casos de avaliação revelam seus pontos fracos, e esses resultados permitem modificar o agente novamente.

A IA pode decidir partes do processo, mas não necessariamente o resultado final

Outro ponto central da apresentação foi o lugar que a IA deve ocupar dentro de uma arquitetura seguradora. Deaney afirmou que, em processos regulados, não necessariamente convém entregar ao agente a decisão final de aprovar ou negar um sinistro. Em vez disso, ele pode ser usado para resolver tarefas específicas: analisar evidências, identificar determinados riscos, verificar informações ou gerar um indicador que depois seja processado pelas regras do sistema.

“A ideia é manter um núcleo determinístico que governe as decisões críticas, enquanto o agente contribui com capacidade de análise em tarefas concretas. Por exemplo, um agente pode produzir um determinado indicador de risco e o sistema de gestão de sinistros pode estabelecer que, a partir de certo limite, o caso deve ser encaminhado a uma instância específica”, exemplificou.

Deaney explicou que esse esquema permite manter uma lógica previsível: “Se a condição se apresenta, o resultado é conhecido”. Ou seja, diante de determinada condição, o sistema sabe qual será o resultado. Essa separação também reduz o impacto que uma instrução maliciosa embutida em um arquivo ou documento analisado pelo agente poderia ter.

Antes da produção: testar, comparar e supervisionar

O especialista apresentou um percurso progressivo para levar um agente dos testes à operação real. O primeiro passo é construir e validar os casos de avaliação. Para isso, destacou a necessidade de trabalhar com especialistas que possam definir o que significa um resultado correto e incorporar tanto os casos habituais quanto os cenários-limite.

A partir daí surge o chamado holdout set, um conjunto de casos mantido separado do processo de melhoria para verificar se o agente consegue responder corretamente a situações que não utilizou durante seu treinamento e ajuste. Depois vem o shadow mode, etapa em que o agente processa informações reais em paralelo com o regulador (ajustador), mas ainda não toma a decisão. Seu resultado pode ser comparado com o que o profissional fez diante do mesmo caso.

Essa comparação também pode servir para descobrir novos cenários que deveriam ser incorporados às avaliações.

“Uma discrepância não implica necessariamente que o agente esteja errado: pode revelar um caso que não estava contemplado ou até a necessidade de rever o critério usado pela equipe humana”, esclareceu aos presentes.

O degrau seguinte é o draft: o agente passa a gerar uma primeira versão de uma resposta, recomendação ou decisão, mas o regulador continua responsável por aprová-la.

Somente depois de passar por essas etapas, e mantendo mecanismos de supervisão, exceções, níveis de confiança e, eventualmente, amostragens sobre os casos processados, o agente pode assumir determinadas tarefas em produção.

A progressão responde a uma ideia central de Deaney: não se trata de passar de uma demonstração diretamente para a produção, mas de aumentar gradualmente o nível de responsabilidade atribuído ao agente à medida que há evidências sobre seu desempenho.

O caso de uma seguradora: 12 semanas de trabalho

Para mostrar como essa abordagem se traduz em um projeto real, Deaney apresentou o caso de uma seguradora que trabalhou por aproximadamente 12 semanas em um agente aplicado a decisões complexas de cobertura.

O projeto começou com o levantamento dos procedimentos existentes e a identificação das ferramentas internas necessárias para realizar as verificações correspondentes.

Em seguida, foram construídos cerca de 300 casos de avaliação a partir de sinistros reais anteriores. O trabalho com especialistas permitiu identificar casos-limite e situações que não estavam suficientemente contempladas na documentação inicial.

Essa interação gerou milhares de comentários e devolutivas que serviram para ajustar o agente e ampliar o conhecimento disponível para resolver os casos.

O projeto chegou então a uma etapa de shadow mode, na qual era possível observar o que o agente teria feito diante de casos reais antes de atribuir-lhe responsabilidade sobre essas decisões.

Deaney observou que, nesse caso particular, estavam vendo resultados que consideravam mais precisos que os dos reguladores humanos para aquela tarefa específica, devido à complexidade da análise e à quantidade de documentos que precisavam ser ponderados em conjunto. “Trata-se de um resultado observado nesse caso de uso e não de uma conclusão geral sobre a capacidade da IA frente aos profissionais”, esclareceu.

Mais ferramentas nem sempre significam um agente melhor

A demonstração também mostrou como um agente pode consultar fontes externas para complementar a informação disponível internamente. No entanto, o executivo da Anthropic ressaltou que incorporar uma nova ferramenta não é automaticamente positivo. Cada fonte adicional pode trazer informação relevante, mas também aumentar a complexidade, o tempo de resposta e as novas permissões de acesso.

“O critério deve ser que informação o agente realmente precisa para resolver uma determinada tarefa. A ideia de fundo é conceder acesso às ferramentas necessárias, mas não mais do que o necessário”, comentou.

Em um processo de sinistros, por exemplo, uma fonte externa pode fornecer antecedentes que permitam gerar um novo indicador de risco. Esse resultado pode voltar ao sistema core e ser usado dentro das regras estabelecidas para definir se o caso deve ser encaminhado. Novamente, o agente traz inteligência a uma parte do processo, enquanto a decisão crítica pode permanecer dentro de uma estrutura controlada.

A confiança como condição para escalar

Ao final, Deaney resumiu a abordagem em três ações-chave para as organizações que queiram avançar com agentes de IA: tornar acessíveis os sistemas e dados de que os agentes precisam, converter os SOPs existentes em skills reutilizáveis e começar o quanto antes a construir uma base de avaliações.

Sobre este último ponto, reconheceu que pode ser um processo longo e trabalhoso. Reunir centenas de casos, revisar seus resultados e garantir que representem corretamente a operação exige tempo e participação de especialistas. Mas começar com um conjunto reduzido permite construir a capacidade necessária para melhorar os agentes de forma sistemática. “Até 20 é melhor que nada”, disse, ao se referir à necessidade de começar a reunir casos de avaliação.

O palestrante chegou a definir os evals como parte fundamental do trabalho prévio à entrada em produção: “Se estiverem perfeitamente feitas, provavelmente representam 70% do trabalho de um agente”.

“O objetivo final não é simplesmente implantar um agente, mas gerar um ciclo que permita ampliar progressivamente seu alcance com evidências sobre seu desempenho”, ponderou o especialista.

Para Deaney, um agente confiável em produção precisa de três elementos centrais: precisão, segurança e governança, e rastreabilidade. Ele deve demonstrar que funciona em escala, operar dentro de limites definidos e deixar um registro que permita reconstituir como se chegou a determinada decisão.

Em um setor como o segurador, onde as decisões podem ter consequências econômicas, regulatórias e operacionais, essa diferença é fundamental. O desafio da IA já não passa apenas por demonstrar que ela pode fazer algo, mas por demonstrar quando, como e sob quais controles pode fazê-lo de maneira confiável.

Com informações de 100% SEGURO.

ARTIGOS SIMILARES

Advertisment

redes sociais

POPULARES