Agentes de IA para atendimento ao cliente: arquitetura, custos e métricas que importam
Agentes de IA para atendimento resolvem o problema do cliente em vez de gerar protocolo. O que muda na arquitetura, quanto custa operar de verdade e quais métricas mostram se está funcionando.
Quase toda empresa que procura um “chatbot para empresas” hoje quer, na verdade, outra coisa: um sistema que resolva o problema do cliente sem abrir ticket para um humano. Chatbot responde. Agentes de IA para atendimento resolvem. A diferença não é de marketing. É de arquitetura, de custo e do que se mede no final do mês.
Este artigo descreve o que muda quando o objetivo passa de “responder” para “resolver”: os componentes que precisam existir, quanto custa operar cada um, quais métricas importam e onde estão os riscos que ninguém mostra na demo.
Do chatbot aos agentes de IA para atendimento: resolver, não responder
O chatbot clássico é uma árvore de decisão com interface de conversa. Ele funciona para menu (“digite 1 para segunda via”) e falha assim que o cliente escreve algo fora do roteiro. A segunda geração, com modelo de linguagem, entende a pergunta como foi escrita e responde com base em documentos. É melhor. Ainda assim, só responde.
Um agente vai além em um ponto: ele age. Consulta o pedido no sistema, emite a segunda via, reagenda a visita, abre a contestação. Para isso precisa de acesso a sistemas, regras sobre quando pode ou não agir, e um caminho de transbordo quando não consegue. É esse conjunto que define um agente de atendimento, e é ele que justifica o investimento.
Uma forma simples de avaliar onde a sua operação está: pegue os dez motivos de contato mais frequentes e pergunte, para cada um, se o cliente sai da conversa com o problema resolvido ou com um protocolo. Se a resposta é “protocolo” na maioria, o que existe hoje é um chatbot, independentemente do nome no contrato.
| Aspecto | Chatbot | Agente |
|---|---|---|
| Entrada | Menu ou pergunta reconhecida | Pergunta como o cliente escreveu, em qualquer canal |
| Saída | Texto ou protocolo | Ação executada e confirmada |
| Integração | Nenhuma ou consulta simples | Leitura e escrita em sistemas, com permissão e log |
| Quando não sabe | Repete o menu | Transborda com contexto para um humano |
| Métrica de sucesso | Volume de conversas | Resolução no primeiro contato |
Antes de contratar, vale um diagnóstico honesto desses motivos de contato, do que já está integrado e do que não está. Uma consultoria de IA que começa pela ferramenta e não por esse mapa vai entregar um chatbot com nome novo.
Arquitetura: canais, base de conhecimento e ações em sistemas
Um agente de atendimento em produção tem quatro camadas. Cada uma pode ser simples ou sofisticada, mas nenhuma pode faltar.
Canais
WhatsApp, e-mail, chat no site, aplicativo, telefone com transcrição. No Brasil, o WhatsApp domina o volume, e “agentes de IA WhatsApp” virou pedido comum em reunião de diretoria. A camada de canal normaliza a entrada (texto, áudio transcrito, imagem de comprovante) e devolve a resposta no formato do canal. Deve ser a parte mais desacoplada do sistema: o mesmo agente atende todos os canais.
IA para empresas no WhatsApp tem regras próprias que afetam a arquitetura: janela de atendimento de 24 horas para resposta livre, templates aprovados para mensagens ativas fora dessa janela, cobrança por conversa e não por mensagem, e número corporativo obrigatório. O agente precisa conhecer essas regras antes de tentar enviar qualquer coisa. Um follow-up fora da janela sem template simplesmente não chega, e ninguém avisa.
Base de conhecimento com RAG
O agente precisa saber a política de troca, o prazo de entrega, a cobertura do plano, as regras do produto. Isso vive em documentos internos que mudam. A técnica padrão é RAG (busca em documentos antes de gerar a resposta), e a qualidade dela depende mais da curadoria do conteúdo do que do modelo. Detalhamos como montar isso em RAG corporativo. O resumo: documento desatualizado na base gera resposta errada com confiança.
Ações em sistemas
É a camada que diferencia agente de chatbot. Cada ação (consultar pedido, emitir boleto, reagendar) é uma integração com um sistema interno, com permissão definida, validação de entrada e registro do que foi feito. Comece com ações de leitura (consultar status) e só depois libere ações de escrita (alterar, cancelar, emitir), com limites claros de valor e de escopo.
Orquestração e transbordo
Quem decide quando o agente responde sozinho, quando pede confirmação e quando passa para um humano. Inclui o contexto que vai junto no transbordo: o atendente humano precisa receber o resumo da conversa e o que já foi tentado, não a transcrição crua. Transbordo mal feito é o motivo número um de CSAT cair depois de implantar IA.
Custos: tokens, integrações e curadoria
O custo de tokens é o mais visível e o menos importante. A tabela abaixo organiza onde o dinheiro vai em uma operação típica, com pesos ilustrativos.
| Componente | Natureza do custo | Peso típico | Como controlar |
|---|---|---|---|
| Inferência (tokens) | Variável por conversa | Baixo a médio | Modelo por tarefa, cache, limite de contexto |
| Integrações com sistemas | Fixo de construção, manutenção contínua | Alto no início | Começar por leitura, priorizar por volume de motivo |
| Curadoria da base | Recorrente, horas de pessoas | Médio, constante | Dono por documento, revisão mensal |
| Operação e monitoramento | Recorrente | Médio | Amostragem de conversas, alertas de transbordo |
| Canal (WhatsApp, telefonia) | Variável por mensagem | Depende do volume | Negociar por faixa, evitar mensagens redundantes |
Exemplo ilustrativo: uma operação com 40 mil conversas por mês. Se cada conversa consome em média alguns milhares de tokens, a conta de inferência fica na casa de poucos milhares de reais mensais. A integração com o sistema de pedidos e o ERP, feita direito, custa mais que isso em um único mês de construção. E a pessoa que mantém a base de conhecimento atualizada custa todo mês. Quem orça só tokens vai errar o orçamento por uma ordem de grandeza.
Dois cuidados. Use modelos diferentes para tarefas diferentes: classificar intenção não precisa do mesmo modelo que redige a resposta final. E limite o contexto: mandar a conversa inteira para o modelo a cada turno é o jeito mais fácil de dobrar a conta sem melhorar nada.
Métricas: resolução no primeiro contato, transbordo e CSAT
Métrica de modelo (acurácia, precisão) não interessa ao negócio. As que interessam são as mesmas de qualquer operação de atendimento, e os agentes de IA para atendimento precisam ser medidos por elas desde a primeira semana.
- Resolução no primeiro contato (FCR). Quantas conversas terminam com o problema resolvido, sem reabertura em 7 dias. É a métrica principal. Chatbot tem FCR próximo de zero, porque gera protocolo.
- Taxa de transbordo. Quantas conversas vão para humano. Não é para ser zero. É para cair mês a mês nos motivos em que o agente já deveria resolver, e ficar estável nos motivos em que o humano é a decisão correta.
- CSAT por motivo de contato. Não a média geral, que esconde tudo. Por motivo: se a satisfação em “segunda via” está alta e em “contestação de cobrança” está baixa, você sabe o que consertar.
- Tempo médio até resolução. Incluindo o tempo em fila humana depois do transbordo. Um agente rápido que transborda para uma fila lenta não melhorou nada para o cliente.
- Custo por conversa resolvida. Custo total (inferência, canal, operação, transbordo) dividido por conversas resolvidas. É o número que vai para a reunião de orçamento.
Defina o valor atual de cada uma antes de implantar. Sem baseline, qualquer número depois é opinião.
Riscos: alucinação, LGPD e tom de voz
Alucinação
O modelo inventa um prazo, uma cobertura, uma condição. O controle não é “usar um modelo melhor”. É restringir a resposta ao que está na base de conhecimento, exigir citação da fonte interna em respostas sobre regra e política, e transbordar quando a busca não encontra nada relevante. Um agente que diz “não encontrei essa informação, vou te passar para um atendente” é um agente bem desenhado.
LGPD
Conversa de atendimento tem dado pessoal. CPF, endereço, histórico de saúde em operadoras, dados financeiros em bancos. Isso precisa de base legal definida, minimização (o modelo não precisa receber o CPF inteiro para consultar um pedido), retenção com prazo, e clareza sobre o que sai do perímetro da empresa quando um modelo externo é usado. Em setores regulados, BACEN, SUSEP e ANS têm exigências próprias sobre registro e rastreabilidade de atendimento, e o agente precisa gerar log auditável de cada ação.
Tom de voz
É o risco mais subestimado. Um agente que responde certo com tom errado (formal demais para uma marca jovem, informal demais para um banco) derruba CSAT tanto quanto uma resposta errada. O tom precisa ser definido por escrito, com exemplos, testado com amostras reais e revisado por quem cuida da marca. Não é detalhe de configuração. É parte do produto.
Por onde começar
Escolha os três motivos de contato de maior volume que hoje terminam em protocolo. Para cada um, liste o que o agente precisa consultar e o que precisa executar. Construa a base de conhecimento só para esses três, integre só os sistemas que eles exigem, e meça FCR e transbordo por seis semanas antes de expandir.
Checklist para avaliar uma proposta de agentes de IA para atendimento
- A proposta parte dos motivos de contato, com volume medido, e não da plataforma.
- Está claro quais ações o agente executa em sistemas e quais só consulta.
- O transbordo está desenhado, com o contexto que vai para o atendente humano.
- O orçamento separa inferência, integrações, curadoria e operação.
- Há baseline de FCR, transbordo e CSAT por motivo antes da implantação.
- O tratamento de dados pessoais está documentado, com base legal e retenção.
- O tom de voz está definido por escrito e será testado com conversas reais.
Se qualquer item está em branco, o que está sendo vendido é um chatbot com nome novo, e o preço deveria refletir isso.
Se quiser ver como estruturamos essa arquitetura em projetos reais, do canal à ação no sistema, a página de agentes de IA descreve o que entregamos e como medimos. O diagnóstico dos motivos de contato é o primeiro passo, e é onde sugerimos começar a conversa.