Consultoria de IA generativa: o que muda no escopo em relação à IA clássica
Consultoria de IA generativa não é a consultoria de IA de sempre com outro modelo. Avaliação sem gabarito, prompts versionados, RAG, guardrails e custo por token mudam o escopo, o orçamento e o contrato.
Boa parte das empresas que procuram uma consultoria de IA generativa já contratou consultoria de IA antes. Tinham um modelo de churn, um score de crédito, uma previsão de demanda. O contrato tinha início, meio e fim, e o modelo entregue rodava sozinho por meses. A expectativa é que o projeto com modelos de linguagem siga o mesmo roteiro. Não segue.
O escopo muda em quatro pontos: como se avalia qualidade, o que se entrega além do modelo, como o custo se comporta e quais riscos entram no contrato. Quem ignora esses pontos vende uma demo e chama de projeto. Este texto explica cada um deles para que você saiba o que exigir de uma proposta.
IA preditiva vs. generativa: problemas diferentes
IA preditiva responde a uma pergunta fechada com um número ou uma classe. Esse cliente vai pagar? Esse pedido é fraude? Quantas unidades vendemos na próxima semana? A saída tem formato fixo e existe uma verdade histórica para comparar. Você mede acurácia, precisão, recall, e o resultado é um número que todo mundo entende.
IA generativa produz texto, código, resumo, resposta. A saída é aberta e raramente existe um gabarito único. Duas respostas diferentes podem estar ambas certas, e uma resposta fluente pode estar completamente errada. O modelo não é treinado por você. É um modelo de fundação que você adapta com contexto, instruções e recuperação de dados.
Isso muda a natureza do trabalho. No projeto preditivo, a maior parte do esforço vai para os dados de treino e a engenharia de features. No generativo, o modelo já existe. O esforço vai para o que fica em volta dele: avaliação, recuperação de contexto, guardrails e operação. É por isso que uma consultoria de IA que só sabe treinar modelos costuma subestimar o projeto.
| Dimensão | IA preditiva | IA generativa |
|---|---|---|
| Saída | Número ou classe | Texto, código, decisão aberta |
| Como medir | Métricas sobre gabarito histórico | Rubrica, modelo juiz e amostra humana |
| Onde está o esforço | Dados de treino e features | Contexto, prompts, RAG, guardrails |
| Custo em produção | Quase fixo | Variável por token e por chamada |
| Falha típica | Erro de classificação | Resposta plausível e falsa |
O que entra no escopo de uma consultoria de IA generativa
Uma proposta séria de consultoria em IA generativa tem quatro blocos de trabalho que não existiam no projeto clássico. Se algum deles está ausente da proposta, pergunte por quê.
Avaliação antes de qualquer outra coisa
Sem gabarito, você precisa construir um. Isso significa montar um conjunto de casos reais do seu processo, definir uma rubrica de qualidade com a área de negócio e decidir como cada resposta será pontuada. Parte da avaliação pode ser automatizada com um modelo juiz. Parte precisa de gente. O conjunto de avaliação é o ativo mais valioso do projeto, porque é ele que permite trocar de modelo, mudar prompt ou ajustar o RAG sem regredir.
Prompts como código
Prompt não é texto solto no painel de alguém. É artefato versionado, testado contra o conjunto de avaliação e revisado como qualquer mudança de software. A consultoria deve entregar os prompts em repositório, com histórico e com os testes que justificam cada versão.
RAG e o acesso ao conhecimento da empresa
Na maioria dos casos corporativos, o valor está em o modelo responder com base nos seus documentos, contratos, políticas e sistemas. Isso exige uma camada de recuperação: indexação, permissões, atualização e medição de quanto do que o modelo diz está de fato ancorado no que foi recuperado. Detalhamos a arquitetura em RAG corporativo. O ponto aqui é que essa camada é metade do projeto e costuma ser tratada como detalhe.
Guardrails e caminho de escape
O sistema precisa saber quando não responder. Isso inclui filtros de entrada e saída, detecção de dados pessoais, limites de escopo e um fallback humano definido com a operação. Guardrail sem fallback é só um erro mais educado.
O que uma proposta completa entrega, no mínimo:
- Conjunto de avaliação com casos reais e rubrica aprovada pela área de negócio
- Prompts versionados e testados a cada mudança
- Camada de recuperação com controle de permissão e métrica de aderência
- Guardrails de entrada e saída com fallback humano
- Plano de operação: monitoramento, custo, revisão periódica
Custo variável por uso e como orçar
O modelo preditivo custa quase o mesmo com mil ou um milhão de previsões. O modelo generativo cobra por token de entrada e de saída, a cada chamada. Um agente que faz cinco chamadas por tarefa, cada uma com dez mil tokens de contexto, custa dezenas de vezes mais que um resumo simples. Esse custo escala com o uso e aparece na fatura de nuvem todo mês.
Orçar isso exige três números: volume esperado no pico, tokens médios por tarefa e preço do modelo escolhido. Multiplicados, dão o custo mensal de inferência. Exemplo ilustrativo: uma operação de atendimento com 200 mil conversas por mês, oito mil tokens por conversa e um modelo intermediário chega a dezenas de milhares de reais mensais só de inferência. Isso precisa estar na proposta, ao lado do custo do projeto.
Há alavancas para reduzir: cache de prompt, roteamento para modelos menores em tarefas simples, limite de contexto e compressão de histórico. Uma consultoria de IA generativa que não discute essas alavancas na fase de desenho vai entregar um sistema que funciona e que você não vai querer manter ligado.
Um detalhe que passa despercebido: o custo de avaliação também é recorrente. Cada mudança de prompt ou de modelo exige rodar o conjunto de avaliação de novo, e isso consome tokens. É pequeno perto da inferência de produção, mas precisa estar no orçamento de operação.
Riscos específicos: alucinação, vazamento, direitos autorais
Os três riscos que mais aparecem em contrato e em comitê são estes.
Alucinação. O modelo produz uma resposta convincente e falsa. Não se elimina, se controla: com RAG bem medido, com instruções de recusa, com citação de fonte e com avaliação contínua. O risco aceitável depende do processo. Um resumo interno tolera mais do que uma resposta ao cliente sobre cobertura de seguro.
Vazamento de dados. Dados pessoais ou confidenciais entram no prompt e saem para um provedor externo, ou aparecem na resposta para quem não deveria ver. A LGPD se aplica integralmente. O desenho precisa definir o que pode sair do perímetro, com qual provedor, sob qual contrato e com qual anonimização. Isso é decisão de jurídico e segurança, tomada antes da primeira chamada de API, não depois.
Direitos autorais e propriedade. Quem é dono do texto gerado. O que o provedor faz com os seus dados. Se o conteúdo gerado pode reproduzir material protegido. As respostas estão nos termos de cada provedor e mudam com o tempo. A consultoria precisa mapear isso e deixar documentado no projeto.
Esses três riscos viram cláusulas. Peça que a proposta diga qual provedor será usado, qual o regime de retenção e treinamento sobre os seus dados, quem responde por resposta errada em produção e como a qualidade será medida ao longo do contrato. Proposta que não responde a isso está vendendo uma demo.
Casos onde generativa não é a resposta
IA generativa para empresas virou resposta padrão para qualquer problema, e isso gera projetos caros para tarefas que um modelo clássico ou uma regra resolveriam melhor.
- Classificação com categorias fixas e histórico rotulado: um classificador tradicional é mais barato, mais rápido e auditável.
- Previsão numérica: demanda, inadimplência, churn. Modelo generativo não é ferramenta para isso.
- Regras de negócio determinísticas: se a lógica cabe em uma tabela de decisão, não precisa de modelo.
- Extração de campos de documentos padronizados: OCR com template resolve, com custo marginal próximo de zero.
Generativa entra quando a entrada é linguagem livre, a saída precisa ser linguagem e o volume de variação é grande demais para regras. Atendimento, análise de documentos não padronizados, geração de rascunhos, busca em base de conhecimento. Fora disso, desconfie.
A pergunta que fazemos no diagnóstico é simples: se o modelo generativo fosse substituído por uma regra ou por um classificador, o resultado para o negócio mudaria? Se a resposta é não, o projeto está superdimensionado.
Perguntas frequentes
Consultoria de IA generativa custa mais que consultoria de IA tradicional?
O projeto em si costuma ter duração parecida, entre 8 e 14 semanas para um primeiro caso em produção. A diferença está no custo recorrente de inferência, que é variável e precisa de orçamento próprio. Uma proposta completa apresenta os dois números separados.
Preciso treinar um modelo próprio?
Na maioria dos casos, não. Modelos de fundação com contexto bem construído e RAG resolvem a maior parte dos problemas corporativos. Fine-tuning entra em cenários específicos, como formato de saída muito rígido ou domínio com vocabulário muito particular, e sempre depois de esgotar as alternativas mais baratas.
Como sei se a consultoria entende de IA generativa e não só de modelos clássicos?
Pergunte como ela avalia qualidade sem gabarito, como versiona prompts e como orça o custo por token no pico de uso. Se as respostas forem vagas, a experiência é em demos, não em produção.
O que a empresa precisa ter pronto antes de começar?
Um processo definido, acesso aos documentos ou sistemas que o modelo vai consultar, e uma área de negócio disposta a construir a rubrica de avaliação. Não precisa de time de dados maduro para começar, mas precisa de dono do processo.
Se quiser discutir o escopo de um caso concreto, o caminho mais curto é agendar uma conversa de diagnóstico com a LA AI. Em uma hora dá para separar o que é generativo do que é regra, estimar o custo de inferência e decidir se vale abrir um projeto.