Onde fica no painel
Em Agente, o seletor de modelo mostra a lista do provider escolhido, com etiquetas de modalidade. O ícone de ajustes ao lado abre Configurações do modelo: Provider, API Key, Temperatura, Top P, Raciocínio, Max Tokens, Seed, Timeout, Tentativas e Fallback.Modalidades: o modelo entende imagem? PDF?
Cada modelo da lista tem etiquetas com o que aceita de entrada:
Na lista da OpenAI, o painel só marca Texto e Imagem. Para saber se um modelo
da OpenAI lê PDF, confira na página do modelo. No OpenRouter, as etiquetas
vêm do próprio OpenRouter.
Se os leads do cliente mandam foto de documento, de produto ou comprovante,
escolha um modelo com Imagem. Detalhes de cada mídia em
Mídia: áudio, imagem e PDF.
Custo x qualidade x latência
Como escolher na prática:
- Comece por um modelo pequeno ou intermediário que aceite as modalidades que o cliente precisa.
- Teste 5 a 10 conversas reais no chat do builder: as mais comuns e as mais difíceis. Veja se ele chama as tools certas e segue as regras.
- Suba de modelo só se errar, e só depois de conferir que o erro não é do prompt ou da descrição da tool.
- Calcule o custo por atendimento dos 2 ou 3 candidatos com Estimar o custo de IA.
Parâmetros
Temperatura
Controla o quanto a resposta varia. Vai de 0 a 2; o padrão é 0.- 0 a 0,3 para atendimento: respostas consistentes, que seguem o prompt.
- Acima de 0,7 o agente varia mais as palavras, mas também inventa mais.
- Mexa na temperatura ou no Top P, nunca nos dois.
- Com raciocínio ligado, muitos modelos ignoram a temperatura.
Max Tokens
O limite de tokens que o modelo pode gerar em cada chamada. O padrão é 4096. Se o valor passar do máximo do modelo, o agente reduz sozinho (quando conhece o limite daquele modelo).- Resposta de WhatsApp é curta. Sem raciocínio, 1000 a 2000 sobra.
- Com raciocínio, o raciocínio também conta nesse limite. Deixe 4096 a 8192.
- Baixo demais corta a resposta no meio ou impede a chamada de tool.
- Alto demais não aumenta o custo da resposta (paga-se o que é gerado), mas no OpenRouter reserva mais crédito por chamada.
Raciocínio (reasoning effort)
Quanto o modelo “pensa” antes de responder. Opções: Padrão, Mínimo, Baixo, Médio, Alto e Muito alto.- Padrão não envia nada: o modelo usa o comportamento dele. Na família
gpt-5.xda OpenAI, Padrão significa sem raciocínio, para manter as tools funcionando. - Modelos sem raciocínio ignoram a opção.
- O raciocínio é cobrado como saída e não aparece para o lead.
- Quanto maior o nível, mais lenta e cara a resposta.
Com raciocínio ligado, o Top P é descartado em modelos que não o aceitam.
Outros campos
Pelo MCP
Tudo fica emlangchain.config.model. Mudar o modelo pelo assistente cria uma
versão não publicada; quem publica é a pessoa, no painel.
Armadilhas
- Trocar de modelo sem testar as tools. Cada modelo segue descrições de tool de um jeito. Teste as ações principais depois de trocar.
- Modelo sem Imagem num cliente que recebe fotos: o agente responde sem ver a imagem, e pode inventar.
- Raciocínio alto no WhatsApp: respostas de muitos segundos, mais o buffer. O lead acha que ninguém está respondendo.
- Max Tokens baixo com raciocínio ligado: o raciocínio consome o limite e a resposta sai vazia ou cortada.
- Temperatura e Top P mexidos juntos: efeito difícil de prever. Escolha um.
- Escolher pelo preço por token só. Um modelo barato que chama a tool errada gera mais chamadas e mais tokens. Compare o custo por atendimento.
Perguntas frequentes
Qual modelo a Zatten recomenda?
Qual modelo a Zatten recomenda?
Não há um fixo: modelos e preços mudam todo mês. Comece por um modelo pequeno ou
intermediário com as modalidades certas, teste com conversas reais e compare o
custo por atendimento. Como referência, um agente de orçamentos real custa cerca
de R$0,30 por atendimento completo.
Por que o modelo que eu quero não aparece na lista?
Por que o modelo que eu quero não aparece na lista?
No OpenRouter, o painel só lista modelos que aceitam tools e respondem em texto: o
agente precisa de tools. Na OpenAI, ficam de fora modelos que não são de chat
(imagem, áudio, embeddings).
O agente ficou lento depois que liguei o raciocínio. É normal?
O agente ficou lento depois que liguei o raciocínio. É normal?
Sim. Volte para Padrão ou Baixo e veja se a qualidade se mantém.
Para saber mais
- Providers: OpenAI e OpenRouter
- Estimar o custo de IA
- Mídia: áudio, imagem e PDF
- Escrever um bom prompt
- OpenAI, modelos: https://developers.openai.com/api/docs/models
- OpenAI, preços: https://developers.openai.com/api/docs/pricing
- OpenAI, raciocínio: https://developers.openai.com/api/docs/guides/reasoning
- OpenAI, guia do modelo mais recente: https://developers.openai.com/api/docs/guides/latest-model
- OpenRouter, modelos: https://openrouter.ai/models (em JSON: https://openrouter.ai/api/v1/models)
- OpenRouter, guia de modelos: https://openrouter.ai/docs/guides/overview/models
- OpenRouter, tokens de raciocínio: https://openrouter.ai/docs/guides/best-practices/reasoning-tokens
- OpenRouter, cache de prompt: https://openrouter.ai/docs/guides/best-practices/prompt-caching
- OpenRouter, parâmetros: https://openrouter.ai/docs/api/reference/parameters