O que o agente entende, por conexão
Na conexão não oficial, o servidor não converte nem descreve vídeo e figurinha: só
repassa o arquivo. Se o modelo escolhido não aceita esse tipo de entrada, o provider
pode recusar a chamada e o agente fica sem responder àquela mensagem. Para leads que
mandam muito vídeo, escolha um modelo que aceite Vídeo ou peça no prompt que o
lead descreva em texto.
Quando uma mídia é gravada com erro, a IA não responde a ela, a mensagem fica no
chat com o aviso de erro para um humano ver, e o webhook de erro dispara. Figurinha,
localização e reação na conexão oficial nem chegam a ser gravadas. Se a
mesma mídia veio com outras mensagens no mesmo lote do
buffer, o agente responde às outras.
O que o modelo entende
O builder mostra, ao lado de cada modelo, as entradas que ele aceita: Texto, Imagem, Áudio, Vídeo, Arquivo. Use isso para escolher.
Com um modelo só de texto, o agente não entende a imagem nem o PDF. Dependendo do
provider, a chamada ao modelo falha e entra o
tratamento de erro. Se o
público manda muita foto ou PDF, escolha um modelo com Imagem e Arquivo.
Veja Escolher o modelo.
Transcrição de áudio
No LangChain Agent, todo áudio do lead é transcrito antes de o modelo ver. A transcrição é ligada sempre e não aparece na tela: ao salvar no builder, o painel a deixa ligada, com o modelo Whisper certo para o provider e o idioma detectado automaticamente.
Se a transcrição falha (chave sem crédito, nome de modelo errado), o áudio segue
para o modelo sem texto. Um modelo que não entende áudio falha, e entra o
tratamento de erro.
A armadilha do nome do modelo na OpenAI direta
O padrão do config éopenai/whisper-1, que é o nome no OpenRouter. A OpenAI
direta só aceita whisper-1, sem o prefixo. Com o nome errado, toda
transcrição falha.
O painel corrige isso ao salvar o agente no builder. O nome errado fica quando o
config é gravado sem passar pelo botão Salvar do builder:
- escrito pelo assistente (MCP ou API de template) com o provider
openaie semsettings.transcription.model, ou comopenai/whisper-1; - criado pela migração do motor antigo com provider
openaie ainda não salvo no builder.
"model": "whisper-1" em settings.transcription (provider
openai), ou abra o agente no builder, salve e publique.
Interpretação desligada vinda do motor antigo
O motor antigo tinha chaves para desligar a interpretação de áudio, imagem e PDF. O builder do LangChain Agent não mostra essas chaves, mas, na conexão oficial e na coexistência, o servidor ainda as respeita: se um projeto migrado estava com “Interpretação de imagem” desligada, a imagem é gravada com erro e não vai ao agente. Para liberar, gravetrue em audio_interpretation, image_interpretation ou
pdf_interpretation, no bloco llm_attendant (veja “Pelo MCP”). Na conexão não
oficial, só a chave de PDF vale.
Pelo MCP
Armadilhas
- Modelo só de texto com público que manda foto. O agente não entende a foto, e a chamada pode falhar com a mensagem de erro ao lead. Escolha um modelo com Imagem.
openai/whisper-1na OpenAI direta. Toda transcrição falha. Usewhisper-1.- Interpretação desligada herdada do motor antigo. A tela do LangChain Agent não mostra, mas a conexão oficial continua bloqueando a mídia.
- PDF não é “documento”. Word, Excel e outros arquivos não vão ao agente. Peça no prompt que o lead envie em PDF ou foto.
- Vídeo não vai ao agente na conexão oficial. Se o fluxo depende de vídeo (vistoria, sinistro), peça fotos.
- A transcrição custa. Cada áudio é cobrado pelo provider, além dos tokens do modelo.
- Imagem enviada como documento não é PDF: é gravada com erro. Peça ao lead que envie como foto.
Perguntas frequentes
O agente consegue ler um comprovante ou uma receita?
O agente consegue ler um comprovante ou uma receita?
Sim, se o modelo aceitar Imagem (foto) ou Arquivo (PDF). A qualidade da
leitura depende do modelo; teste com exemplos reais do cliente final.
Dá para desligar a transcrição?
Dá para desligar a transcrição?
Não pela tela. Todo agente no LangChain Agent transcreve áudio.
O agente responde em áudio?
O agente responde em áudio?
Só com a voz da ElevenLabs configurada e quando o lead mandou áudio. Veja
Segmentação e voz.
Existe limite de tamanho?
Existe limite de tamanho?
Há três camadas:
- Meta (conexão oficial): a mídia que o lead manda pode ter até 100 MB. Acima disso a Meta não entrega o arquivo e avisa com o erro 131052. Para o que a empresa envia, os limites são por tipo: imagem 5 MB, áudio e vídeo 16 MB, documento 100 MB, figurinha 100 KB (animada 500 KB). Veja mídia na documentação da Meta.
- Zatten (conexão oficial): arquivo recebido acima de 15 MB dispara o
webhook de erro com o código
FILE_TOO_LARGE, mas o arquivo continua sendo processado e chega ao agente normalmente. Trate esse webhook como aviso, não como perda da mensagem. Na conexão não oficial não há limite próprio. - Provider do modelo: tamanho de arquivo e número de páginas de PDF que o modelo aceita. Confira na documentação do provider.
E no motor antigo?
E no motor antigo?
No motor antigo, a Zatten transcreve o áudio e envia imagem e PDF à OpenAI antes
de chamar o modelo, e a tela tem chaves de interpretação por tipo de mídia. Ele é
legado: migre para o LangChain Agent.
Para saber mais
- Escolher o modelo
- Providers: OpenAI e OpenRouter
- Resiliência: retry, fallback e erro
- Conexões do WhatsApp
- OpenAI, transcrição (speech to text): https://developers.openai.com/api/docs/guides/speech-to-text
- OpenAI, imagens e visão: https://developers.openai.com/api/docs/guides/images-vision
- OpenAI, arquivos PDF: https://developers.openai.com/api/docs/guides/pdf-files
- OpenRouter, entradas multimodais: https://openrouter.ai/docs/guides/overview/multimodal/overview
- OpenRouter, catálogo de modelos (filtre por entrada): https://openrouter.ai/models