Multimodal mental model: além do texto
Ao terminar: Você decide entre um modelo unificado e um pipeline de modelos especializados pelo custo real por modalidade.
Duas arquiteturas, não uma
Todo sistema multimodal em produção cai em uma de duas arquiteturas. Ou você usa um modelo unified (Claude 3.5 Sonnet, GPT-4o, Gemini 1.5) que aceita texto + imagem + áudio no mesmo prompt, ou você monta um pipeline de modelos especializados (Whisper para STT, LLM só-texto para reasoning, ElevenLabs para TTS). A decisão não é estética — é arquitetural, e define custo, latência e falhas.
- → texto
- Gestão e governança
- Conceito de arquitetura
- IA e machine learning
A escolha não é entre moderno e antigo: é entre raciocinar sobre a imagem e raciocinar sobre uma descrição dela. Se a pergunta envolve relação entre modalidades, o encadeamento não tem como responder.
- 1 · Unificado raciocina SOBRE a imagem. As duas modalidades convivem na mesma representação, então perguntas sobre a relação entre elas têm resposta. É o que o encadeamento não consegue.
- 2 · Encadeado converte, e converter perde. A descrição textual é um gargalo: o que o especialista não descreveu deixou de existir para o passo seguinte, e não há como recuperar.
- 3 · E ainda assim o encadeamento ganha às vezes. Quando a tarefa é estreita e bem definida — ler um documento, detectar um objeto — o especialista é mais preciso e muito mais barato.
- 4 · A imagem entra como quantidade finita de tokens. Não é o tamanho do arquivo que importa: é quantos tokens ela vira. Isso impõe teto de detalhe e define o custo.
- 5 · Daí a prática de recortar antes de enviar. Ampliar a região de interesse aproveita melhor os tokens disponíveis do que mandar a foto inteira em alta resolução.
- 6 · Com várias imagens, rotule cada uma. Sem referência explícita, o modelo confunde qual observação pertence a qual imagem — e você não tem como perceber pela resposta.
Pipeline especializado é debugável: cada etapa tem input/output claro, cache próprio e métricas separadas. Unified é conveniente, mas mistura falhas — um alucinação no reasoning parece falha de vision, e vice-versa.
Quando unified ganha
Unified vale quando a resposta depende de relacionar modalidades. Exemplos reais:
// Pergunta que exige cross-modal reasoning
await anthropic.messages.create({
model: 'claude-3-5-sonnet-20241022',
messages: [{
role: 'user',
content: [
{ type: 'image', source: { type: 'base64', media_type: 'image/png', data: chartBase64 } },
{ type: 'text', text: 'Este gráfico de receita confirma ou contradiz o texto do relatório abaixo?\n\n' + reportText },
],
}],
max_tokens: 1024,
});Dividir em "OCR do gráfico → LLM compara com texto" perde nuance (posição, cor, tendência visual). Pagar o preço do unified compensa.
Quando pipeline ganha
Pipeline ganha em tarefas sequenciais de alto volume onde cada etapa é cacheável. Transcrever 10.000h de reuniões, gerar sumário e exportar PDF: Whisper + Claude + renderer. Cada item tem seu SLO, seu custo e seu retry policy.
Regra prática: se a etapa intermediária (transcrição, OCR) tem valor por si só no seu produto (ex: você mostra a transcrição ao usuário), pipeline é quase sempre melhor. Você precisa expor e armazenar esse artefato de qualquer jeito.
Custo: pense em tokens, não em bytes
Cada provider traduz modalidades em tokens cobrados. Imagens viram tokens por área (Anthropic) ou por tiles (OpenAI). Áudio vira tokens por segundo. O maior erro de quem começa é estimar custo pelo tamanho do arquivo — isso não bate com o billing.
// Estimador grosseiro de custo Anthropic vision
function estimateClaudeImageTokens(width: number, height: number): number {
// Anthropic: tokens ≈ (width * height) / 750, cap em 1568 tokens
return Math.min(1568, Math.ceil((width * height) / 750));
}
// Exemplo: screenshot 1920x1080
const tokens = estimateClaudeImageTokens(1920, 1080); // ~1568 (cap)
const costUSD = (tokens / 1_000_000) * 3; // Sonnet $3/M inputO que caracteriza um modelo verdadeiramente multimodal?
Latência é a outra dimensão esquecida
Usuário em conversa ao vivo tolera ~500ms antes de perceber atraso. Pipeline Whisper (800ms) + LLM (600ms) + TTS (400ms) já dá 1.8s — inviável. É aí que entram Realtime APIs (GPT-4o Realtime, Gemini Live) que processam áudio nativamente. Para batch (processar gravações), latência importa menos e pipeline vence em custo.
Nunca escolha arquitetura multimodal sem primeiro escrever os três SLOs: latência p95, custo por request e taxa de erro aceitável. Sem isso, você vai iterar no escuro e descobrir na fatura do mês.
Próximo passo
No próximo módulo, mergulhamos em speech-to-text sério: Whisper (API e self-host), Deepgram, AssemblyAI, streaming vs batch, diarização e custo real. Esse é o bloco de entrada de quase todo pipeline de voz.
Leve desse módulo: unified vs pipeline é decisão de arquitetura, não de preferência. Escreva seus SLOs primeiro. Tokens de imagem/áudio não são bytes. Latência <500ms só com Realtime. Tudo o mais é pipeline bem feito.
Perguntas frequentes
❓ Modelo unificado ou especializado por modalidade?
❓ Como o modelo enxerga uma imagem?
❓ Multimodal substitui o pipeline clássico?
Fixando
Qual é a limitação prática mais relevante ao usar imagem como entrada?
Como estruturar um pedido que envolve várias imagens?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…