O catálogo de modelos: qual escolher para cada caso
- ⬜👋 Sua primeira chamada: a Converse API na prática(AWS Bedrock — GenAI em Produção)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Você abre o console do Bedrock e vê um cardápio: por volta de 18 provedores e mais de 100 variantes de modelo (meados de 2026). A reação de todo mundo é a mesma — pânico de escolha. A boa notícia é que ninguém decora esse catálogo, e você também não precisa. O que separa o sênior do júnior aqui não é saber os nomes: é ter uma heurística de decisão que mapeia o SEU caso de uso para a família e o tier certos, e que ainda vai valer quando metade desses modelos for aposentada em 6 meses. É isso que este módulo entrega — como escolher, não o que decorar.
Um catálogo grande demais para decorar
Antes de descer aos detalhes, fixe o mapa. Cada família tem uma vocação — um lugar onde ela é a escolha óbvia. Comece pela coluna Bom para: você quase nunca escolhe um modelo pelo nome, você escolhe pela tarefa e deixa a tarefa apontar a família.
| Família | Bom para | Exemplo de modelo |
|---|---|---|
| Anthropic Claude | Raciocínio de fronteira, agentic e coding long-horizon, tool use, vision, extended thinking | Sonnet 5, Opus 4.8, Haiku 4.5 |
| Amazon Nova | Melhor preço-performance da casa; texto e multimodal em escala; RAG com contexto de ~1M | Nova Micro, Lite, Pro, Premier |
| Meta Llama | Open-weights generalista, fine-tune, portável para on-prem | Llama 4 Scout/Maverick, 3.3 70B |
| Mistral | Multilíngue (foco Europa), código, reasoning, vision, áudio | Devstral, Magistral, Pixtral, Voxtral |
| Cohere | RAG enterprise: embeddings e reranking | Embed v4, Rerank 3.5, Command R+ |
| AI21 Jamba | Contexto muito longo (híbrido SSM/Transformer) | Jamba |
| DeepSeek | Reasoning open-weights custo-eficiente | DeepSeek V3.x, R1 |
| Outros open-weight | Base para fine-tune e self-host leve | gpt-oss 120b/20b, Gemma, Qwen |
| Imagem e criativos | Geração de imagem, vídeo e voz | Nova Canvas, Reel, Titan Image, Stability |
Anthropic Claude: o topo do raciocínio
A família Claude é a referência quando a tarefa é difícil de verdade: planejamento em múltiplos passos, tool use confiável, coding long-horizon, vision e extended thinking. Em 2026 ela se divide em Claude 5.x (Sonnet 5) e Claude 4.x (Opus 4.8/4.7/4.6, Haiku 4.5). A escolha interna é sempre a mesma trinca de tiers — barato/rápido, equilíbrio, topo — e você sobe só o necessário.
| Tier | Modelo (2026) | Escolha quando |
|---|---|---|
| Haiku | Haiku 4.5 | Precisa de baixo custo e baixa latência em volume: classificação, extração, roteamento, chat simples |
| Sonnet | Sonnet 5 | Quer o melhor equilíbrio custo/qualidade para a maioria dos apps: agentic, coding, RAG de qualidade |
| Opus | Opus 4.8 / 4.7 / 4.6 | Precisa do topo de raciocínio em tarefas longas e difíceis, onde errar sai caro |
Claude Fable 5 NÃO está no Bedrock
Atenção ao planejar arquitetura: o Claude Fable 5 é exclusivo da API first-party da Anthropic (Claude Platform on AWS) e não aparece no catálogo do Bedrock. Se o seu design depende especificamente do Fable, você vai acessá-lo pela API direta da Anthropic, não pelo bedrock-runtime. No Bedrock, a linha Claude disponível é a Opus / Sonnet / Haiku.
Amazon Nova: preço-performance da casa
A família Nova é a aposta da Amazon em custo-benefício: geralmente entrega qualidade suficiente por uma fração do preço dos modelos de fronteira. É o primeiro lugar onde você olha quando o volume é grande e a tarefa não exige o topo de raciocínio. Além dos modelos de texto, a Nova traz uma linha criativa (imagem, vídeo, voz).
- Nova Micro — texto puro, ultra-barato e rápido; ideal para classificação, extração e roteamento em escala massiva.
- Nova Lite — multimodal (texto, imagem, vídeo na entrada) e barato; bom default quando há imagem numa tarefa simples.
- Nova Pro — raciocínio e agentic com bom custo; o degrau intermediário antes de subir para Claude Sonnet/Opus.
- Nova Premier — o mais capaz da família, com contexto de ~1M tokens; forte para RAG e documentos grandes.
- Nova 2 (Lite / Pro / Sonic / Omni) — a geração seguinte; Sonic = speech-to-speech, Omni = entrada e saída multimodais amplas.
- Criativos: Nova Canvas (imagem), Nova Reel (vídeo), Nova Sonic (voz em tempo real) e Nova Multimodal Embeddings (busca multimodal).
Open-weights e especialistas
Fora do eixo Claude/Nova, o catálogo tem duas motivações claras: open-weights (para fine-tune, portabilidade e fuga de lock-in proprietário) e especialistas (que fazem uma coisa muito bem — RAG, contexto longo, código, áudio). Escolha por vocação, não por marca.
- Meta Llama 4 (Scout/Maverick) e 3.3 70B — open-weights generalistas; escolha quando quer fine-tune, portabilidade para on-prem ou independência de um provedor fechado.
- Mistral — Devstral (código), Magistral (reasoning), Pixtral (vision), Voxtral (áudio); forte em multilíngue com foco europeu.
- DeepSeek V3.x e R1 — reasoning open-weights com forte custo-eficiência; R1 é orientado a cadeias de raciocínio.
- Cohere — Command R/R+ para geração ancorada em RAG; mas a força real da casa são Embed v4 e Rerank 3.5.
- AI21 Jamba — arquitetura híbrida SSM/Transformer, pensada para contexto muito longo com custo controlado.
- OpenAI gpt-oss 120b/20b (open-weight, via runtime), Google Gemma (leves), Qwen e outros — base para self-host leve e experimentação.
Nem tudo passa pelo Converse
Um gotcha que derruba muita gente: a API Converse unifica só os modelos de texto e chat multimodal de conversa. Modelos de outra natureza não entram por ela — e tentar forçar dá erro de modelo não suportado.
Imagem, embeddings e voz usam outra porta
Geração de imagem (Nova Canvas, Titan Image, Stability) e embeddings (Titan Text Embeddings V2, Cohere Embed v4) são chamados via InvokeModel, com o payload nativo de cada modelo — NÃO via Converse. Speech-to-speech em tempo real (Nova Sonic) usa uma API bidirecional dedicada. Regra prática: Converse é para conversar; para imagem/embeddings use InvokeModel; para voz em tempo real, a API própria do Sonic.
Você precisa classificar um volume massivo de textos curtos numa tarefa simples, com o menor custo possível. Qual escolha faz mais sentido no Bedrock?
Embeddings: qual escolher
Embeddings são a espinha dorsal de qualquer RAG: eles viram os vetores que você indexa e busca. Aqui a decisão é sobre idioma, modalidade e se você vai reordenar resultados com um reranker depois.
| Modelo | Bom para | Observação |
|---|---|---|
| Titan Text Embeddings V2 | Embeddings de texto de propósito geral, com dimensões configuráveis (256/512/1024) | Default barato dentro da AWS; chamado via InvokeModel |
| Cohere Embed v4 | RAG enterprise, multilíngue, suporta texto e imagem | Combina bem com Rerank 3.5 para reordenar os resultados recuperados |
| Nova Multimodal Embeddings | Busca multimodal — texto, imagem e vídeo no mesmo espaço vetorial | Use quando o índice precisa cruzar modalidades |
Guia rápido de escolha por cenário
📋 Preciso classificar 1 milhão de tickets de suporte por dia em ~10 categorias. A tarefa é simples e o volume é enorme.
Classificar em rótulos é tarefa fácil; o gargalo é custo por token e latência, não profundidade de raciocínio. Um modelo topo de linha aqui é pagar 10x por acurácia que você nem consegue medir como melhor. Rode um lote de amostra nos dois tiers baratos e fique com o mais barato que bate sua meta de acerto.
Alt: Claude Opus 4.8 — Overkill caro: raciocínio de fronteira desperdiçado numa classificação trivial, com custo e latência muito maiores.
Alt: Nova Lite — Só compensa se os tickets tiverem imagem ou anexo; para texto puro, o Micro entrega o mesmo resultado mais barato.
📋 Um agent que planeja tarefas em múltiplos passos, usa ferramentas (function calling) e precisa manter coerência ao longo de uma sessão longa.
Tarefa long-horizon com tool use e planejamento é exatamente onde a qualidade de raciocínio e a confiabilidade em chamar ferramentas se pagam. Um modelo fraco falha silenciosamente no meio do plano, e o custo do retrabalho supera com folga a economia no token.
Alt: Nova Micro / Claude Haiku — Barato, mas quebra em cadeias longas de decisão e tool use — falha cara disfarçada de economia.
Alt: Amazon Nova Pro — Boa relação custo/qualidade e um bom plano B, mas em tarefas agentic difíceis ainda fica atrás de Sonnet/Opus em confiabilidade.
Trocar de modelo sem reescrever
A regra que envelhece melhor: o melhor modelo hoje não será o melhor daqui a 6 meses. Por isso o acoplamento certo é com a API Converse, não com um modelId específico. Trocar de modelo vira trocar a string do modelId — o resto (mensagens, tool config, inferenceConfig) segue igual. A ressalva operacional é a inferência cross-region: muitos modelos novos só rodam via inference profile (prefixos us., eu., global.), que distribui a chamada entre regiões de uma geografia para dar capacidade. Na prática, o modelId que você passa costuma ser o ID do inference profile, não o do modelo base.
Heurística: comece barato, suba só onde dói
Não comece pelo modelo mais forte 'por segurança'. Comece pelo mais barato que pode resolver (Nova Micro / Haiku), meça acurácia num conjunto real, e só suba para Sonnet / Nova Pro / Opus nas tarefas onde a qualidade se paga. Custo em GenAI é multiplicado por volume: escolher um tier acima 'só por garantia' em 1M de chamadas/dia é uma decisão de arquitetura, não um detalhe.
Qual afirmação está correta sobre o catálogo do Bedrock em 2026?
Por que a recomendação é acoplar o código à API Converse em vez de a um modelId específico?
Próximo passo
Você já sabe escolher a família e o tier certos — e abstrair a escolha pela Converse para não ficar preso a um modelo. O que transforma um modelo bom num agent útil é a capacidade de chamar as SUAS ferramentas. É o próximo módulo: Tool use — dando ferramentas ao modelo (function calling).
Perguntas frequentes
❓ Como escolher entre os modelos do catálogo?
❓ Modelo aberto no Bedrock compensa?
❓ Preciso me casar com um modelo?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…