Deploy modelo customizado: vLLM, TGI, Bedrock
⏱ 14 min·⭐ 60 XP
Pré-requisitos (0/1)0%
- ⬜📊 Avaliando fine-tune: golden set, regression, A/B(Fine-tuning & Customização de LLMs)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
Opções comparadas
| Opção | Setup | Cost model | Quando |
|---|---|---|---|
| OpenAI FT API | Zero (API) | Pay-per-token | FT de gpt-4o-mini/gpt-3.5 |
| Anthropic Custom | Enterprise tier | Negociado | Claude FT (limited access) |
| AWS Bedrock Custom | CloudFormation | Pay-per-token + provisioning | Já em AWS, managed |
| SageMaker JumpStart | Notebook-based | Instance hours | AWS-native FT + deploy |
| vLLM self-host (EKS/GCE) | Medium (GPU ops) | GPU hours fixos | Volume alto, control total |
| Replicate/Together AI | Upload model | Pay-per-token | Managed open models |
OpçãoOpenAI FT API
SetupZero (API)
Cost modelPay-per-token
QuandoFT de gpt-4o-mini/gpt-3.5
OpçãoAnthropic Custom
SetupEnterprise tier
Cost modelNegociado
QuandoClaude FT (limited access)
OpçãoAWS Bedrock Custom
SetupCloudFormation
Cost modelPay-per-token + provisioning
QuandoJá em AWS, managed
OpçãoSageMaker JumpStart
SetupNotebook-based
Cost modelInstance hours
QuandoAWS-native FT + deploy
OpçãovLLM self-host (EKS/GCE)
SetupMedium (GPU ops)
Cost modelGPU hours fixos
QuandoVolume alto, control total
OpçãoReplicate/Together AI
SetupUpload model
Cost modelPay-per-token
QuandoManaged open models
vLLM serving exemplo
💡
python -m vllm.entrypoints.openai.api_server --model ./llama3-lora-merged --tensor-parallel-size 2 --max-model-len 4096 sobe servidor OpenAI-compatible em minutos. OpenAI SDK aponta pra http://your-server/v1 e funciona. Deploy em K8s com GPU node pool + autoscaler.
Quiz rápido
O ponto de equilíbrio entre hospedar o modelo e usar um serviço gerenciado é descrito em dezenas de milhões de tokens por mês. O que essa conta implica?
Custos realistas 2026
- H100 80GB rental: $2.50-5/h (AWS/GCP), $1.50-3/h (Lambda Labs/CoreWeave)
- Llama-3-70B em 1× H100: ~1000 tokens/s throughput em batching
- Break-even self-host vs Bedrock: ~30-80M tokens/mês (depende do preço Bedrock do modelo)
- Cold start: vLLM load de 70B ~2-5min; keep warm pra prod
Perguntas frequentes
❓ Servir por conta própria ou por serviço gerenciado?
Por conta própria quando volume alto e constante justifica a operação de GPU, e você precisa de controle de latência e de custo por token. Gerenciado quando o volume é variável ou o time não quer operar GPU. O cálculo muda com utilização: GPU ociosa é o item mais caro de inferência.
❓ Qual servidor de inferência escolher?
O que resolve o seu gargalo. Se é vazão com muitas requisições simultâneas, o que pagina a memória de atenção e forma lote continuamente rende mais. Se é simplicidade de operação e integração, outros pesam. Medir com o seu perfil de tráfego é a única forma honesta de escolher.
❓ Modelo ajustado exige capacidade reservada?
Em plataforma gerenciada, com frequência sim — e isso muda o cálculo por completo, porque você passa a pagar por tempo e não por token. É o custo escondido do ajuste fino gerenciado, e o que faz muitos projetos voltarem para prompt e recuperação.
Fixando
Quiz rápido
Servir o modelo por uma interface compatível com a API mais difundida traz qual benefício prático?
Quiz rápido
Carregar um modelo grande leva minutos, e o módulo recomenda mantê-lo aquecido em produção. Que problema isso evita?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…