Hardware LLM 2026: Mac M3 Ultra vs RTX 5090 vs DGX
- ⬜🧪 Avaliação offline: lm-eval-harness, deepeval local(Local LLMs & Edge AI)
Recomendamos completar os pré-requisitos antes de seguir, mas nada te impede de continuar.
O cenário em maio/2026
Você quer rodar LLM local sério. Quatro caminhos principais: Apple Silicon (unified memory), RTX consumer (CUDA performance), AMD APU (alternativa valor), data center NVIDIA (A100/H100/B200). Escolha errada custa caro — literal e em tempo perdido com driver issues.
A tabela definitiva
| Hardware | RAM/VRAM | Bandwidth | Modelo max prático | Tok/s típico | Preço (USD) |
|---|---|---|---|---|---|
| MacBook M4 Pro 48GB | 48GB unified | ~273 GB/s | Qwen 2.5 32B Q4 | ~30 tok/s | ~$3k |
| Mac Studio M3 Ultra 96GB | 96GB unified | ~800 GB/s | Llama 3.3 70B Q4 | ~25 tok/s | ~$5k |
| Mac Studio M3 Ultra 192GB | 192GB unified | ~800 GB/s | Llama 3.3 70B FP16 | ~15 tok/s | ~$7k |
| RTX 4090 24GB | 24GB VRAM | 1008 GB/s | Qwen 2.5 14B Q4 | ~120 tok/s | ~$1.6k (used) |
| RTX 5090 32GB | 32GB VRAM (GDDR7) | ~1.8 TB/s | Qwen 2.5 32B Q4 | ~150 tok/s | ~$2k |
| AMD Ryzen AI Max+ 128GB | 128GB unified | ~256 GB/s | Llama 3.3 70B Q4 | ~15 tok/s | ~$3k |
| NVIDIA A100 80GB | 80GB HBM | 2 TB/s | Llama 3.3 70B FP16 | ~60 tok/s | ~$10k (used) |
| NVIDIA H100 80GB | 80GB HBM3 | 3.35 TB/s | Llama 3.3 70B FP16 | ~100 tok/s | ~$25-30k |
| DGX Spark / GB10 | 128GB unified | ~700+ GB/s | Llama 3.3 70B FP16+ | ~80 tok/s | ~$3-4k |
Bandwidth importa mais que TFLOPs para inferência LLM em batch-1 (decoding bottleneck = memory bandwidth, não compute).
Decisão por perfil
📋 Indie / dev solo, modelo único, < $3k
Silencioso, portátil, unified memory, dev experience perfeita, fan barato
Alt: RTX 5090 + PC — Se já tem PC, mais tok/s mas barulho/calor
Alt: Cloud (Replicate/fal) — Se uso < 4h/dia
📋 Quero rodar Llama 70B FP16 em casa
Único hardware <$10k que roda 70B FP16 confortavelmente, baixo ruído
Alt: A100 80GB usado — Mais tok/s, mas ruidoso, caro de operar
Alt: AMD Ryzen AI Max+ 128GB — 50% do preço; ROCm imaturo
📋 Time pequeno fazendo fine-tune
Blackwell + tensor cores otimizados, bom valor
Alt: Cloud (Modal, RunPod) — Treina em A100/H100 pay-per-second
Alt: A100 80GB usado — Mais VRAM, treina modelos maiores
Por que a largura de banda pesa mais que a capacidade de cálculo ao comparar hardware para inferência de uso individual?
Pitfalls de hardware
Encerrando — trilha Local LLMs & Edge AI
Badge Edge AI Engineer desbloqueado. Você conhece quantização, motores de inferência, hardware, RAG local, avaliação offline — stack completa para rodar LLM sério sem depender de API externa.
Perguntas frequentes
❓ Qual hardware escolher para rodar modelo local?
❓ Mac com memória unificada ou GPU dedicada?
❓ Vale comprar hardware ou pagar por API?
Fixando
Qual é o critério para escolher entre uma máquina de memória unificada grande e uma placa dedicada rápida?
Qual armadilha de infraestrutura o módulo destaca em montagem doméstica?
Terminou de ler?
Marcar como concluído registra o XP, mantém sua sequência e coloca 3 cartas deste módulo na fila de revisão espaçada.
Próximos passos sugeridos
Temas deste módulo
Discussão
Carregando comentários…