250B+ Models
26 profiles in this group. Use this hub page to compare practical VRAM floor, expected throughput, and best local-vs-cloud path.
RAM planning is included because Ollama may spill layers to CPU when VRAM is tight, especially with long context.
| Model | Data | VRAM min | VRAM optimal | System RAM | RTX 3090 fit | Best local GPU | Cloud fallback | Detail |
|---|---|---|---|---|---|---|---|---|
| Llama 4 128X17B FP16 | Estimated | 430GB | 442GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 4 128X17B Q4 | Estimated | 418GB | 428GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 4 128X17B Q5 | Estimated | 420GB | 430GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 4 128X17B Q8 | Estimated | 424GB | 434GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-R1 671B FP16 | Estimated | 430GB | 442GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-R1 671B Q4 | Estimated | 418GB | 428GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-R1 671B Q5 | Estimated | 420GB | 430GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-R1 671B Q8 | Estimated | 424GB | 434GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-V3 671B FP16 | Estimated | 430GB | 442GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-V3 671B Q4 | Estimated | 418GB | 428GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-V3 671B Q5 | Estimated | 420GB | 430GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek-V3 671B Q8 | Estimated | 424GB | 434GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 Coder 480B CLOUD | Estimated | 215GB | 223GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 Coder 480B FP16 | Estimated | 225GB | 237GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 Coder 480B Q4 | Estimated | 215GB | 230GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 Coder 480B Q5 | Estimated | 230GB | 232GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 Coder 480B Q8 | Estimated | 219GB | 229GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.1 405B FP16 | Estimated | 225GB | 237GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.1 405B Q4 | Estimated | 213GB | 223GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.1 405B Q5 | Estimated | 215GB | 225GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.1 405B Q8 | Estimated | 219GB | 229GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3.5 397B-A17B CLOUD | Estimated | 215GB | 223GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 4 16X17B FP16 | Estimated | 225GB | 237GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 4 16X17B Q4 | Estimated | 40GB | 48GB | 64GB+ | Cloud / larger GPU | RTX 6000 Ada 48GB | A100 80GB | Open |
| Llama 4 16X17B Q5 | Estimated | 48GB | 50GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Llama 4 16X17B Q8 | Estimated | 219GB | 229GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
We may earn a commission if you click links on this page.