73B-250B Models
34 profiles in this group. Use this hub page to compare practical VRAM floor, expected throughput, and best local-vs-cloud path.
RAM planning is included because Ollama may spill layers to CPU when VRAM is tight, especially with long context.
| Model | Data | VRAM min | VRAM optimal | System RAM | RTX 3090 fit | Best local GPU | Cloud fallback | Detail |
|---|---|---|---|---|---|---|---|---|
| DeepSeek Coder V2 236B FP16 | Estimated | 150GB | 162GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek Coder V2 236B Q4 | Estimated | 138GB | 148GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek Coder V2 236B Q5 | Estimated | 140GB | 150GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| DeepSeek Coder V2 236B Q8 | Estimated | 144GB | 154GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 235B FP16 | Estimated | 150GB | 162GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 235B Q4 | Estimated | 138GB | 148GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 235B Q5 | Estimated | 140GB | 150GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 235B Q8 | Estimated | 144GB | 154GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 VL 235B CLOUD | Estimated | 140GB | 148GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 VL 235B FP16 | Estimated | 150GB | 162GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 VL 235B Q4 | Estimated | 138GB | 148GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 VL 235B Q5 | Estimated | 140GB | 150GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3 VL 235B Q8 | Estimated | 144GB | 154GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Mixtral 8X22B FP16 | Estimated | 150GB | 162GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Mixtral 8X22B Q4 | Estimated | 138GB | 148GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Mixtral 8X22B Q5 | Estimated | 140GB | 150GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Mixtral 8X22B Q8 | Estimated | 144GB | 154GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3.5 122B FP16 | Estimated | 150GB | 162GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3.5 122B Q4 | Estimated | 70GB | 80GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Qwen3.5 122B Q5 | Estimated | 80GB | 82GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen3.5 122B Q8 | Estimated | 144GB | 154GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| GPT-OSS 120B CLOUD | Estimated | 70GB | 78GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| GPT-OSS 120B FP16 | Estimated | 80GB | 92GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| GPT-OSS 120B Q4 | Estimated | 70GB | 80GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| GPT-OSS 120B Q5 | Estimated | 80GB | 82GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| GPT-OSS 120B Q8 | Estimated | 74GB | 84GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen 110B FP16 | Estimated | 80GB | 92GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Qwen 110B Q4 | Estimated | 68GB | 78GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Qwen 110B Q5 | Estimated | 70GB | 80GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Qwen 110B Q8 | Estimated | 74GB | 84GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.2 Vision 90B FP16 | Estimated | 80GB | 92GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
| Llama 3.2 Vision 90B Q4 | Estimated | 68GB | 78GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Llama 3.2 Vision 90B Q5 | Estimated | 70GB | 80GB | 128GB+ | Cloud / larger GPU | Dual RTX 4090 (model parallel) | A100 80GB | Open |
| Llama 3.2 Vision 90B Q8 | Estimated | 74GB | 84GB | 128GB+ | Cloud / larger GPU | Cloud-first (no practical single-GPU local) | H100/H200 class | Open |
We may earn a commission if you click links on this page.