250B+ Models

26 profiles in this group. Use this hub page to compare practical VRAM floor, expected throughput, and best local-vs-cloud path.

RAM planning is included because Ollama may spill layers to CPU when VRAM is tight, especially with long context.

Model Data VRAM min VRAM optimal System RAM RTX 3090 fit Best local GPU Cloud fallback Detail
Llama 4 128X17B FP16 Estimated 430GB 442GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 4 128X17B Q4 Estimated 418GB 428GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 4 128X17B Q5 Estimated 420GB 430GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 4 128X17B Q8 Estimated 424GB 434GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-R1 671B FP16 Estimated 430GB 442GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-R1 671B Q4 Estimated 418GB 428GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-R1 671B Q5 Estimated 420GB 430GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-R1 671B Q8 Estimated 424GB 434GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-V3 671B FP16 Estimated 430GB 442GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-V3 671B Q4 Estimated 418GB 428GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-V3 671B Q5 Estimated 420GB 430GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
DeepSeek-V3 671B Q8 Estimated 424GB 434GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3 Coder 480B CLOUD Estimated 215GB 223GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3 Coder 480B FP16 Estimated 225GB 237GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3 Coder 480B Q4 Estimated 215GB 230GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3 Coder 480B Q5 Estimated 230GB 232GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3 Coder 480B Q8 Estimated 219GB 229GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 3.1 405B FP16 Estimated 225GB 237GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 3.1 405B Q4 Estimated 213GB 223GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 3.1 405B Q5 Estimated 215GB 225GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 3.1 405B Q8 Estimated 219GB 229GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Qwen3.5 397B-A17B CLOUD Estimated 215GB 223GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 4 16X17B FP16 Estimated 225GB 237GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Llama 4 16X17B Q4 Estimated 40GB 48GB 64GB+ Cloud / larger GPU RTX 6000 Ada 48GB A100 80GB Open
Llama 4 16X17B Q5 Estimated 48GB 50GB 128GB+ Cloud / larger GPU Dual RTX 4090 (model parallel) A100 80GB Open
Llama 4 16X17B Q8 Estimated 219GB 229GB 128GB+ Cloud / larger GPU Cloud-first (no practical single-GPU local) H100/H200 class Open
Back to all groups Use VRAM calculator Run large models on RunPod Try Vast.ai fallback

We may earn a commission if you click links on this page.