150
Coding profiles in catalog
This guide ranks coding models for developers choosing a private local assistant. It prioritizes Ollama profiles with clear 16GB/24GB VRAM fit, measured RTX 3090 data, and a practical cloud fallback when local context is too tight.
Coding profiles in catalog
Measured coding profiles
Local-first picks (<=24GB optimal)
Heavy picks (cloud-first)
| Model | VRAM min/optimal | 3090 tok/s | Data | Detail |
|---|---|---|---|---|
| Qwen3 8B Q4 | 8GB / 10GB | 30 | Estimated | Open |
| Qwen2.5 0.5B Q4 | 2GB / 10GB | 48 | Estimated | Open |
| Qwen2.5 Coder 0.5B Q4 | 2GB / 10GB | 48 | Estimated | Open |
| Qwen3 8B Q5 | 10GB / 12GB | 27 | Estimated | Open |
| CodeGemma 2B Q4 | 2GB / 12GB | 42 | Estimated | Open |
| Qwen3 1.7B Q4 | 2GB / 12GB | 42 | Estimated | Open |
| Qwen2.5 1.5B Q4 | 2GB / 12GB | 42 | Estimated | Open |
| Qwen2.5 Coder 1.5B Q4 | 2GB / 12GB | 42 | Estimated | Open |
| DeepSeek Coder 1.3B Q4 | 2GB / 12GB | 42 | Estimated | Open |
| Qwen3 0.6B Q4 | 2GB / 12GB | 48 | Estimated | Open |
| Qwen2.5 0.5B Q5 | 2GB / 12GB | 43.2 | Estimated | Open |
| Qwen2.5 Coder 0.5B Q5 | 2GB / 12GB | 43.2 | Estimated | Open |
| Model | VRAM min/optimal | Cloud fallback | Detail |
|---|---|---|---|
| Qwen3 32B Q5 | 24GB / 26GB | A100 80GB | Open |
| Qwen2.5 14B Q8 | 16GB / 26GB | A100 80GB | Open |
| Qwen3 14B Q8 | 16GB / 26GB | A100 80GB | Open |
| Qwen2.5 Coder 14B Q8 | 16GB / 26GB | A100 80GB | Open |
| CodeLlama 13B Q8 | 16GB / 26GB | A100 80GB | Open |
| CodeGemma 2B FP16 | 14GB / 26GB | A100 80GB | Open |
| Qwen3 1.7B FP16 | 14GB / 26GB | A100 80GB | Open |
| Qwen2.5 1.5B FP16 | 14GB / 26GB | A100 80GB | Open |