RTX 3090 VRAM Benchmarks for Local LLMs

The RTX 3090 has 24GB VRAM. This page tracks model tags with measured local runs on RTX 3090 so you can compare tokens/s, latency, and model fit instead of relying only on baseline estimates.

Measured model tags

Model Tag Tokens/s Latency (ms) Test time Detail
GPT-OSS 20B CLOUD gpt-oss:20b 156.1 1524 2026-04-29T05:39:58Z Open
Qwen3 Coder 30B CLOUD qwen3-coder:30b 151.0 1003 2026-08-19T03:08:42Z Open
Qwen3 8B FP16 qwen3:8b 128.3 1404 2026-08-19T03:08:42Z Open
Ministral 3 14B FP16 ministral-3:14b 85.6 1963 2026-08-19T03:08:42Z Open
Qwen2.5 14B FP16 qwen2.5:14b 84.0 946 2026-04-29T05:39:58Z Open
DeepSeek-R1 14B FP16 deepseek-r1:14b 78.9 2067 2026-08-19T03:08:42Z Open
Mistral Small 22B FP16 mistral-small:22b 59.0 1890 2026-08-19T03:08:42Z Open
Nemotron 3 Nano 30B FP16 nemotron-3-nano:30b 57.0 2468 2026-04-01T11:53:50Z Open
Gemma 3 27B FP16 gemma3:27b 41.7 3022 2026-08-19T03:08:42Z Open
Translategemma 27B FP16 translategemma:27b 41.3 3142 2026-04-01T11:53:50Z Open
Qwen2.5 Coder 32B FP16 qwen2.5-coder:32b 33.1 3581 2026-08-19T03:08:42Z Open
QwQ 32B FP16 qwq:32b 28.9 3770 2026-08-19T03:08:42Z Open
Qwen3.6 35B FP16 qwen3.6:35b 18.7 5915 2026-08-19T03:08:42Z Open
Glm 4.7 Flash 7B FP16 glm-4.7-flash:bf16 11.2 9291 2026-03-04T09:01:38Z Open
Llama 4 16X17B FP16 llama4:16x17b 8.6 8259 2026-08-19T03:08:42Z Open
Qwen3.5 122B FP16 qwen3.5:122b 4.9 11915 2026-02-26T19:19:16Z Open
Qwen3.5 35B FP16 qwen3.5:35b 2.8 37551 2026-06-24T06:22:37Z Open
Llama 3.3 70B FP16 llama3.3:70b 1.5 37261 2026-06-24T06:22:37Z Open

Validation notes

Open benchmark changelog Open model catalog Estimate VRAM