Skip to content
AI Model Radar

Hardware guide

Best local models for
RTX 4080

EstimatedEstimated: computed from our curated model and hardware catalog — not a live reading.

Specifications

Memory
16 GB
Memory type
Dedicated VRAM
Bandwidth
716.8 GB/s
Class
Solid local

The short answer

gpt-oss 20B

Weights ~10.8 GB (Q4_K_M), context ~0.2 GB at 8K tokens, runtime ~1.2 GB. Your 16 GB leaves ~14.1 GB usable after a 12% safety margin.

GGUF (Q4_K_M) ↗ (External link)Original (safetensors) ↗ (External link)Ollama ↗ (External link)

Fit labels

  • Excellent fit
  • Good fit
  • Tight fit
  • Offload required
  • Not recommended

Every curated model on this card

Context length: 8K tokens · f16 (default)

Model fit on the selected hardware
ModelFitEst. memoryEstimated memory = weights + context + runtime
Gemma 4 12BGoogle · 12B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~8.5 GB6.6 + 0.8 + 1.0
Nemotron Nano 9B v2NVIDIA · 8.9B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Excellent fit~8.9 GB6.1 + 1.8 + 1.0
Ornith 1.5 9BOrnith AI · 9.7B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~6.7 GB5.4 + 0.3 + 1.0
Granite 4.2 8BIBM · 8.8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~7.3 GB5.0 + 1.3 + 1.0
LFM2.5 8B-A1BLiquid AI · 8.5B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~5.9 GB4.8 + 0.1 + 1.0
Qwen3 8BAlibaba Qwen · 8.2B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~6.8 GB4.7 + 1.1 + 1.0
Gemma 4 E4BGoogle · 8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~5.7 GB4.6 + 0.1 + 1.0
Ling 3.0 TinyInclusionAI · 7.9B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Excellent fit~5.7 GB4.5 + 0.2 + 1.0
Qwen3 4BAlibaba Qwen · 4B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~4.3 GB2.3 + 1.1 + 0.9
Phi-4 MiniMicrosoft · 3.8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~4.2 GB2.3 + 1.0 + 0.9
Granite 4.2 3BIBM · 3.7B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~3.6 GB2.1 + 0.6 + 0.9
LFM2.5 2.6BLiquid AI · 2.7B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~2.6 GB1.6 + 0.1 + 0.9
LFM2.5 1.2BLiquid AI · 1.2B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~1.7 GB0.7 + 0.1 + 0.9
Qwen3 0.6BAlibaba Qwen · 0.6B · Q8_0GGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Excellent fit~2.3 GB0.6 + 0.9 + 0.9
gpt-oss 20BOpenAI · 20.9B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Good fit~12.2 GB10.8 + 0.2 + 1.2
Qwen3 14BAlibaba Qwen · 14.8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Good fit~10.8 GB8.4 + 1.3 + 1.1
Qwen AgentWorld 35B-A3BAlibaba Qwen · 34.7B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Offload required~22.2 GB20.6 + 0.2 + 1.5
Ornith 1.5 35B-A3BOrnith AI · 36B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~21.8 GB20.2 + 0.2 + 1.5
KAT-Coder V2.5Kwaipilot · 34.7B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Offload required~21.5 GB19.9 + 0.2 + 1.4
Qwen3 32BAlibaba Qwen · 32.8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~21.8 GB18.4 + 2.0 + 1.4
Qwen3-Coder 30B-A3BAlibaba Qwen · 30.5B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~19.4 GB17.3 + 0.8 + 1.4
Gemma 4 31BGoogle · 31.3B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~20.5 GB17.1 + 2.0 + 1.4
GLM-4.7-FlashZhipu AI · 31.2B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Offload required~18.9 GB17.1 + 0.4 + 1.4
Granite 4.2 30BIBM · 29.3B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~19.8 GB16.5 + 2.0 + 1.3
Gemma 4 26B-A4BGoogle · 25.8B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~17.6 GB15.8 + 0.5 + 1.3
Gemma 3 27BGoogle · 27.4B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~17.7 GB15.4 + 1.0 + 1.3
Qwen3.8 27BAlibaba Qwen · 27.8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~17.1 GB15.3 + 0.5 + 1.3
Mistral Small 3.2Mistral AI · 24B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~15.8 GB13.3 + 1.3 + 1.2
Devstral Small 2 24BMistral AI · 24B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Offload required~15.8 GB13.3 + 1.3 + 1.2
Qwen3.8 2.4T-A95BAlibaba Qwen · 2.4T-A95B · IQ4_XSGGUF ↗ (External link)Original ↗ (External link)Not recommended~1259.0 GB1220.8 + 0.7 + 37.5
DeepSeek-V4-ProDeepSeek · 1650B MoE · Q4_KGGUF ↗ (External link)Original ↗ (External link)Not recommended~816.4 GB791.3 + 0.5 + 24.6
GLM-5.3Zhipu AI · 753B · Q4_KGGUF ↗ (External link)Original ↗ (External link)Not recommended~449.8 GB435.2 + 0.7 + 13.9
GLM-5.2Zhipu AI · 753B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Not recommended~448.3 GB433.8 + 0.7 + 13.9
Ornith 1.5 397BOrnith AI · 403B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Not recommended~235.4 GB227.5 + 0.2 + 7.7
GLM-5.3-FlashZhipu AI · 321B · Q4_KGGUF ↗ (External link)Original ↗ (External link)Not recommended~192.5 GB186.0 + 0.1 + 6.4
Hy3Tencent · 299B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Not recommended~174.6 GB166.3 + 2.5 + 5.8
DeepSeek-V4-FlashDeepSeek · 304B MoE · Q4_KGGUF ↗ (External link)Original ↗ (External link)Not recommended~150.0 GB144.4 + 0.4 + 5.2
Qwen3.8 Flash-NextAlibaba Qwen · 180B MoE · Q4_KGGUF ↗ (External link)Original ↗ (External link)Not recommended~107.8 GB103.7 + 0.2 + 4.0
Ling 3.0 FlashInclusionAI · 127B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Not recommended~73.4 GB70.1 + 0.4 + 3.0
GLM-4.5-AirZhipu AI · 110B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Not recommended~72.3 GB68.0 + 1.4 + 2.9
gpt-oss 120BOpenAI · 117B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Not recommended~61.4 GB58.5 + 0.3 + 2.6
Qwen3-Coder NextAlibaba Qwen · 79.7B MoE · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Not recommended~48.1 GB45.1 + 0.8 + 2.2
Llama 3.3 70BMeta · 70.6B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Not recommended~44.1 GB39.6 + 2.5 + 2.0
Llama 3.1 8BMeta · 8B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Unknown
Llama 3.2 3BMeta · 3B · Q4_K_MGGUF ↗ (External link)Original ↗ (External link)Ollama ↗ (External link)Unknown

All memory figures are estimates: measured quantized file size + computed context memory + runtime overhead, with a 12% safety margin on your hardware. Real usage varies with runtime version and settings.

GGUF is the quantized single-file format local runtimes load (Ollama, LM Studio, llama.cpp); our memory figures are measured from the linked GGUF file. The original repo holds full-precision safetensors — a much larger download meant for GPUs with far more memory.

Same memory, different speed

These cards hold the same models — the difference is how fast they read them. Memory bandwidth is the ceiling for token generation, so it decides tokens per second, not which models fit.

Same memory, different speed
CardBandwidthRelative speed
RTX 4080(this card)716.8 GB/s1.00×
RTX 5080960 GB/s1.34×
RTX 4060 Ti 16GB288 GB/s0.40×
RTX 5060 Ti 16GB448 GB/s0.63×
RTX 5070 Ti896 GB/s1.25×

Relative speed compares memory bandwidth only. Real throughput also depends on the runtime, quantization and how much of the model sits in VRAM.

When this card is not enough

Own the middle.

DGX Spark and GB10-class systems put 128 GB of unified memory on your desk. Rational when large local models are your daily routine.

Read our DGX Spark profile

Path C — Elastic compute

Rent the spike.

Occasional heavy job? Rent an H100 for the afternoon instead of buying hardware that idles the rest of the year.

Browse current offers