§01·spec · /gpus
RTX 4070
nvidia40 series12GB VRAM
42 open-weights AI models run on the RTX 4070 — see which fit, how fast they go, and the VRAM each needs.
§02·models that run on this GPU
42 totalLLM · 10
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| Gemma 4 12B | 12GB | ✓ | recipe | check ↗ | |
| gpt-oss 20B | 12GB | ✓ | recipe | check ↗ | |
| Llama 3.1 8B | 10GB | ✓ | recipe | check ↗ | |
| Mistral Nemo 12B | 12GB | ✓ | recipe | check ↗ | |
| Nanbeige4.2 3B | 12GB | ✓ | recipe | check ↗ | |
| Ornith 1.0 9B | 12GB | ✓ | recipe | check ↗ | |
| Phi-4 | 12GB | ✓ | recipe | check ↗ | |
| Qwen3 14B | 12GB | ✓ | recipe | check ↗ | |
| Qwen3 30B-A3B | 12GB | ✓ | recipe | check ↗ | |
| Qwen3-8B | 12GB | ✓ | recipe | check ↗ |
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 10GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
Multimodal · 8
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| Qwen3.6 35B-A3B | 80.8tokens/s | 12GB | ✓ | 1benchrecipe | check ↗ |
| Bonsai 27B | 12GB | ✓ | recipe | check ↗ | |
| Fara1.5-4B | 12GB | ✓ | recipe | check ↗ | |
| Fara1.5-9B | 12GB | ✓ | recipe | check ↗ | |
| Gemma 4 E4B-IT | 6GB | ✓ | recipe | check ↗ | |
| MiniMind-O | 4GB | ✓ | recipe | check ↗ | |
| MOSS-Audio | 12GB | ✓ | recipe | check ↗ | |
| Voxtral Mini 3B | 10GB | ✓ | recipe | check ↗ |
- Best speed
- 80.8tokens/s
- Min VRAM
- 12GB
- Evidence
- 1benchrecipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 6GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 4GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 10GB
- Evidence
- recipe
Image · 9
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| Anima | 7GB | ✓ | recipe | check ↗ | |
| Chroma V48 | 11GB | ✓ | recipe | check ↗ | |
| ERNIE-Image-Turbo | 12GB | ✓ | recipe | check ↗ | |
| Flux.2-Klein-4B | 8GB | ✓ | recipe | check ↗ | |
| HiDream-O1-Image | 10GB | ✓ | recipe | check ↗ | |
| Juggernaut Z | 12GB | ✓ | recipe | check ↗ | |
| Krea 2 | 12GB | ✓ | recipe | check ↗ | |
| Qwen-Image | 12GB | ✓ | recipe | check ↗ | |
| SenseNova U1 | 12GB | ✓ | recipe | check ↗ |
- Best speed
- Min VRAM
- 7GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 11GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 8GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 10GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 12GB
- Evidence
- recipe
Video · 4
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| CogVideoX 1.5 | 10GB | ✓ | recipe | check ↗ | |
| LightX2V | 8GB | ✓ | recipe | check ↗ | |
| MiniMax H3 (Hailuo 3) | 12GB | ✓ | recipe | check ↗ | |
| Wan 2.2 TI2V-5B | 8GB | ✓ | recipe | check ↗ |
3D · 1
TTS · 6
Music · 2
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| ACE-Step 1.5 XL | 8GB | ✓ | recipe | check ↗ | |
| Foundation-1 | 8GB | ✓ | recipe | check ↗ |
§03·tested recipes
showing 6 of 42- llmintermediate12GB+recipe
Nanbeige4.2-3B on RTX 4070: Q8_0 weights and a 65,536-token cache in 12 GB
- videoadvanced12GB+recipe
MiniMax H3 on RTX 4070: 12 GB video+audio via ComfyUI VRAM offload
- multimodaladvanced12GB+recipe
Fara1.5-4B on RTX 4070: a Q8_0 Browser Computer-Use Agent with llama.cpp
- multimodaladvanced12GB+recipe
Fara1.5-9B on RTX 4070: a Local Browser Computer-Use Agent with llama.cpp
- multimodalintermediate12GB+recipe
Bonsai 27B on RTX 4070: 100K Context with No KV Compression on 12GB
- llmintermediate12GB+recipe
Gemma 4 12B on RTX 4070: Local Private Assistant via llama.cpp / Ollama (12GB)