§01·spec · /gpus
RTX 3060 Ti
nvidia30 series8GB VRAM
26 open-weights AI models run on the RTX 3060 Ti — see which fit, how fast they go, and the VRAM each needs.
§02·models that run on this GPU
26 totalLLM · 13
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| llama2 7b | 73.07tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| wizardlm2 7b | 70.79tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| qwen2 7b | 63.73tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| Qwen2.5 7B | 58.13tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| Llama 3.1 8B | 57.34tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| gemma 7b | 31.95tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| falcon2 11b | 31.2tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| Gemma 2 9B | 23.8tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| stablelm2 12b | 18.73tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| llama2 13b | 9.25tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| Nanbeige4.2 3B | 8GB | ✓ | recipe | check ↗ | |
| Ornith 1.0 9B | 8GB | ✓ | recipe | check ↗ | |
| Qwen3-4B | 4GB | ✓ | recipe | check ↗ |
- Best speed
- 73.07tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 70.79tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 63.73tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 58.13tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 57.34tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 31.95tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 31.2tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 23.8tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 18.73tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- 9.25tokens/s
- Min VRAM
- 8GB
- Evidence
- 1benchrecipe
- Best speed
- Min VRAM
- 8GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 8GB
- Evidence
- recipe
- Best speed
- Min VRAM
- 4GB
- Evidence
- recipe
Multimodal · 6
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| llava 7b | 72tokens/s | 8GB | ✓ | 1benchrecipe | check ↗ |
| Agents-A1 4B | 8GB | ✓ | recipe | check ↗ | |
| Bonsai 27B | 6GB | ✓ | recipe | check ↗ | |
| Fara1.5-4B | 8GB | ✓ | recipe | check ↗ | |
| Gemma 4 E4B-IT | 6GB | ✓ | recipe | check ↗ | |
| MiniMind-O | 4GB | ✓ | recipe | check ↗ |
Video · 1
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| AnimateDiff | 6GB | ✓ | recipe | check ↗ |
TTS · 4
Music · 1
| Model | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|
| Foundation-1 | 8GB | ✓ | recipe | check ↗ |
§03·tested recipes
showing 6 of 26- llmintermediate8GB+recipe
Nanbeige4.2-3B on RTX 3060 Ti: 32K Context in 8 GB, and What sm_86 Does Not Change
- multimodaladvanced8GB+recipe
Fara1.5-4B on RTX 3060 Ti: Browser Computer-Use Agent with llama.cpp Vision
- multimodalintermediate8GB+recipe
Agents-A1 4B on RTX 3060 Ti (8GB): Vision-Capable Local Agent via llama.cpp
- multimodalintermediate6GB+recipe
Bonsai 27B on RTX 3060 Ti: a 27B Multimodal Model on 8GB via 1-bit GGUF + llama.cpp
- llmintermediate8GB+recipe
Ornith 1.0 9B on RTX 3060 Ti (8GB): Local Agentic Coding at the Fit Boundary via llama.cpp + OpenHands
- llmbeginner8GB+recipe
Llama 3.1 8B on RTX 3060 Ti: Local Chat via Ollama or llama.cpp + Unsloth UD-Q4_K_XL GGUF