§01·model · /models
Qwen3-8B
llmactiveApache-2.0
8B LLM by Alibaba (Qwen3) with hybrid thinking / non-thinking modes, Apache-2.0. Recipes on 20 cards here, smallest 12 GB. Measured at 200.4 tok/s on an RTX 5090 and 129.1 tok/s on a 16 GB RTX 5080 — fast enough that the bottleneck in a chat UI stops being the model. The usual reason to pick this over the 14B is not VRAM but headroom for context and a second process on the card.
Download· 4 variants
§02·same family
5 other models · by nameOther models grouped with Qwen3-8B. Sizes and modalities can differ, and nothing here says whether one fits your GPU — open a model for its own compatibility table.
§03·GPUs that run this model
20 total| GPU | VRAM | Series | Best speed | Min VRAM | Works | Evidence | |
|---|---|---|---|---|---|---|---|
| RTX 5090 | 32GB | 50 | 200.4tokens/s | ✓ | 3benchesrecipe | check ↗ | |
| RTX 5080 | 16GB | 50 | 129.1tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 3090 Ti | 24GB | 30 | 123.7tokens/s | 24GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 5070 Ti | 16GB | 50 | 120.5tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 3090 | 24GB | 30 | 115.3tokens/s | 24GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 3080 Ti | 12GB | 30 | 115.2tokens/s | ✓ | 2benchesrecipe | check ↗ | |
| RTX 4080 Super | 16GB | 40 | 104.2tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 4080 | 16GB | 40 | 102.7tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 4070 Ti Super | 16GB | 40 | 96.3tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 5070 | 12GB | 50 | 85.8tokens/s | 12GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 4070 Ti | 12GB | 40 | 75.8tokens/s | 12GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 4070 Super | 12GB | 40 | 75.4tokens/s | 12GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 5060 Ti | 16GB | 50 | 69.2tokens/s | 16GB | ✓ | 2benchesrecipe | check ↗ |
| RTX 3060 | 12GB | 30 | 55.2tokens/s | ✓ | 2benchesrecipe | check ↗ | |
| RTX 4060 Ti 16GB | 16GB | 40 | 45.8tokens/s | 16GB | ✓ | 1benchrecipe | check ↗ |
| Apple M2 Pro | 16GB | apple | ~ | recipe | check ↗ | ||
| RTX 4070 | 12GB | 40 | ~ | recipe | check ↗ | ||
| RTX 4090 | 24GB | 40 | ~ | recipe | check ↗ | ||
| RX 7800 XT | 16GB | amd | ~ | recipe | check ↗ | ||
| RX 7900 XTX | 24GB | amd | ~ | recipe | check ↗ |
- VRAM
- 32GB
- Best speed
- 200.4tokens/s
- Min VRAM
- Evidence
- 3benchesrecipe
- VRAM
- 16GB
- Best speed
- 129.1tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 24GB
- Best speed
- 123.7tokens/s
- Min VRAM
- 24GB
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 120.5tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 24GB
- Best speed
- 115.3tokens/s
- Min VRAM
- 24GB
- Evidence
- 2benchesrecipe
- VRAM
- 12GB
- Best speed
- 115.2tokens/s
- Min VRAM
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 104.2tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 102.7tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 96.3tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 12GB
- Best speed
- 85.8tokens/s
- Min VRAM
- 12GB
- Evidence
- 2benchesrecipe
- VRAM
- 12GB
- Best speed
- 75.8tokens/s
- Min VRAM
- 12GB
- Evidence
- 2benchesrecipe
- VRAM
- 12GB
- Best speed
- 75.4tokens/s
- Min VRAM
- 12GB
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 69.2tokens/s
- Min VRAM
- 16GB
- Evidence
- 2benchesrecipe
- VRAM
- 12GB
- Best speed
- 55.2tokens/s
- Min VRAM
- Evidence
- 2benchesrecipe
- VRAM
- 16GB
- Best speed
- 45.8tokens/s
- Min VRAM
- 16GB
- Evidence
- 1benchrecipe
- VRAM
- 16GB
- Best speed
- Min VRAM
- Evidence
- recipe
- VRAM
- 12GB
- Best speed
- Min VRAM
- Evidence
- recipe
- VRAM
- 24GB
- Best speed
- Min VRAM
- Evidence
- recipe
- VRAM
- 16GB
- Best speed
- Min VRAM
- Evidence
- recipe
- VRAM
- 24GB
- Best speed
- Min VRAM
- Evidence
- recipe
✓ benchmarked·~ runs via recipe (not benchmarked)·— untested·✕doesn't fit