§01·index · /recipes
Recipes
930 community-tested setups for running open-weights AI models on real consumer GPUs.page 2 of 10
- multimodaladvanced8GB+
Fara1.5-4B on RTX 4060 Ti 8GB: Local Browser Computer-Use Agent with llama.cpp
- multimodaladvanced16GB+
Fara1.5-4B on RTX 4060 Ti 16GB: BF16 Computer-Use Agent with llama.cpp
- multimodaladvanced16GB+
Fara1.5-4B on RTX 3090: BF16 Computer-Use Agent at a 131K Context with llama.cpp
- multimodaladvanced16GB+
Fara1.5-4B on RTX 3090 Ti: BF16 Browser Computer-Use Agent on Ampere sm_86
- multimodaladvanced12GB+
Fara1.5-4B on RTX 3080 Ti: Browser Computer-Use Agent at Q8_0 in 12GB with llama.cpp
- multimodaladvanced12GB+
Fara1.5-4B on RTX 3060: a 12GB Browser Computer-Use Agent at Q8_0 with llama.cpp
- multimodaladvanced24GB+
Fara1.5-4B on Apple M4 Max: Browser Computer-Use Agent at Full 262K Context
- multimodaladvanced24GB+
Fara1.5-4B on Apple M3 Max: Browser Computer-Use Agent on llama.cpp Metal
- multimodaladvanced16GB+
Fara1.5-4B on Apple M2 Pro: Browser Computer-Use Agent in 16GB Unified Memory
- multimodaladvanced24GB+
Fara1.5-4B on Apple M2 Max: Browser Computer-Use Agent on llama.cpp Metal
- multimodaladvanced24GB+
Fara1.5-27B on RX 7900 XTX: Q4_K_M Browser Computer-Use Agent on ROCm gfx1100
- multimodaladvanced32GB+
Fara1.5-27B on RTX 5090: Q6_K Computer-Use Agent on Blackwell sm_120
- multimodaladvanced24GB+
Fara1.5-27B on RTX 4090: Q4_K_M Browser Computer-Use Agent on Ada sm_89
- multimodaladvanced24GB+
Fara1.5-27B on RTX 3090 Ti: Q4_K_M Browser Computer-Use Agent on Ampere sm_86
- multimodaladvanced48GB+
Fara1.5-27B on Apple M3 Max: Browser Computer-Use Agent on llama.cpp Metal
- multimodaladvanced64GB+
Fara1.5-27B on Apple M2 Max: Browser Computer-Use Agent at the Full 262K Context
- multimodaladvanced24GB+
Fara1.5-27B on RTX 3090: local browser computer-use agent with llama.cpp
- multimodaladvanced12GB+
Fara1.5-9B on RTX 4070: a Local Browser Computer-Use Agent with llama.cpp
- multimodaladvanced8GB+
Fara1.5-4B on RTX 3060 Ti: Browser Computer-Use Agent with llama.cpp Vision
- multimodaladvanced24GB+
Agents-A1 35B-A3B on RTX 3090: 128K Agentic Serving via llama.cpp, and What Vision Costs on 24 GB
- multimodalintermediate14GB+
Agents-A1 4B on Apple M2 Max: First-Party GGUF + Vision on Metal at the Full 262K Context
- multimodalintermediate8GB+
Agents-A1 4B on RTX 3060 Ti (8GB): Vision-Capable Local Agent via llama.cpp
- llmadvanced48GB+
KAT-Coder V2.5 Dev on Apple M2 Max: 35B Agentic Coding via llama.cpp Metal (64GB Unified Memory)
- llmadvanced24GB+
KAT-Coder V2.5 Dev on RTX 3090: 35B-A3B Agentic Coding at 128K Context via llama.cpp
- multimodalintermediate6GB+
Bonsai 27B on Apple M2 Pro: a 27B Multimodal Model on 16GB Unified Memory via 1-bit GGUF + Metal
- multimodalintermediate6GB+
Bonsai 27B on RX 7900 XTX: a 27B Multimodal Model on AMD via 1-bit GGUF + llama.cpp (ROCm)
- multimodalintermediate6GB+
Bonsai 27B on RTX 5060: the Cheapest Current-Gen Card That Runs a 27B
- multimodalintermediate10GB+
Bonsai 27B on RTX 4090: the Full 262K Window Plus the Vision Tower
- multimodalintermediate12GB+
Bonsai 27B on RTX 4070: 100K Context with No KV Compression on 12GB
- multimodalintermediate6GB+
Bonsai 27B on RTX 3060 Ti: a 27B Multimodal Model on 8GB via 1-bit GGUF + llama.cpp
- llmadvanced48GB+
Qwen3-Next 80B-A3B on Apple M3 Max: an 80B MoE Assistant in 48GB via a Sub-Q4 GGUF
- llmadvanced64GB+
Qwen3-Next 80B-A3B on Apple M2 Max: an 80B MoE Assistant in 64GB Unified Memory
- llmintermediate16GB+
Gemma 4 12B on RX 7800 XT: Local Private Assistant via llama.cpp-HIP / Ollama (ROCm, 16GB)
- llmintermediate48GB+
Gemma 4 12B on Apple M3 Max: Local Private Assistant via llama.cpp / Ollama (48GB)
- llmintermediate16GB+
Gemma 4 12B on Apple M2 Pro: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate24GB+
Gemma 4 12B on RTX 3090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Gemma 4 12B on RTX 4080: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate12GB+
Gemma 4 12B on RTX 4070: Local Private Assistant via llama.cpp / Ollama (12GB)
- llmintermediate8GB+
Gemma 4 12B on RTX 4060: Local Private Assistant via llama.cpp / Ollama (8GB)
- llmintermediate24GB+
Gemma 4 12B on RTX 4090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Phi-4 (14B) on RX 7800 XT: Local Private Assistant via llama.cpp-HIP / Ollama (ROCm, 16GB)
- llmintermediate48GB+
Phi-4 (14B) on Apple M3 Max: Full-Precision Local Assistant via llama.cpp / Ollama (48GB)
- llmintermediate16GB+
Phi-4 (14B) on Apple M2 Pro: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate32GB+
Phi-4 (14B) on RTX 5090: Local Private Assistant via llama.cpp / Ollama (32GB)
- llmintermediate24GB+
Phi-4 (14B) on RTX 3090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Phi-4 (14B) on RTX 4080: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate12GB+
Phi-4 (14B) on RTX 4070: Local Private Assistant via llama.cpp / Ollama (12GB)
- llmintermediate24GB+
Phi-4 (14B) on RTX 4090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Mistral Nemo 12B on RX 7800 XT: Local Private Assistant via llama.cpp-HIP / Ollama (ROCm, 16GB)
- llmintermediate48GB+
Mistral Nemo 12B on Apple M3 Max (48GB): Full-Precision Local Assistant via llama.cpp / Ollama (Metal)
- llmintermediate16GB+
Mistral Nemo 12B on Apple M2 Pro (16GB): Local Private Assistant via llama.cpp / Ollama (Metal)
- llmintermediate24GB+
Mistral Nemo 12B on RTX 3090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Mistral Nemo 12B on RTX 4080: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate12GB+
Mistral Nemo 12B on RTX 4070: Local Private Assistant via llama.cpp / Ollama (12GB)
- llmintermediate8GB+
Mistral Nemo 12B on RTX 4060: Local Private Assistant via llama.cpp / Ollama (8GB)
- llmintermediate24GB+
Mistral Nemo 12B on RTX 4090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate24GB+
Mistral Small 3.2 24B on RX 7900 XTX: Local Private Assistant via llama.cpp-HIP / Ollama (24GB ROCm)
- llmintermediate64GB+
Mistral Small 3.2 24B on M2 Max (64GB): Local Private Assistant via llama.cpp / Ollama on Apple Metal
- llmintermediate48GB+
Mistral Small 3.2 24B on M3 Max (48GB): Local Private Assistant via llama.cpp / Ollama on Apple Metal
- llmintermediate32GB+
Mistral Small 3.2 24B on RTX 5090: Local Private Assistant via llama.cpp / Ollama (32GB)
- llmintermediate24GB+
Mistral Small 3.2 24B on RTX 3090 Ti: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate24GB+
Mistral Small 3.2 24B on RTX 3090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmintermediate16GB+
Mistral Small 3.2 24B on RTX 4080: Local Private Assistant via llama.cpp / Ollama (16GB)
- llmintermediate24GB+
Mistral Small 3.2 24B on RTX 4090: Local Private Assistant via llama.cpp / Ollama (24GB)
- llmadvanced24GB+
Devstral Small 2 (24B) on RX 7900 XTX: Local Agentic Coding via llama.cpp-HIP + OpenHands (24GB ROCm)
- llmintermediate64GB+
Devstral Small 2 (24B) on Apple M2 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (64GB Apple / Q8_0 default, bf16 opt-in)
- llmintermediate48GB+
Devstral Small 2 (24B) on Apple M3 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (48GB Apple / Q8_0 near-lossless)
- llmintermediate32GB+
Devstral Small 2 (24B) on RTX 5090: Local Agentic Coding via llama.cpp + OpenHands (32GB Quality Tier, near-lossless Q8_0)
- llmintermediate24GB+
Devstral Small 2 (24B) on RTX 3090 Ti: Local Agentic Coding via llama.cpp + OpenHands (24GB, Faster Ampere)
- llmintermediate24GB+
Devstral Small 2 (24B) on RTX 3090: Local Agentic Coding via llama.cpp + OpenHands (24GB Value Tier)
- llmintermediate16GB+
Devstral Small 2 (24B) on RTX 4080: Local Agentic Coding via llama.cpp + OpenHands (16GB Entry Tier)
- llmadvanced24GB+
Laguna XS 2.1 on RX 7900 XTX: Local Agentic Coding via Ollama (ROCm) / llama.cpp + OpenHands (24GB Tier)
- llmadvanced24GB+
Laguna XS 2.1 on Apple M2 Max: Local Agentic Coding via Ollama + OpenHands (64GB Apple)
- llmadvanced24GB+
Laguna XS 2.1 on Apple M3 Max: Local Agentic Coding via Ollama + OpenHands (48GB Apple / q8_0-capable)
- llmadvanced24GB+
Laguna XS 2.1 on RTX 5090: Local Agentic Coding via Ollama / llama.cpp + OpenHands (32GB Tier)
- llmadvanced24GB+
Laguna XS 2.1 on RTX 3090 Ti: Local Agentic Coding via Ollama / llama.cpp + OpenHands (24GB Tier)
- llmadvanced24GB+
Laguna XS 2.1 on RTX 3090: Local Agentic Coding via Ollama / llama.cpp + OpenHands (24GB Value-Entry Tier)
- llmadvanced24GB+
North Mini Code 1.0 on RX 7900 XTX: Local Agentic Coding via llama.cpp-HIP + OpenHands (24GB ROCm Entry Tier)
- llmadvanced48GB+
North Mini Code 1.0 on Apple M2 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (64GB Unified Memory)
- llmadvanced48GB+
North Mini Code 1.0 on Apple M3 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (48GB Unified Memory)
- llmadvanced32GB+
North Mini Code 1.0 on RTX 5090: Local Agentic Coding via llama.cpp + OpenHands (32GB Blackwell Tier)
- llmadvanced16GB+
North Mini Code 1.0 on RTX 4080: Reduced-Quant Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmadvanced24GB+
North Mini Code 1.0 on RTX 3090 Ti: Local Agentic Coding via llama.cpp + OpenHands (24GB Entry Tier)
- llmadvanced24GB+
North Mini Code 1.0 on RTX 4090: Local Agentic Coding via llama.cpp + OpenHands (24GB Ada Tier)
- llmintermediate24GB+
Devstral Small 2 (24B) on RTX 4090: Local Agentic Coding via llama.cpp + OpenHands (24GB, the Vendor's Named Target)
- llmadvanced24GB+
Laguna XS 2.1 on RTX 4090: Local Agentic Coding via Ollama / llama.cpp + OpenHands (24GB Entry Tier)
- llmadvanced24GB+
North Mini Code 1.0 on RTX 3090: Local Agentic Coding via llama.cpp + OpenHands (24GB Entry Tier)
- llmadvanced48GB+
Ornith 1.0 35B on Apple M2 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (64GB Unified Memory)
- llmadvanced48GB+
Ornith 1.0 35B on Apple M3 Max: Local Agentic Coding via llama.cpp Metal + OpenHands (48GB Unified Memory)
- llmadvanced24GB+
Ornith 1.0 35B on RX 7900 XTX: Local Agentic Coding via llama.cpp-HIP + OpenHands (24GB ROCm Entry Tier)
- llmintermediate12GB+
Ornith 1.0 9B on Apple M2 Pro: Local Agentic Coding in 16GB Unified Memory via llama.cpp Metal + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RX 7800 XT: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp-HIP + OpenHands (ROCm)
- llmintermediate12GB+
Ornith 1.0 9B on RTX 5060 Ti: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 5080: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 5070 Ti: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 4060 Ti 16GB: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 4080 SUPER: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 4070 Ti SUPER: Max-Fidelity Local Agentic Coding in 16GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 4070 Ti: A Local Agentic-Coding Model in 12GB via llama.cpp + OpenHands
- llmintermediate12GB+
Ornith 1.0 9B on RTX 4070 SUPER: A Local Agentic-Coding Model in 12GB via llama.cpp + OpenHands