Meta Llama 3.x / 4
Metas Llama ist die größte offene Modellfamilie — viele Größen, sehr günstige Preise und maximale Flexibilität.
→ Quelle / RepositoryPreise und Features: Stand 23. Februar 2026. Preise ändern sich laufend — Preise variieren je nach Provider.
Was ist Llama?
Llama ist Metas offene Modellfamilie und hat das Feld der Open-Weight-Modelle maßgeblich geprägt. Von winzigen 1B-Varianten bis zum riesigen 405B-Modell ist alles dabei. Für Coder sind vor allem die mittleren bis großen Varianten interessant, die über Cloud-Provider extrem günstig verfügbar sind.
Das Schöne an Llama: Du bist nicht an einen Anbieter gebunden. Dutzende Cloud-Provider hosten Llama-Modelle, und du kannst sie sogar lokal laufen lassen.
Die Modellfamilie im Überblick
- Llama 3.2 3B/8B Instruct — Günstige Allrounder für leichtere Aufgaben.
- Llama 3.3 70B Instruct — Leistungsstark und eine gute Wahl für ernsthaftes Cloud-Coding.
- Llama 4 Maverick — Die neuere High-End-Variante mit großem Kontext und starker Performance.
Tarife (Beispiele)
Preise variieren je nach Provider. Hier eine Orientierung:
| Modell | Input-Preis / 1M Tokens | Output-Preis / 1M Tokens |
|---|---|---|
| Llama 3.2 3B Instruct | 0,02 $ | 0,02 $ |
| Llama 3.3 70B Instruct | 0,10 $ | 0,32 $ |
| Llama 4 Maverick (Flagship) | 0,15 $ | 0,60 $ |
Zum Vergleich: Für den Preis eines einzigen Claude Opus-Requests bekommst du bei Llama Dutzende Anfragen.
Was macht Llama stark fürs Coden?
- Maximale Auswahl — Viele Größen für verschiedene Budgets. Du kannst feingranular zwischen Kosten und Qualität wählen.
- Sehr günstige Preise — Besonders die kleineren Modelle (3B–11B) sind fast geschenkt und reichen für viele Coding-Tasks.
- Gute Coding-Leistung ab 70B — Die größeren Varianten kommen in Benchmarks an kommerzielle Modelle heran.
- Open Weights — Riesen-Community, viele Prompt-Rezepte, Fine-Tuning-Guides und maximale Flexibilität.
Für wen ist Llama die richtige Wahl?
Llama ist ideal, wenn du:
- Maximale Flexibilität willst und dich nicht an einen Anbieter binden möchtest
- Ein begrenztes Budget hast und trotzdem brauchbare Coding-Leistung brauchst
- Spezialisierte Coder-Agenten in Multi-Agent-Setups einsetzen willst
- Später eventuell selbst hosten oder Fine-Tuning betreiben möchtest
Wo kannst du Llama nutzen?
- Cloud-Provider: Meta, Together, Cloudflare, Groq und viele andere
- Tools: Breiter Support in IDE-Plugins, Ollama, LM Studio
- Lokal: Ollama, LM Studio, HuggingFace
Offizielle Links
- Llama: ai.meta.com/llama
Häufige Fragen
Was ist Meta Llama?
Llama ist Metas offene Modellfamilie und hat das Feld der Open-Weight-Modelle maßgeblich geprägt. Die Palette reicht von winzigen 1B-Varianten bis zum riesigen 405B-Modell. Für Coder sind vor allem Llama 3.3 70B Instruct und das neuere Llama 4 Maverick interessant. Da Dutzende Cloud-Provider Llama hosten, bist du an keinen Anbieter gebunden und kannst die Modelle sogar lokal laufen lassen.
Was kostet Llama?
Die Preise variieren je nach Provider, sind aber sehr niedrig: Llama 3.2 3B Instruct kostet circa 0,02 Dollar für Input und Output pro 1 Million Tokens, Llama 3.3 70B Instruct 0,10 und 0,32 Dollar, das Flaggschiff Llama 4 Maverick 0,15 und 0,60 Dollar. Für den Preis eines einzigen Claude-Opus-Requests bekommst du bei Llama Dutzende Anfragen. Stand: Februar 2026.
Für wen ist Llama die richtige Wahl?
Llama ist ideal, wenn du maximale Flexibilität ohne Anbieterbindung willst, ein begrenztes Budget hast oder spezialisierte Coder-Agenten in Multi-Agent-Setups einsetzt. Auch wer später selbst hosten oder Fine-Tuning betreiben möchte, profitiert von den offenen Gewichten, der riesigen Community und den vielen verfügbaren Guides. Die größeren Varianten ab 70B kommen in Benchmarks an kommerzielle Modelle heran.
Quellen
- Industry Leading, Open-Source AI | Llama — Meta (abgerufen 2026-07-13)
Verwandte Artikel
MiniMax M3: Open-Weight-MoE mit 1M-Token-Kontext
MiniMax M3 ist ein Open-Weight-MoE-Modell (428B/23B aktiv) mit 1M-Token-Kontext und Sparse Attention — stark bei Coding- und Agenten-Benchmarks.
DeepSeek V3.x
DeepSeek ist der Preis-Leistungs-König unter den Coding-Modellen — starkes Reasoning zu einem Bruchteil der Kosten.
Qwen2.5 / Qwen3 Coder
Qwen Coder von Alibaba ist der führende Open-Source-Coder 2026 — teils besser als GPT-4 bei HumanEval und SWE-Bench.