Google Gemma 4 (12B/26B): Multimodales Open-Source-Modell fürs Notebook
Google Gemma 4 bringt multimodale KI mit Audio-Input unter Apache 2.0 auf lokale Hardware — mit QAT-Varianten und MTP-Speculative-Decoding bis 100+ Token/s.
→ Quelle / RepositoryGoogle Gemma 4 ist Googles offene Modellfamilie für lokale Hardware, vorgestellt im Juni 2026 und unter Apache-2.0-Lizenz frei nutzbar. Das Modell verarbeitet Text, Bilder und — erstmals in mittlerer Größe — Audio nativ, ganz ohne Cloud. Anders als das proprietäre Gemini läuft Gemma 4 komplett auf deinem Notebook.
Die Gemma-4-Varianten im Steckbrief
| Merkmal | Gemma 4 12B | Gemma 4 26B |
|---|---|---|
| Zielhardware | Notebooks, ~12 GB VRAM | Workstations, 12-24 GB VRAM (mit QAT/Offload) |
| Multimodal | Text, Bild, nativer Audio-Input | Text, Bild, Audio |
| Lizenz | Apache 2.0 | Apache 2.0 |
| MTP-Speed (RTX 4070) | 120,8 Token/s (2,0x) | 38,5 → 100,6 Token/s (2,6x) |
| QAT-Variante | verfügbar | ~18 GB → ~14,2 GB, Q8-nahe Qualität |
| Draft-Modell (MTP) | mitgeliefert | ~460 MB |
Multimodal ohne Encoder-Ballast
Gemma 4 setzt auf eine vereinheitlichte Architektur, die multimodale Daten direkt im LLM-Backbone verarbeitet. Den klassischen Vision-Encoder hat Google durch ein leichtgewichtiges Embedding-Modul ersetzt; beim Audio fliegt der Encoder komplett raus — das rohe Signal wird direkt in denselben Raum wie die Text-Token projiziert. Diese Verschlankung senkt Latenz und RAM-Verbrauch, was auf Notebooks den Unterschied macht. Die 12B-Variante ist zudem das erste Modell mittlerer Größe mit nativen Audioeingängen: Lokale Sprachassistenten werden möglich, bei denen Audiodaten nie das Gerät verlassen. In Benchmarks schlägt die 12B-Version laut Google teils sogar die alte Gemma 3 27B. Unsere Release-Einordnung hat die Details.
Tempo auf lokaler Hardware: MTP macht den Unterschied
Gemma 4 bringt native Multi-Token-Prediction-Köpfe mit — das Draft-Modell für Speculative Decoding liegt dem Download bei und ist bei der 26B-Variante nur rund 460 MB groß. Die dokumentierten Messwerte aus dem Referenz-Setup von Homelab-Entwickler Kartikey Chauhan (RTX 4070, 12 GB VRAM, Juni 2026): Gemma 4 26B springt mit --spec-type draft-mtp von 38,5 auf 100,6 Token/s, Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Dazu kommen QAT-Varianten (Quantization-Aware Training): 4-Bit-Verhalten nahe Q8-Qualität, das 26B-Modell schrumpft von ~18 GB auf ~14,2 GB. Die komplette Optimierungs-Reihenfolge — inklusive Sampler-Empfehlung temp 1.0, top-k 64, top-p 0.95 — steht im llama.cpp-Guide.
Wann ist Gemma 4 die richtige Wahl?
Gemma 4 lohnt sich, wenn du KI lokal und ohne Cloud-Zwang betreiben willst:
- Notebook-Betrieb — 12B als Sweetspot für 12-GB-VRAM-Hardware, mit MTP über 120 Token/s
- Datenschutz-kritische Anwendungen — Sprachassistenten und Bildanalyse, ohne dass Daten das Gerät verlassen
- Freie Lizenz — Apache 2.0 erlaubt Anpassung, Fine-Tuning und kommerzielle Integration ohne restriktive Vorgaben
- Coding-Sessions lokal — als Dense-Modell profitiert Gemma 4 stark von QAT-Quants und Speculative Decoding
Für maximale Rohleistung in der Cloud bleibt Gemini 3 Pro die stärkere Wahl — Gemma 4 ist Googles Antwort für alle, die Kontrolle über die eigene Hardware behalten wollen.
Offizielle Links
- Ankündigung: blog.google — Introducing Gemma 4 12B
Häufige Fragen
Welche Größen gibt es bei Google Gemma 4?
Gemma 4 erscheint in mehreren Größen: einem sparsamen 4B-Modell, der 12B-Variante als Sweetspot für Notebooks und dem 26B-Topmodell. Die 12B-Version schließt gezielt die Lücke zwischen Effizienz und High-End-Performance und ist das erste Modell mittlerer Größe mit nativen Audioeingängen. Alle Varianten stehen unter Apache 2.0.
Wie schnell läuft Gemma 4 auf lokaler Hardware?
Mit MTP-Speculative-Decoding in llama.cpp springt Gemma 4 26B auf einer RTX 4070 mit 12 GB VRAM von 38,5 auf 100,6 Token/s — Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Möglich machen das die nativen Multi-Token-Prediction-Köpfe: Das mitgelieferte Draft-Modell der 26B-Variante ist nur rund 460 MB groß.
Was bringen die QAT-Varianten von Gemma 4?
QAT (Quantization-Aware Training) heißt: Das Modell lernt schon im Training mit Quantisierungsrauschen umzugehen. Die Gemma-4-QAT-Varianten liefern 4-Bit-Verhalten nahe Q8-Qualität, und das 26B-Modell schrumpft von rund 18 GB auf etwa 14,2 GB — deutlich mehr Layer passen so direkt ins VRAM.
Wie verarbeitet Gemma 4 Bilder und Audio?
Google hat die klassischen, speicherhungrigen Encoder gestrichen: Der Vision-Encoder wurde durch ein leichtgewichtiges Embedding-Modul ersetzt, das rohe Audiosignal wird direkt in denselben Raum wie die Text-Token projiziert. Die Verarbeitung läuft im LLM-Backbone selbst — das senkt Latenz und Speicherbedarf auf Notebooks spürbar.
Quellen
- Google Gemma 4 12B Guide: Neue Multimodale Power für Notebooks — thevibe-coding.de (abgerufen 2026-07-17)
- Lokale LLM-Inferenz optimieren: Von 5 auf 100 Token/s mit llama.cpp — thevibe-coding.de (abgerufen 2026-07-17)
- Introducing Gemma 4 12B — Google (abgerufen 2026-07-17)
Verwandte Artikel
Gemini (2.5 Pro, 3 Pro)
Googles Gemini-Modelle punkten mit riesigen Kontexten, starkem Reasoning und nahtloser Workspace-Integration.
Google DiffusionGemma: 1000 Token/s durch Text-Diffusion 2026
Google DiffusionGemma revolutioniert 2026 die Textgenerierung. Erfahre alles über 1000 Token/s, MoE-Architektur und Apache 2.0 im exklusiven deutschen Guide.
Meta Llama 3.x / 4
Metas Llama ist die größte offene Modellfamilie — viele Größen, sehr günstige Preise und maximale Flexibilität.