VIBE CODING
MODELL3 min read

Google Gemma 4 (12B/26B): Multimodales Open-Source-Modell fürs Notebook

Google Gemma 4 bringt multimodale KI mit Audio-Input unter Apache 2.0 auf lokale Hardware — mit QAT-Varianten und MTP-Speculative-Decoding bis 100+ Token/s.

→ Quelle / Repository
Gemma 4GoogleLocal LLMMultimodalOpen SourceQATllama.cpp

Google Gemma 4 ist Googles offene Modellfamilie für lokale Hardware, vorgestellt im Juni 2026 und unter Apache-2.0-Lizenz frei nutzbar. Das Modell verarbeitet Text, Bilder und — erstmals in mittlerer Größe — Audio nativ, ganz ohne Cloud. Anders als das proprietäre Gemini läuft Gemma 4 komplett auf deinem Notebook.

Die Gemma-4-Varianten im Steckbrief

MerkmalGemma 4 12BGemma 4 26B
ZielhardwareNotebooks, ~12 GB VRAMWorkstations, 12-24 GB VRAM (mit QAT/Offload)
MultimodalText, Bild, nativer Audio-InputText, Bild, Audio
LizenzApache 2.0Apache 2.0
MTP-Speed (RTX 4070)120,8 Token/s (2,0x)38,5 → 100,6 Token/s (2,6x)
QAT-Varianteverfügbar~18 GB → ~14,2 GB, Q8-nahe Qualität
Draft-Modell (MTP)mitgeliefert~460 MB

Multimodal ohne Encoder-Ballast

Gemma 4 setzt auf eine vereinheitlichte Architektur, die multimodale Daten direkt im LLM-Backbone verarbeitet. Den klassischen Vision-Encoder hat Google durch ein leichtgewichtiges Embedding-Modul ersetzt; beim Audio fliegt der Encoder komplett raus — das rohe Signal wird direkt in denselben Raum wie die Text-Token projiziert. Diese Verschlankung senkt Latenz und RAM-Verbrauch, was auf Notebooks den Unterschied macht. Die 12B-Variante ist zudem das erste Modell mittlerer Größe mit nativen Audioeingängen: Lokale Sprachassistenten werden möglich, bei denen Audiodaten nie das Gerät verlassen. In Benchmarks schlägt die 12B-Version laut Google teils sogar die alte Gemma 3 27B. Unsere Release-Einordnung hat die Details.

Tempo auf lokaler Hardware: MTP macht den Unterschied

Gemma 4 bringt native Multi-Token-Prediction-Köpfe mit — das Draft-Modell für Speculative Decoding liegt dem Download bei und ist bei der 26B-Variante nur rund 460 MB groß. Die dokumentierten Messwerte aus dem Referenz-Setup von Homelab-Entwickler Kartikey Chauhan (RTX 4070, 12 GB VRAM, Juni 2026): Gemma 4 26B springt mit --spec-type draft-mtp von 38,5 auf 100,6 Token/s, Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Dazu kommen QAT-Varianten (Quantization-Aware Training): 4-Bit-Verhalten nahe Q8-Qualität, das 26B-Modell schrumpft von ~18 GB auf ~14,2 GB. Die komplette Optimierungs-Reihenfolge — inklusive Sampler-Empfehlung temp 1.0, top-k 64, top-p 0.95 — steht im llama.cpp-Guide.

Wann ist Gemma 4 die richtige Wahl?

Gemma 4 lohnt sich, wenn du KI lokal und ohne Cloud-Zwang betreiben willst:

  • Notebook-Betrieb — 12B als Sweetspot für 12-GB-VRAM-Hardware, mit MTP über 120 Token/s
  • Datenschutz-kritische Anwendungen — Sprachassistenten und Bildanalyse, ohne dass Daten das Gerät verlassen
  • Freie Lizenz — Apache 2.0 erlaubt Anpassung, Fine-Tuning und kommerzielle Integration ohne restriktive Vorgaben
  • Coding-Sessions lokal — als Dense-Modell profitiert Gemma 4 stark von QAT-Quants und Speculative Decoding

Für maximale Rohleistung in der Cloud bleibt Gemini 3 Pro die stärkere Wahl — Gemma 4 ist Googles Antwort für alle, die Kontrolle über die eigene Hardware behalten wollen.

Häufige Fragen

Welche Größen gibt es bei Google Gemma 4?

Gemma 4 erscheint in mehreren Größen: einem sparsamen 4B-Modell, der 12B-Variante als Sweetspot für Notebooks und dem 26B-Topmodell. Die 12B-Version schließt gezielt die Lücke zwischen Effizienz und High-End-Performance und ist das erste Modell mittlerer Größe mit nativen Audioeingängen. Alle Varianten stehen unter Apache 2.0.

Wie schnell läuft Gemma 4 auf lokaler Hardware?

Mit MTP-Speculative-Decoding in llama.cpp springt Gemma 4 26B auf einer RTX 4070 mit 12 GB VRAM von 38,5 auf 100,6 Token/s — Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Möglich machen das die nativen Multi-Token-Prediction-Köpfe: Das mitgelieferte Draft-Modell der 26B-Variante ist nur rund 460 MB groß.

Was bringen die QAT-Varianten von Gemma 4?

QAT (Quantization-Aware Training) heißt: Das Modell lernt schon im Training mit Quantisierungsrauschen umzugehen. Die Gemma-4-QAT-Varianten liefern 4-Bit-Verhalten nahe Q8-Qualität, und das 26B-Modell schrumpft von rund 18 GB auf etwa 14,2 GB — deutlich mehr Layer passen so direkt ins VRAM.

Wie verarbeitet Gemma 4 Bilder und Audio?

Google hat die klassischen, speicherhungrigen Encoder gestrichen: Der Vision-Encoder wurde durch ein leichtgewichtiges Embedding-Modul ersetzt, das rohe Audiosignal wird direkt in denselben Raum wie die Text-Token projiziert. Die Verarbeitung läuft im LLM-Backbone selbst — das senkt Latenz und Speicherbedarf auf Notebooks spürbar.

Quellen

  1. Google Gemma 4 12B Guide: Neue Multimodale Power für Notebooks thevibe-coding.de (abgerufen 2026-07-17)
  2. Lokale LLM-Inferenz optimieren: Von 5 auf 100 Token/s mit llama.cpp thevibe-coding.de (abgerufen 2026-07-17)
  3. Introducing Gemma 4 12B Google (abgerufen 2026-07-17)
+

Verwandte Artikel