# Google Gemma 4 (12B/26B): Multimodales Open-Source-Modell fürs Notebook

> Google Gemma 4 bringt multimodale KI mit Audio-Input unter Apache 2.0 auf lokale Hardware — mit QAT-Varianten und MTP-Speculative-Decoding bis 100+ Token/s.

- URL: https://thevibe-coding.de/modelle/google-gemma-4
- Typ: modelle | Veroeffentlicht: 2026-07-17 | Aktualisiert: 2026-07-17
- Autor: Vita Legne | Site: VIBE CODING — thevibe-coding.de

---

**Google Gemma 4** ist Googles offene Modellfamilie für lokale Hardware, vorgestellt im Juni 2026 und unter Apache-2.0-Lizenz frei nutzbar. Das Modell verarbeitet Text, Bilder und — erstmals in mittlerer Größe — Audio nativ, ganz ohne Cloud. Anders als das proprietäre [Gemini](/modelle/gemini) läuft Gemma 4 komplett auf deinem Notebook.

## Die Gemma-4-Varianten im Steckbrief

| Merkmal | Gemma 4 12B | Gemma 4 26B |
| --- | --- | --- |
| Zielhardware | Notebooks, ~12 GB VRAM | Workstations, 12-24 GB VRAM (mit QAT/Offload) |
| Multimodal | Text, Bild, nativer Audio-Input | Text, Bild, Audio |
| Lizenz | Apache 2.0 | Apache 2.0 |
| MTP-Speed (RTX 4070) | 120,8 Token/s (2,0x) | 38,5 → 100,6 Token/s (2,6x) |
| QAT-Variante | verfügbar | ~18 GB → ~14,2 GB, Q8-nahe Qualität |
| Draft-Modell (MTP) | mitgeliefert | ~460 MB |

## Multimodal ohne Encoder-Ballast

Gemma 4 setzt auf eine vereinheitlichte Architektur, die multimodale Daten direkt im [LLM](/glossar/llm)-Backbone verarbeitet. Den klassischen Vision-Encoder hat Google durch ein leichtgewichtiges [Embedding](/glossar/embedding)-Modul ersetzt; beim Audio fliegt der Encoder komplett raus — das rohe Signal wird direkt in denselben Raum wie die Text-[Token](/glossar/token) projiziert. Diese Verschlankung senkt Latenz und RAM-Verbrauch, was auf Notebooks den Unterschied macht. Die 12B-Variante ist zudem das erste Modell mittlerer Größe mit nativen Audioeingängen: Lokale Sprachassistenten werden möglich, bei denen Audiodaten nie das Gerät verlassen. In Benchmarks schlägt die 12B-Version laut Google teils sogar die alte Gemma 3 27B. Unsere [Release-Einordnung](/blog/google-gemma-4-12b-multimodal-ai-2026) hat die Details.

## Tempo auf lokaler Hardware: MTP macht den Unterschied

Gemma 4 bringt native Multi-Token-Prediction-Köpfe mit — das Draft-Modell für Speculative Decoding liegt dem Download bei und ist bei der 26B-Variante nur rund 460 MB groß. Die dokumentierten Messwerte aus dem Referenz-Setup von Homelab-Entwickler Kartikey Chauhan (RTX 4070, 12 GB VRAM, Juni 2026): Gemma 4 26B springt mit `--spec-type draft-mtp` von 38,5 auf 100,6 Token/s, Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Dazu kommen QAT-Varianten (Quantization-Aware Training): 4-Bit-Verhalten nahe Q8-Qualität, das 26B-Modell schrumpft von ~18 GB auf ~14,2 GB. Die komplette Optimierungs-Reihenfolge — inklusive Sampler-Empfehlung temp 1.0, top-k 64, top-p 0.95 — steht im [llama.cpp-Guide](/guides/lokale-llm-inferenz-optimieren-llama-cpp-2026).

## Wann ist Gemma 4 die richtige Wahl?

Gemma 4 lohnt sich, wenn du KI lokal und ohne Cloud-Zwang betreiben willst:

- **Notebook-Betrieb** — 12B als Sweetspot für 12-GB-VRAM-Hardware, mit MTP über 120 Token/s
- **Datenschutz-kritische Anwendungen** — Sprachassistenten und Bildanalyse, ohne dass Daten das Gerät verlassen
- **Freie Lizenz** — Apache 2.0 erlaubt Anpassung, Fine-Tuning und kommerzielle Integration ohne restriktive Vorgaben
- **Coding-Sessions lokal** — als Dense-Modell profitiert Gemma 4 stark von QAT-Quants und Speculative Decoding

Für maximale Rohleistung in der Cloud bleibt [Gemini 3 Pro](/modelle/gemini) die stärkere Wahl — Gemma 4 ist Googles Antwort für alle, die Kontrolle über die eigene Hardware behalten wollen.

## Offizielle Links

- Ankündigung: [blog.google — Introducing Gemma 4 12B](https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12B/)

## FAQ

### Welche Größen gibt es bei Google Gemma 4?

Gemma 4 erscheint in mehreren Größen: einem sparsamen 4B-Modell, der 12B-Variante als Sweetspot für Notebooks und dem 26B-Topmodell. Die 12B-Version schließt gezielt die Lücke zwischen Effizienz und High-End-Performance und ist das erste Modell mittlerer Größe mit nativen Audioeingängen. Alle Varianten stehen unter Apache 2.0.

### Wie schnell läuft Gemma 4 auf lokaler Hardware?

Mit MTP-Speculative-Decoding in llama.cpp springt Gemma 4 26B auf einer RTX 4070 mit 12 GB VRAM von 38,5 auf 100,6 Token/s — Faktor 2,6. Das 12B-Modell erreicht 120,8 Token/s (2,0x). Möglich machen das die nativen Multi-Token-Prediction-Köpfe: Das mitgelieferte Draft-Modell der 26B-Variante ist nur rund 460 MB groß.

### Was bringen die QAT-Varianten von Gemma 4?

QAT (Quantization-Aware Training) heißt: Das Modell lernt schon im Training mit Quantisierungsrauschen umzugehen. Die Gemma-4-QAT-Varianten liefern 4-Bit-Verhalten nahe Q8-Qualität, und das 26B-Modell schrumpft von rund 18 GB auf etwa 14,2 GB — deutlich mehr Layer passen so direkt ins VRAM.

### Wie verarbeitet Gemma 4 Bilder und Audio?

Google hat die klassischen, speicherhungrigen Encoder gestrichen: Der Vision-Encoder wurde durch ein leichtgewichtiges Embedding-Modul ersetzt, das rohe Audiosignal wird direkt in denselben Raum wie die Text-Token projiziert. Die Verarbeitung läuft im LLM-Backbone selbst — das senkt Latenz und Speicherbedarf auf Notebooks spürbar.

## Quellen

- [Google Gemma 4 12B Guide: Neue Multimodale Power für Notebooks](https://thevibe-coding.de/blog/google-gemma-4-12b-multimodal-ai-2026) — thevibe-coding.de
- [Lokale LLM-Inferenz optimieren: Von 5 auf 100 Token/s mit llama.cpp](https://thevibe-coding.de/guides/lokale-llm-inferenz-optimieren-llama-cpp-2026) — thevibe-coding.de
- [Introducing Gemma 4 12B](https://blog.google/innovation-and-ai/technology/developers-tools/introducing-gemma-4-12B/) — Google
