# WASTE im Test: Kimi K3 mit 2,8T Parametern auf dem MacBook

> WASTE bringt das Kimi K3 Modell mit 2,8T Parametern auf das MacBook Pro. Erfahre alles über SSD-Offloading und reale Performance-Werte für das Jahr 2026.

- URL: https://thevibe-coding.de/tools/sqlite-ai-waste-kimi-k3-macbook-moe
- Typ: tools | Veroeffentlicht: 2026-08-03 | Aktualisiert: 2026-08-03
- Autor: Vita Legne | Site: VIBE CODING — thevibe-coding.de

---

Bisher war die Ausführung gigantischer Sprachmodelle (LLMs) spezialisierten Server-Clustern mit Terabytes an [Arbeitsspeicher](/glossar/context-window) vorbehalten. SQLite AI bricht diese Exklusivität mit der WASTE-Engine auf. Das System besteht aus lediglich 6.000 Zeilen C-Code und stemmt das [Kimi K3](/modelle/kimi-k3) Modell mit seinen fast 3 Billionen Parametern auf einem MacBook Pro mit 64 GB RAM. Bemerkenswert: Die Engine verzichtet im Betrieb vollständig auf BLAS, CUDA oder eine aufgeblähte Python-Umgebung.

## Effizientes MoE-Management durch SSD-Offloading

WASTE nutzt die Architektur von Mixture-of-Experts (MoE) Modellen, um den RAM-Bedarf radikal zu senken. Kimi K3 belegt nach der Konvertierung aus dem safetensors-Format rund 982 GiB auf dem Datenträger. Da diese Menge die Kapazität aktueller Laptops sprengt, hält WASTE lediglich einen Kern von 27,28 GB im Arbeitsspeicher. Die benötigten Experten-Layer lädt die Engine erst in dem Moment von der SSD nach, in dem sie für die Berechnung eines [Token](/glossar/token)s tatsächlich anstehen.

Bei Kimi K3 werden pro Token etwa 4 % der Gesamtgewichte aktiv – das entspricht 16 Experten in jedem der 92 Layer. Um Verzögerungen zu minimieren, korreliert ein Experte mit genau einem Lesevorgang. Die Matrizen für Gate, Up und Down liegen räumlich beieinander, während eine restvektorbasierte [Quantisierung](/guides/lokale-llm-inferenz-optimieren-llama-cpp-2026) (3 Bit pro Gewicht) dafür sorgt, dass die Matrix nie vollständig entpackt werden muss.

## Performance-Metriken und Hardware-Anforderungen

Mit der internen NVMe-SSD eines MacBook Pro erreicht WASTE eine Geschwindigkeit von 0,49 bis 0,54 Token pro Sekunde. Die Leistung hängt dabei fast linear an der Bandbreite des Speichers. Während die interne SSD Raten von 12,78 GB/s liefert, bricht der Durchsatz bei externen Laufwerken ein. Ein über USB angebundenes Gehäuse drosselt auf etwa 0,94 GB/s, wodurch die Wartezeit pro Token auf zähe 13 Sekunden steigt.

| Komponente | Spezifikation / Wert |
| -------- | -------- |
| Modell-Parameter | ca. 2,8 Billionen (K3) |
| Speicherbedarf (Disk) | 982 GiB |
| Residenter RAM-Bedarf | 27,28 GB |
| SSD-Leserate (intern) | 12,78 GB/s |
| Token-Durchsatz | 0,49 - 0,54 tok/s |

Das Speichermanagement von macOS erweist sich als kritischer Faktor für die Stabilität. Ein Experten-Cache jenseits der 46 GB markiert den Kipppunkt: Bei 52 GB sinkt das Tempo um den Faktor drei, bei 58 GB bricht es um den Faktor acht ein. Ursache ist das aggressive Paging des Systems in den Swap, was zu redundanten Zugriffen führt. WASTE ist deshalb so vorkonfiguriert, dass das Arbeitsset strikt innerhalb des physischen RAM-Budgets bleibt.

## Konvertierung und alternative Modelle

Wer Kimi K3 lokal betreiben will, braucht Geduld. Die Modell-Konvertierung beansprucht auf einem aktuellen M5 Pro im Multi-Process-Verfahren rund fünf Stunden. Wer auf Standard-PyTorch setzt, wartet fast einen ganzen Tag. Für Anwender mit weniger Hardware-Ressourcen oder höherem Tempobedarf unterstützt die Engine das Modell Kimi-Linear 48B. Dieses operiert aus einem 19 GB großen Container und liefert deutlich flüssigere 10,7 Token pro Sekunde.

Der Quellcode und die Dokumentation stehen unter [github.com/sqliteai/waste](https://github.com/sqliteai/waste) zur Verfügung. Ein Blick in die Datei [LEARNED.md](https://github.com/sqliteai/waste/blob/main/docs%2FLEARNED.md) lohnt sich: Hier protokollieren die Entwickler ungeschönt, welche technischen Ansätze während der Entwicklung gescheitert sind. Das Projekt unterliegt der Apache 2.0 Lizenz.

## FAQ

### Wie ermöglicht WASTE die Ausführung von Kimi K3 auf einem MacBook?

Die WASTE-Engine nutzt SSD-Offloading für Mixture-of-Experts (MoE) Modelle, um den Arbeitsspeicherbedarf massiv zu reduzieren. Das System lädt lediglich die aktuell benötigten Experten-Layer von der SSD nach, wodurch selbst Modelle mit 2,8 Billionen Parametern auf Hardware mit 64 GB RAM lauffähig werden.

### Welche Hardware-Voraussetzungen sind für eine flüssige Nutzung entscheidend?

Die Geschwindigkeit der internen NVMe-SSD ist der kritischste Faktor, da die Engine Transferraten von über 12 GB/s benötigt. Externe Festplatten bremsen den Token-Durchsatz aufgrund geringerer Bandbreite drastisch aus, während der RAM-Bedarf für den stabilen Betrieb unter 46 GB bleiben sollte.

### Wie lange dauert die Konvertierung des Kimi K3 Modells für WASTE?

Ein aktuelles MacBook mit M5 Pro Chip benötigt im optimierten Multi-Process-Verfahren etwa fünf Stunden für die Umwandlung aus dem safetensors-Format. Standard-PyTorch-Prozesse können für denselben Vorgang hingegen fast einen ganzen Tag in Anspruch nehmen.

### Gibt es schnellere Alternativen zum Kimi K3 Modell innerhalb der Engine?

Kimi-Linear 48B stellt eine performante Alternative dar, die deutlich geringere Ressourcen beansprucht. Dieses Modell operiert aus einem 19 GB Container und erreicht mit 10,7 Token pro Sekunde eine wesentlich höhere Geschwindigkeit als das große K3-Modell.

## Quellen

- [github.com](https://github.com/sqliteai/waste/blob/main/docs%2FLEARNED.md) — github.com
- [github.com](https://github.com/sqliteai/waste) — github.com
- [github.com](https://github.com/sqliteai/waste#converting-kimi-k3) — github.com
- [huggingface.co](https://huggingface.co/Kuberwastaken/Kimi-K3-GGUF) — huggingface.co
- [huggingface.co](https://huggingface.co/moonshotai/Kimi-K3/tree/main) — huggingface.co
- [7minai.com](https://7minai.com/how-to-run-kimi-k3-locally/) — 7minai.com
- [huggingface.co](https://huggingface.co/unsloth/Kimi-K3/blob/main/model-00013-of-000096.safetensors) — huggingface.co
- [huggingface.co](https://huggingface.co/moonshotai/Kimi-K3/commit/c5d1dd4c428bd1ce8b88c5044f3b6ccde9e3b721) — huggingface.co
- [kimi-k2.org](https://kimi-k2.org/de/blog/39-kimi-k3-weights-live) — kimi-k2.org
- [huggingface.co](https://huggingface.co/GrEarl/Kimi-K3-GGUF) — huggingface.co
- [explainx.ai](https://www.explainx.ai/blog/kimi-k3-run-locally-open-weights-desktop-july-2026) — explainx.ai
- [aitoolsrecap.com](https://aitoolsrecap.com/Blog/kimi-k3-weights-live-download-huggingface-july-27-2026) — aitoolsrecap.com
- [recipes.vllm.ai](https://recipes.vllm.ai/moonshotai/Kimi-K3.json) — recipes.vllm.ai
- [wan27.org](https://wan27.org/blog/kimi-k3-huggingface) — wan27.org
- [youtube.com](https://www.youtube.com/watch?v=aMTKDynnDP4) — youtube.com
- [kimi.com](https://www.kimi.com/de/help/kimi-code/faq) — kimi.com
- [unsloth.ai](https://unsloth.ai/docs/models/kimi-k3) — unsloth.ai
- [huggingface.co](https://huggingface.co/moonshotai/Kimi-K3) — huggingface.co
