Nerdstuff: Den Memory Wall einreißen 🚀 (11. September 2026)
Zusammenfassung: Vergiss RAM-Größen. Die neue Ära der lokalen KI auf dem Mac wird durch "Expert Streaming" vom SSD definiert. Wir lernen gerade, dass Bandbreite wichtiger ist als Kerne und dass wir massive MoE-Modelle auf Hardware laufen lassen können, die eigentlich viel zu klein dafür ist.
Bandbreite schlägt Kerne ⚡️
Wenn du dich fragst, warum dein M-Chip bei großen Modellen langsam wird, ist die Antwort simpel: Es ist die Memory Bandwidth. Die GPU-Kerne langweilen sich zu Tode, weil die Daten nicht schnell genug aus dem RAM ankommen.
Ein absurdes Beispiel aus der aktuellen Praxis: Die Lily-Engine auf einem M5 Max kann Texte mit über 4.000 Tokens/Sekunde "lesen" (Prefill), aber nur mit etwa 170 Tokens/Sekunde "schreiben" (Decode). Das ist ein Faktor von 24! Wir haben hier eine massive Diskrepanz zwischen dem Verstehen des Kontextes und dem Generieren der Antwort.
Der SSD-Hack: Slotstream & Mference 💾
Die spannendste Entwicklung ist gerade das Ende des "Alles muss in den RAM"-Dogmas. Projekte wie Slotstream und Mference nutzen einen genialen Trick: Sie behandeln die NVMe-SSD quasi als erweiterten VRAM.
Bei Mixture-of-Experts (MoE) Modellen müssen nicht alle Parameter für jedes Token aktiv sein. Slotstream hält nur den gemeinsamen Kern im RAM und streamt die spezifischen "Experten" in Echtzeit direkt von der SSD in die Metal-Buffer. Das Ergebnis? Ein 125B-Parameter-Modell (wie Qwen3.8-Flash-Next) läuft auf einem 48GB Mac mit soliden 12 Tokens/Sekunde. Das ist ein absoluter Gamechanger für die lokale Souveränität.
Strategie: Local Reading, Cloud Writing ☁️
Aufgrund des erwähnten Prefill/Decode-Gaps etabliert sich gerade ein hybrider Workflow:
- Lokal: Alles, was "leselastig" ist. Klassifizierung, Routing, PII-Maskierung (Datenschutz!) und erste Filterung. Das geht blitzschnell.
- Cloud: Alles, was "schreibelastig" ist. Komplexe Reasoning-Ketten, lange Entwürfe und kreatives Schreiben.
Wer heute einen Mac für KI kauft, sollte weniger auf die Generation des Chips achten, sondern auf die Tier-Klasse (Pro
Mein Fazit: Die Zeit, in der man 128GB RAM brauchte, um "richtige" Modelle zu nutzen, ist vorbei. Wer die SSD intelligent anbindet, bringt die Intelligenz von 100B+ Modellen auf fast jedes moderne MacBook.
Quellen: