Fit check

Kann mein Mac ein lokales LLM ausführen? Memory-Check pro Modell

Direkte Antwort auf die häufigste Frage vor einem Mac-Kauf für lokale KI: Passt dieses Modell wirklich in diese Maschine? Die Tabelle nutzt dieselbe Kapazitätsarithmetik wie unser Fit-Explorer — öffentliche Gewichtgrößen gegen nutzbaren Unified Memory.

Zuletzt geprüft: 29. August 2026 · Unabhängige Entscheidungshilfe, kein Rat von Apple

Kurzantwort

Ein Mac kann ein lokales Modell nur ausführen, wenn die gespeicherten Gewichte in den nutzbaren Unified Memory passen, nachdem macOS, Runtime und Kontext reserviert sind. Planungsregel: rund 75% des Unified Memory sind nutzbar, halte 4GB für Runtime und Kontext frei, und eine 4-Bit-Quantisierung braucht etwa 0.6GB pro Milliarde Parameter. Jenseits dieser Arithmetik wählst du Geschwindigkeit und Workflow, nicht Kapazität.

Die niedrigste Mac-Stufe für jedes aktuelle Modell

Jede Zeile nutzt dieselbe Kapazitätsarithmetik wie die Fit-Engine: nutzbarer Memory sind 75% des Unified Memory minus einer 4GB-Reserve für Runtime und Kontext; bleiben weniger als 4GB übrig, gilt die Stufe als knapp. Die erste Stufe mit echtem Spielraum nutzt dieselbe Schwelle wie die Kaufentscheidungskarte des Explorers. Tippe einen Modellnamen an, um ihn im interaktiven Explorer zu öffnen.

Niedrigste Mac-Stufe pro aktuellem Modell, mit derselben Kapazitätsarithmetik wie der Fit-Explorer
ModellGewichte (Quantisierung)Niedrigste Stufe, die passtErste Stufe mit echtem Spielraum16GB Mac mini M6
Qwen3.8 27B (27B)16.06GB · verifizierte Dateigröße (Q4_0)Mac mini M6 · 32GB · Knapp · 3.94GB GB freiMac mini M5 Pro · 48GB · 15.94GB GB freiPasst nicht
Qwen3.8-Flash-Next 180B (6B active) (180B total · 6B active)360GB · verifizierte Dateigröße (BF16)Mac Studio M5 Ultra · 512GB · Mit Spielraum · 20GB GB freiMac Studio M5 Ultra · 512GB · 20GB GB freiPasst nicht
Qwen3.8 2.4T-A95B (2400B total · 95B active)1440GB · Planungsschätzung (Q4_K_M)Kein Mac im Katalog passtPasst nicht
DeepSeek-V4-Flash 284B-A13B (284B total · 13B active)170.4GB · Planungsschätzung (MLX-4bit)Mac Studio M5 Ultra · 256GB · Mit Spielraum · 17.6GB GB freiMac Studio M5 Ultra · 256GB · 17.6GB GB freiPasst nicht
DeepSeek-V4-Pro 1.6T-A49B (1600B total · 49B active)960GB · Planungsschätzung (MLX-4bit)Kein Mac im Katalog passtPasst nicht
GLM-5.3-Flash 320B-A18B (320B total · 18B active)203.99GB · verifizierte Dateigröße (MLX-4bit)Mac Studio M5 Ultra · 512GB · Mit Spielraum · 176.01GB GB freiMac Studio M5 Ultra · 512GB · 176.01GB GB freiPasst nicht
GLM-5.3 744B-A40B (744B total · 40B active)446.4GB · Planungsschätzung (MLX-4bit)Kein Mac im Katalog passtPasst nicht
Gemma 4 E2B (5.1B)3.35GB · verifizierte Dateigröße (Q4_0)Mac mini M6 · 16GB · Mit Spielraum · 4.65GB GB freiMac mini M6 · 16GB · 4.65GB GB freiMit Spielraum
Gemma 4 12B Unified (11.95B)6.98GB · verifizierte Dateigröße (Q4_0)Mac mini M6 · 16GB · Knapp · 1.02GB GB freiMac mini M6 · 24GB · 7.02GB GB freiKnapp
Gemma 4 26B-A4B (25.2B total · 3.8B active)14.44GB · verifizierte Dateigröße (Q4_0)Mac mini M6 · 32GB · Mit Spielraum · 5.56GB GB freiMac mini M6 · 32GB · 5.56GB GB freiPasst nicht

So funktioniert die Arithmetik

  1. Gespeicherte Gewichte sind das Kapazitätstor. Die Modelldatei muss zuerst passen. Bei MoE zählt das komplette Paket — aktive Parameter senken den Bedarf nicht.
  2. Nutzbarer Memory ist kleiner als die Angabe. Plane 75% des Unified Memory für das Modell und halte 4GB für macOS, Runtime und brauchbaren Kontext frei; ein 16GB-Mac plant mit etwa 8GB für Gewichte.
  3. Knapp versus Spielraum. Bleiben nach den Gewichten weniger als 4GB übrig, können lange Prompts, Agenten und parallele Jobs über die Grenze drücken — die Stufe heißt knapp, nicht Spielraum.
Grenze: Passen ist nicht laufen. Runtime-Support (MLX, Ollama, llama.cpp), Tool-Aufrufe, Vision und Dauerbetrieb werden auf der Evidence-Seite und im Explorer separat verfolgt.

Wenn die Antwort nein lautet

Wenn das Modell nicht passt, ändert ein schnellerer Chip die Antwort nicht — das Tor ist der Speicher. Realistische Optionen nach Kosten: eine kleinere Quantisierung desselben Modells, ein kleineres oder destilliertes Modell, das reicht, oder diese Last bei einer Cloud-API lassen und den Mac nur für Modelle nutzen, die passen. Kaufe keinen maximal bestückten Mac Studio für ein einziges Modell, dessen Mac-Runtime noch unverifiziert ist — prüfe zuerst die Runtime-Evidenz.

Interaktives Tool

Prüfe deine genaue Konfiguration.

Wähle Modell, Quantisierung und Runtime, um Gewichtsbudget, freien Speicher und den nächsten Schritt zum kostenlosen Berater zu sehen.

Fit-Explorer öffnen

Vollständige Evidenzmatrix ansehen

Häufige Fragen

Zuerst die Kapazitätsgrenze verstehen.

Kann ein 16GB-Mac ein 70B-Modell ausführen?

Nein. Ein 70B-Modell mit 4-Bit-Quantisierung speichert rund 42GB Gewichte, während ein 16GB-Mac nach den Reserven mit etwa 8GB plant. Das ist kein Tempo-, sondern ein Platzproblem. Selbst ein 32B in Q4 (etwa 20GB) ist auf einem 32GB-Mac nach den Reserven nur knapp.

Verringern aktive MoE-Parameter den Speicherbedarf?

Nein. Mixture-of-Experts-Modelle speichern weiterhin alle Experten. Aktive Parameter erklären die Rechenlast pro Token, nicht die Kapazität. Ein 284B-A13B braucht deutlich mehr Speicher, als die 13B aktiven Parameter vermuten lassen.

Bedeutet 'passt mit Spielraum' ein Versprechen für gutes Laufen?

Nein. Fit beantwortet nur, ob die Gewichte ins Budget passen. Prefill-Tempo, langer Kontext, Tool-Aufrufe, Parallelität und Dauerbetrieb hängen vom Modell, der Runtime (MLX, Ollama, llama.cpp) und dem Client ab und sind separat zu prüfen.

Welchen Mac 2026 für lokale LLMs kaufen?

Starte beim Modell, nicht beim Chipnamen. Nutze die Tabelle für die niedrigste Stufe mit echtem Spielraum und gib Kontextlänge, Parallelität und Budget in den kostenlosen Berater. Der komplette Guide vergleicht Mac mini M6, M5 Pro und Mac Studio nach Arbeitslast.

Sind die Gewichtgrößen verifiziert?

Zeilen mit verifizierter Dateigröße nutzen exakte öffentliche Byte-Zahlen aus offiziellen oder Community-Repos, geprüft am 2026-08-28. Zeilen mit Planungsschätzung nutzen die Regel 0.6GB pro Milliarde Parameter und bleiben Schätzungen, bis eine exakte Datei eingelesen ist.

Bring deinen echten Workflow ein

Mach aus Kapazität eine Kaufentscheidung.

Der kostenlose Berater ergänzt deinen aktuellen Mac, Kontext, Parallelität, Budget, Kompatibilität und Offline-Anforderungen. Kapazität ist nur ein Teil der Entscheidung.

Kostenlosen Berater öffnen

Keep or Upgrade ist ein unabhängiges Entscheidungstool; Apple sponsert oder empfiehlt diese Seite nicht.