Werkzeuge und Ablauf · 21. September 2026

Ein Modell mit 176 GB Gewichten auf zwei kleinen Rechnern

Der Satz, der viele Gespräche über KI beendet, lautet: Diese Daten dürfen nicht hochgeladen werden. Ein Rezept aus einem offenen Repository zeigt, wie weit die Antwort darauf inzwischen trägt.

Lokale Inferenz ist zu einer Rechnung geworden: Speicher, Strom, Auslastung und Wartung entscheiden, ob sie sich trägt.

Der Anlass

Das Repository MiaAI-Lab/GLM-5.3-Flash-EXL3-2x-DGX-Sparks steht unter AGPL-3.0, wurde am 27. August 2026 angelegt und am 21. September 2026 über die GitHub Schnittstelle geprüft. Es serviert GLM 5.3 Flash als quantisierte Fassung über vLLM auf zwei NVIDIA GB10 Rechnern, wie sie in den DGX Spark Geräten stecken. Die Gewichte liegen in 120 Teilen bei rund 176 GB. Die Anbindung erfolgt über eine Schnittstelle, die zu verbreiteten Clientbibliotheken passt.

Was gemessen ist und was nicht

Das Projekt nennt eigene Messwerte: Durchsatz beim Vorverarbeiten je nach Promptlänge, Geschwindigkeit beim Ausgeben bei verschiedenen Parallelzugriffen, ein Kontextfenster von bis zu 850k Token als Standardeinstellung, dazu Optimierungen, die standardmäßig aus sind. Diese Zahlen kommen vom Projekt. Wir haben sie nicht nachgemessen und keine eigene Installation aufgesetzt.

Was das im Ablauf bedeutet

Wer Anfragen an einen Cloudanbieter schickt, bezahlt pro Token und gibt die Daten aus der Hand. Wer lokal rechnet, kauft Hardware, Strom und Wartung. Die Rechnung kippt nicht automatisch. Sie hängt an der Auslastung: Ein Gerätepaket für mehrere tausend Euro trägt sich erst, wenn täglich genug Arbeit durchläuft. Dazu kommt die Lizenzfrage. Die Rezeptur steht unter AGPL-3.0. Die Nutzungsbedingungen des Modells sind davon getrennt zu lesen, ebenso die Bedingungen der quantisierten Gewichte.

Unsere Einordnung

Der nützliche nächste Schritt bleibt unspektakulär. Nehmen Sie eine wiederkehrende Aufgabe, die heute an der Datenfrage hängt. Lassen Sie zwanzig echte Fälle auf der Hardware laufen, die Sie tatsächlich beschaffen würden. Notieren Sie Fehlerquote und Antwortzeit. Wer das nicht gemessen hat, kauft entweder zu viel Gerät oder zu viel Vertrauen.

Quellen und Stand

Originalquellen zuletzt geprüft: 2026-09-21.

  1. Repository GLM-5.3-Flash-EXL3-2x-DGX-Sparks ↗

Mathias Heinke

← Alle Beiträge