Gerücht: Eigene Engine soll Qwen3.8-27B stark beschleunigen
Kurz gesagt: Im Forum Reddit LocalLLaMA berichtet ein Nutzer, er habe eine eigene Inferenz-Engine für Alibabas dichtes Modell Qwen3.8-27B auf einer einzelnen RTX-3090-Grafikkarte gebaut. Bei 250 Watt Leistungsbegrenzung und einem Kontextfenster von bis zu 195.000 Token will er 82 Tokens pro Sekunde bei einer einzelnen Anfrage und 417 Tokens pro Sekunde bei 64 gleichzeitigen Anfragen erreicht haben, je nach Auslastung 17 bis 149 Prozent schneller als die bekannte Engine ninfer. Belegt ist das bislang nur durch den einzelnen Forenpost - eine offizielle RTX-3090-Portierung von ninfer kommt nach eigenen Angaben auf rund 115 Tokens pro Sekunde im Bündel, unabhängige Nachmessungen der neuen Zahlen stehen noch aus.
Symbolbild: KI-generiert
Im Forum Reddit LocalLLaMA berichtet ein Nutzer, er habe nach eigenen Angaben "nach einer langen Nacht voller Optimierungen" die derzeit schnellste Inferenz-Engine für Alibabas Modell Qwen3.8-27B auf einer einzelnen RTX 3090 gebaut. Mit einer Leistungsbegrenzung von 250 Watt und einem Kontextfenster von bis zu 195.000 Token (ausgeliefert werden sicherheitshalber 150.000) soll die Engine bei einer einzelnen Anfrage 82 Tokens pro Sekunde liefern, bei 64 gleichzeitigen Anfragen sollen im Dauerbetrieb 417 Tokens pro Sekunde und kurzzeitig sogar bis zu 672 Tokens pro Sekunde möglich sein. Technisch setzt der Nutzer laut eigener Beschreibung auf eine W4A16-Quantisierung, die das rund 27 Milliarden Parameter große Modell auf etwa 16,8 Gigabyte komprimiert - passend für die 24 Gigabyte VRAM der Karte. Gegenüber der etablierten Engine ninfer will er je nach Anzahl gleichzeitiger Anfragen zwischen 17 und 149 Prozent schneller sein. Wichtig für die Einordnung: Es handelt sich um die unbestätigte Eigenmessung eines einzelnen Forennutzers, unabhängige Nachtests durch Dritte liegen bislang nicht vor.
Was sich zum Vergleich unabhängig einordnen lässt
Das als Vergleichsmaßstab genannte Projekt ninfer ist eine reale, quelloffene Inferenz-Engine für ausgewählte Qwen-Modelle, die offiziell aber nur auf Nvidias RTX 5090 läuft. Eine von der Community erstellte Portierung auf die ältere RTX 3090 erreicht laut den zugehörigen Versionshinweisen bei acht gleichzeitigen Anfragen und 8.000 Token Kontext rund 115 Tokens pro Sekunde im Bündel, bei einem VRAM-Bedarf von etwa 21,8 Gigabyte. Die vom Reddit-Nutzer behaupteten 417 Tokens pro Sekunde bei 64 gleichzeitigen Anfragen lägen damit deutlich über diesem offiziell dokumentierten Wert - allerdings bei einer höheren Anzahl gleichzeitiger Anfragen, was einen direkten Vergleich erschwert. Qwen3.8-27B selbst ist als dichtes 27-Milliarden-Parameter-Modell reale Alibaba-Technik, die je nach Quantisierung bereits auf Consumer-Grafikkarten läuft.
Einordnung
Für Leser mit eigener Hardware ist der Post vor allem ein Hinweis darauf, wie aktiv die Community rund um lokal betriebene KI-Modelle an Optimierungen arbeitet - selbstgebaute Inferenz-Engines auf Forenbasis liefern regelmäßig deutliche Geschwindigkeitssprünge gegenüber Standardlösungen. Ob die konkreten Zahlen von 417 beziehungsweise 672 Tokens pro Sekunde bei einer Nachmessung durch Dritte Bestand haben, ist derzeit offen. Ob der Quellcode der beschriebenen Engine öffentlich verfügbar ist, geht aus der bisherigen Meldung nicht hervor.