Geruecht: Neues Tool soll Riesen-KI-Modelle auf Gaming-PC bringen
Kurz gesagt: Auf der Plattform Reddit LocalLLaMA berichtete ein Nutzer von ersten Tests mit FreeToken, einer neuen Software fuer den lokalen Betrieb grosser KI-Sprachmodelle. Laut zugehoerigem Forschungspapier und Github-Projekt, das unter anderem von Forschern der UC Berkeley sowie den bekannten KI-Wissenschaftlern Song Han und Ion Stoica mitverfasst wurde, soll das Tool auch Modelle mit ueber 700 Milliarden Parametern auf einzelnen Consumer-Grafikkarten ausfuehrbar machen - deutlich schneller als etablierte Alternativen wie Ollama.
Symbolbild: KI-generiert
Im Forum Reddit LocalLLaMA, einem Sammelpunkt fuer Enthusiasten lokal betriebener KI-Sprachmodelle, sorgte ein Nutzerbeitrag fuer Aufsehen: Ein Anwender berichtet, er habe das am Vortag veroeffentlichte Open-Source-Projekt FreeToken getestet und auf einer RTX 5080 mit 16 Gigabyte Grafikspeicher rund 100 Token pro Sekunde mit dem Modell Qwen3.6-35B erreicht - Werte, die laut seinem Beitrag deutlich ueber dem liegen, was mit bisherigen Werkzeugen auf vergleichbarer Hardware moeglich war. Die im Post genannten Zahlen stammen aus einem einzelnen Nutzertest und sind bislang nicht unabhaengig nachvollzogen - sie sind daher als vorlaeufige Eigenangabe zu lesen, nicht als geprueftes Ergebnis.
Was hinter FreeToken steckt
Belastbarer als der einzelne Reddit-Post sind die zugrunde liegenden Quellen, die sich unabhaengig einsehen lassen: FreeToken basiert auf einem am 21. August 2026 veroeffentlichten wissenschaftlichen Paper mit dem Titel "FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution", das unter anderem von Song Han (bekannt fuer Effizienzforschung an KI-Modellen) sowie Ion Stoica und Matei Zaharia von der UC Berkeley mitgezeichnet ist - beides Forscher mit Bezug zu bekannten Open-Source-Infrastrukturprojekten. Das zugehoerige Github-Projekt unter der Apache-2.0-Lizenz beschreibt FreeToken als "edge-native" Ausfuehrungsengine speziell fuer sogenannte Mixture-of-Experts-Modelle (MoE) - eine Bauweise, bei der ein Sprachmodell aus vielen spezialisierten Teilnetzen besteht, von denen bei jeder Anfrage nur ein Bruchteil aktiv gerechnet wird. Genau das nutzt FreeToken laut eigener Beschreibung aus, um Modellteile bandbreitenabhaengig zwischen Grafikkarte und Arbeitsspeicher zu verschieben, statt das gesamte Modell dauerhaft im knappen Grafikspeicher vorzuhalten.
Zahlen, die ueber den Reddit-Post hinausgehen
Unabhaengig von der urspruenglichen Reddit-Meldung kursieren inzwischen weitere Benchmark-Angaben zu FreeToken: Laut einem vielbeachteten Beitrag des KI-Entwicklers Yuchen Jin auf der Plattform X soll eine einzelne Workstation-Grafikkarte vom Typ RTX Pro 6000 das mit 753 Milliarden Parametern sehr grosse Modell GLM-5.2 mit rund 14,9 Token pro Sekunde ausfuehren koennen - ein Modell, das regulaer mehrere teure Rechenzentrums-GPUs benoetigt. Ein Laptop mit einer vergleichsweise schwachen RTX 4060 (8 GB) soll demnach das kleinere Modell Qwen3.6-35B mit rund 39 Token pro Sekunde schaffen. Jin beziffert den Geschwindigkeitsvorteil gegenueber der verbreiteten Software Ollama auf das Zwei- bis Vierfache. Auch diese Zahlen sind bislang Community-Angaben Dritter, keine vom Hersteller unabhaengig verifizierten Standard-Benchmarks - sie stuetzen die Reddit-Beobachtung aber in der Groessenordnung.
Einordnung fuer deutsche Leser
Sollten sich die kursierenden Zahlen bestaetigen, waere das fuer die wachsende Szene lokal betriebener KI-Modelle in Deutschland relevant: Bislang scheiterte der Betrieb sehr grosser Open-Source-Modelle wie GLM-5.2 auf Consumer-Hardware meist an der Grafikspeicher-Groesse, nicht an der reinen Rechenleistung. Ein Werkzeug, das - wie von FreeToken behauptet - Modellteile intelligent zwischen GPU und Hauptspeicher verschiebt, koennte diese Huerde senken. Wer selbst lokale KI-Modelle betreibt, sollte die Angaben aus Reddit-Post und Social-Media-Beitraegen aber vorerst als das behandeln, was sie sind: vielversprechende, aber noch unabhaengig unbestaetigte erste Praxiswerte rund um ein frisch veroeffentlichtes Forschungsprojekt.
Quelle: Reddit LocalLLaMA, FreeToken-Paper (arXiv), Github-Projekt, abgerufen am 22. August 2026.