Gerücht: Hersteller vernachlässigen kleine KI-Modelle 8-12B
Kurz gesagt: In einem viel diskutierten Reddit-Thread im Forum r/LocalLLaMA beklagt ein Nutzer mit einem MacBook Pro M4 (16 GB RAM), dass aktuelle KI-Sprachmodelle im für Alltagsgeräte idealen Bereich von 8 bis 12 Milliarden Parametern kaum noch erscheinen sollen – die von der Software LM Studio vorgeschlagenen Alternativen seien teils schon über 150 Tage alt. Bestätigte Zahlen von Herstellern zu diesem Trend gibt es nicht, unabhängige Marktbeobachtungen zeichnen aber ein differenzierteres Bild: Es erscheinen weiterhin Modelle dieser Größe, der Fokus vieler Labs liegt aber zunehmend auf sehr großen Flaggschiffen oder auf extrem komprimierten Mini-Modellen für Smartphones.
Symbolbild: KI-generiert
Im Forum r/LocalLLaMA, einem Treffpunkt für Nutzer lokal betriebener KI-Sprachmodelle, sorgt aktuell ein Beitrag mit dem Titel „Why have 8B-12B models been dropped?“ für Diskussionen. Der Autor beschreibt sein Problem so: Auf seinem MacBook Pro M4 mit 16 Gigabyte gemeinsamem Arbeitsspeicher laufe als bestes Modell weiterhin Googles Gemma 3 12B QAT – veröffentlicht vor rund 66 Tagen. Die von der lokalen KI-Software LM Studio als Alternativen vorgeschlagenen Modelle Nemotron Nano 4B und das gerüchteweise kursierende „Qwen3.5 9B“ seien bereits 147 beziehungsweise 161 Tage alt. Neuere Veröffentlichungen wie das kompakte Modell „Bonsai 27B“ könne er auf seiner Hardware laut eigener Einschätzung möglicherweise gar nicht mehr sinnvoll betreiben.
Ist der Befund haltbar?
Der Thread ist – wie bei Reddit-Diskussionen dieser Art üblich – eine subjektive Momentaufnahme eines einzelnen Nutzers, keine belastbare Statistik über Modell-Veröffentlichungen. Laut eigener Recherche lässt sich der beschriebene Trend zumindest teilweise einordnen: Bonsai 27B, das im Thread als Beispiel für aktuelle Neuerscheinungen genannt wird, ist tatsächlich real und erst am 14. Juli 2026 vom Caltech-Spinout PrismML veröffentlicht worden – allerdings kein klassisches 8-12B-Modell, sondern eine radikal auf 1-Bit- beziehungsweise Ternary-Genauigkeit komprimierte Fassung von Alibabas Qwen3.6 27B, die mit rund 3,9 bis 5,9 Gigabyte Speicherbedarf gezielt auf Smartphones laufen soll. Das deutet eher auf eine Verschiebung als auf ein komplettes Verschwinden der mittleren Modellgröße hin: Mancher Hersteller springt offenbar direkt von sehr kompakten, aggressiv komprimierten Mini-Modellen zu großen Flaggschiffen, während der klassische 8-12B-Bereich seltener frisch bedient wird.
Mögliche Gründe laut Diskussion und Marktbeobachtung
Im Kommentarbereich des Threads werden mehrere Erklärungen diskutiert, die sich mit unabhängigen Markteinschätzungen decken: Erstens verschiebt sich der wirtschaftliche Fokus vieler KI-Labore Richtung agentenfähiger, sehr großer Modelle, die im Rechenzentrum laufen und dort Abo-Umsätze bringen – kleine, lokal lauffähige Modelle sind für Anbieter oft ein Nebenprodukt ohne direkten Erlös. Zweitens wird zunehmend auf Distillation gesetzt, bei der Wissen aus einem großen Modell in ein kleineres übertragen wird – solche Modelle erscheinen dann unregelmäßiger und meist erst deutlich nach dem großen Basismodell. Drittens hat sich der Markt nach Einschätzung mehrerer Fachmedien in eigene Hardware-Klassen aufgespalten: Winzige Modelle für Smartphones auf der einen, sehr große Cloud-Modelle auf der anderen Seite – der Mittelbereich, für den Nutzer mit 16 bis 24 Gigabyte RAM klassische lokale Hardware wie ein MacBook Pro besitzen, bekommt dabei nach Nutzereindruck seltener Aufmerksamkeit.
Was Nutzer aktuell tun können
Für alle, die lokal auf Notebooks mit 16 Gigabyte RAM arbeiten wollen, bleibt der Rat aus der Diskussion pragmatisch: Modelle wie Gemma 3 12B QAT oder ähnlich quantisierte Varianten bekannter Modellfamilien laufen weiterhin zuverlässig und werden von Werkzeugen wie LM Studio oder Ollama unterstützt, auch wenn ihr Veröffentlichungsdatum inzwischen einige Monate zurückliegt. Ob und wann Hersteller den 8-12B-Bereich wieder gezielter bedienen, ist unbestätigt – aus den öffentlich verfügbaren Daten lässt sich derzeit weder ein dauerhafter Rückzug noch eine baldige Trendwende sauber belegen.
Quelle: Reddit r/LocalLLaMA (Nutzerdiskussion, unbestätigte Einzelmeinung). Zusätzliche Einordnung auf Basis eigener Recherche u. a. bei Pinggy.io zu Bonsai 27B.