🤖 KI-News

Gerücht: Qwen 3.8 Max soll besonders gut planen können

Kurz gesagt: Ein Nutzer im Forum Reddit LocalLLaMA berichtet nach eigenen Angaben von seinen Erfahrungen mit Alibabas neuem Flaggschiff-Modell Qwen 3.8 Max: Das Modell soll auffallend schnell arbeiten, gut planen und besonders zuverlaessig erkennen, wenn ein Problem unnoetig kompliziert geloest wird. Belegt ist das bislang nur durch den einzelnen Erfahrungsbericht, nicht durch eigene Messungen. Unabhaengig davon bestaetigen mehrere Fachportale, dass Alibaba das 2,4 Billionen Parameter grosse Modell Anfang August 2026 offiziell veroeffentlicht hat und es in Benchmarks wie OSWorld-Verified und Terminal-Bench 2.1 teils vor Modellen von OpenAI und Google liegt.

Gerücht: Qwen 3.8 Max soll besonders gut planen können

Symbolbild: KI-generiert

Im Forum Reddit LocalLLaMA hat ein Nutzer einen laengeren Erfahrungsbericht zu Alibabas neuem Modell Qwen 3.8 Max veroeffentlicht. Der Post beschreibt Eindruecke aus der fruehen API-Vorschau und der spaeteren Vollversion: Das Modell soll ungewoehnlich schnell antworten, gut planen und vor allem darin auffallen, wann ein Problem unnoetig verkompliziert wird - also eher zu einfachen, funktionierenden Loesungen tendieren als zu ueberladenen. Wichtig fuer die Einordnung: Es handelt sich um den subjektiven Bericht eines einzelnen Nutzers, nicht um eine systematische, unabhaengig nachvollziehbare Messung - eine Bestaetigung durch weitere Tester steht bislang aus.

Was am Modell selbst gesichert ist

Unabhaengig von der einzelnen Praxis-Erfahrung ist die Veroeffentlichung des Modells gut dokumentiert: Laut MarkTechPost hat Alibabas Qwen-Team Qwen3.8-Max am 3. August 2026 als allgemein verfuegbare Version freigegeben, nachdem eine Vorschau bereits seit Ende Juli ueber die Plattformen Token Plan und Qoder lief. Es handelt sich um ein Mixture-of-Experts-Modell mit 2,4 Billionen Parametern, von denen laut Berichten rund 95 Milliarden pro Anfrage aktiv genutzt werden, dazu ein Kontextfenster von einer Million Token sowie native Bild- und Videoverarbeitung.

Benchmarks: an der Spitze bei Agenten-Aufgaben, aber kaum selbst zu betreiben

Bei unabhaengig nachvollziehbaren Tests erreicht Qwen3.8-Max nach Angaben mehrerer Fachportale wie DataCamp und BenchLM beim Agenten-Benchmark OSWorld-Verified 86,1 Punkte - vor GPT-5.6 Sol Max (83,2), Claude Fable 5 (85,0) und Gemini 3.1 Pro (76,2). Beim Terminal-Bench 2.1 liegt es mit 86,6 Punkten vor Claude Opus 4.8 und Claude Fable 5 (jeweils 84,6), aber hinter GPT-5.6 Sol Max (88,8). Gegenueber dem Vorgaenger Qwen3.7-Max ist der Sprung deutlich: OSWorld-Verified stieg von 73,3 auf 86,1, PaperBench von 64,8 auf 93,0. Selbst betreiben laesst sich das Modell dabei praktisch nicht - die Gewichte allein benoetigen in 4-Bit-Genauigkeit laut Berichten rund 1,2 Terabyte Speicher, deutlich mehr als selbst ein Achtfach-Server mit High-End-Grafikkarten liefert.

Einordnung

Fuer deutsche Leser zeigt der Fall zwei Dinge zugleich: Zum einen bestaetigen unabhaengige Benchmarks, dass Alibaba mit Qwen3.8-Max bei Agenten- und Coding-Aufgaben inzwischen mit den grossen US-Anbietern mithalten oder sie teils uebertreffen kann. Zum anderen bleibt die konkrete Alltagserfahrung - etwa die im Reddit-Post beschriebene Planungsstaerke - vorerst ein einzelner, unbestaetigter Eindruck. Wer das Modell nutzen will, kommt derzeit ohnehin nicht um die Cloud-API herum, ein lokaler Betrieb bleibt selbst fuer gut ausgestattete Teams unrealistisch.

Quelle & Einordnung: Anlass dieser Meldung: Reddit LocalLLaMA. Text, Bewertung und Bild sind unsere eigene, unabhängige Einordnung – wir geben keine fremden Inhalte im Wortlaut wieder.
Was das im Alltag bedeutet
🤖 Transparenz: Recherche und Text dieser Meldung entstehen mit KI-Werkzeugen. Themenauswahl, Einordnung und Veröffentlichung verantwortet die Redaktion – verantwortlich im Sinne des § 18 Abs. 2 MStV ist Jörg Schock.

SmartHome Kompass bei Google folgen · alle Nachrichten

← Alle KI-News