Gerücht: Qwen3.8-27B-Variante soll Sperren fast umgehen
Kurz gesagt: Im Forum LocalLLaMA kursiert eine Eval-Tabelle zu einer sogenannten "abliterated" FP8-Fassung von Alibabas Qwen3.8-27B, veröffentlicht vom Anbieter OrcaRouter. Laut den dort genannten Zahlen soll die Ablehnungsrate bei Schadanfragen auf Testsets wie AdvBench, HarmBench und StrongREJECT von 64-99% beim Originalmodell auf teils 0% fallen, während sich MMLU und GSM8K um weniger als 1,3 Punkte verändern sollen. OrcaRouter selbst warnt, das Modell verfüge über keine sinnvollen Schutzmechanismen mehr und dürfe nur zu Forschungszwecken eingesetzt werden.
Symbolbild: KI-generiert
Im Reddit-Forum r/LocalLLaMA wird derzeit eine Eval-Tabelle zu einer modifizierten FP8-Fassung von Alibabas Sprachmodell Qwen3.8-27B diskutiert. Veröffentlicht haben sie soll der Anbieter OrcaRouter unter dem Namen "Qwen3.8-27B-Uncensored-FP8" - laut dessen Modellkarte auf der Plattform Hugging Face handelt es sich um sogenannte "Abliteration": Dabei wird die interne Repräsentation, die ein Modell zum Verweigern von Anfragen nutzt, gezielt aus dem neuronalen Netz herausgerechnet. Das Ergebnis soll ein Modell sein, das kaum noch Anfragen ablehnt - unabhängig davon, ob sie harmlos oder problematisch sind.
Ablehnungsraten sollen drastisch sinken
Nach den auf Hugging Face veröffentlichten Zahlen soll die Ablehnungsquote bei ausgeschaltetem "Thinking"-Modus auf den gängigen Sicherheits-Testsets AdvBench, HarmBench und StrongREJECT von 97,3 bis 99,0% beim Basismodell auf 0,0 bis 2,7% bei der bearbeiteten Version fallen. Mit eingeschaltetem Denkmodus soll der Rückgang mit 35,0-66,7% auf 0,0-1,7% ähnlich deutlich ausfallen. Gleichzeitig soll die reine Rechenleistung laut den Angaben kaum leiden: Bei MMLU wird ein minimales Plus von 0,4 Punkten genannt (84,3% auf 84,7%), bei GSM8K ein Rückgang um 1,3 Punkte (90,0% auf 88,7%) - beides innerhalb der üblichen Messschwankung.
Anbieter warnt selbst vor Missbrauch
OrcaRouter positioniert das Modell laut eigener Modellbeschreibung ausdrücklich als Forschungswerkzeug für Interpretability-Studien und Red-Teaming, mit dem sich die Wirksamkeit eigener Sicherheitsmechanismen prüfen lässt. Zugleich warnt der Anbieter unmissverständlich, das Modell werde schädlichen, unethischen oder illegalen Anfragen ohne nennenswerte eingebaute Schutzvorkehrungen nachkommen, und rät ausdrücklich davon ab, es ohne eigene Sicherheitsschicht produktiv oder gegenüber Endnutzern einzusetzen. Veröffentlicht ist das Modell unter der Apache-2.0-Lizenz des Basismodells, die Verantwortung für den Einsatz liegt damit vollständig bei den Nutzern.
Für die deutsche Debatte um KI-Sicherheit ist die Meldung ein weiterer Beleg dafür, wie leicht sich Sicherheitsschranken quelloffener Modelle technisch entfernen lassen, sobald die Gewichte frei verfügbar sind - unabhängig vom EU AI Act, der für kommerziell angebotene Dienste in Europa gilt, aber selbstgehostete Forschungsvarianten kaum praktisch einhegen kann. Eine unabhängige Bestätigung der Zahlen jenseits der Herstellerangaben und der Reddit-Diskussion liegt bislang nicht vor.