Gerücht: DeepSeek V4 Flash soll Tetris unter Windows XP coden
Kurz gesagt: Ein Nutzer im Forum Reddit LocalLLaMA will gezeigt haben, wie DeepSeeks Modell V4 Flash 0731 über das quelloffene Werkzeug NyoCoder auf Anhieb ein funktionierendes Tetris für die Windows-XP-Entwicklungsumgebung Visual Studio 2010 geschrieben haben soll. Belegt ist das bislang nur durch das Video selbst, dessen Qualität der Poster ausdrücklich als mangelhaft bezeichnet. Unabhängig davon bestätigen DeepSeeks eigene Zahlen sowie Auswertungen von Artificial Analysis deutliche Fortschritte des Modells bei Coding- und Agenten-Benchmarks gegenüber der Vorversion.
Symbolbild: KI-generiert
Im Forum Reddit LocalLLaMA hat ein Nutzer ein Video veröffentlicht, das laut eigener Beschreibung zeigen soll, wie DeepSeeks Modell V4 Flash 0731 auf einem lokalen Server ein Tetris-Spiel für Windows XP samt der damaligen Entwicklungsumgebung Visual Studio 2010 im ersten Anlauf (oneshot) fertiggestellt haben soll. Als Werkzeug diente laut Post das quelloffene Projekt NyoCoder des Nutzers, das als eine Art Kommandozentrale (Harness) zwischen dem KI-Modell und der alten Entwicklungsumgebung vermittelt. Der Poster selbst räumt ein, dass die Videoqualität wegen Problemen mit der Aufnahmesoftware OBS mangelhaft sei - eine unabhängige Bestätigung der Demo liegt bislang nicht vor, das Ergebnis sollte daher als unbestätigte Community-Demonstration und nicht als geprüfter Fakt gelten.
Was hinter DeepSeek V4 Flash 0731 steckt
Unabhängig von der einzelnen Demo ist das verwendete Modell selbst gut dokumentiert: DeepSeek hatte V4 Flash 0731 laut MarkTechPost am 31. Juli 2026 aus der Vorschauphase in die offizielle API-Version überführt. Es handelt sich um ein Mixture-of-Experts-Modell mit 284 Milliarden Parametern, von denen pro Anfrage nur 13 Milliarden aktiv genutzt werden, dazu ein Kontextfenster von einer Million Token. In den von DeepSeek selbst gemessenen Agenten-Benchmarks legte die neue Version gegenüber der Vorschau-Version V4-Pro spürbar zu, etwa im Terminal-Bench-2.1-Test von 72,1 auf 82,7 Punkte oder bei DeepSWE von 12,8 auf 54,4 Punkte. Anthropics Claude Opus liegt in denselben Tests laut MarkTechPost weiterhin vorn, etwa bei Terminal Bench 2.1 mit 85,0 Punkten. Wichtig für die Einordnung: DeepSeek maß diese Werte mit einer eigenen, nicht veröffentlichten Testumgebung - MarkTechPost weist ausdrücklich darauf hin, dass Agenten-Benchmarks stark vom verwendeten Werkzeug abhängen und unabhängige Nachmessungen davon abweichen können.
Einordnung
Für deutsche Leser ist an der Reddit-Demo weniger die konkrete Tetris-Umsetzung interessant als der Trend dahinter: KI-Modelle wie DeepSeek V4 Flash werden zunehmend in der Lage gezeigt, auch mit veralteten, kaum noch dokumentierten Entwicklungsumgebungen wie Visual Studio 2010 unter Windows XP umzugehen - ein Szenario, das in professionellen Coding-Benchmarks selten getestet wird, für Wartungsarbeiten an Alt-Software in Unternehmen aber durchaus relevant sein kann. SmartHome Kompass hat erst kürzlich über die parallele Preiserhöhung bei DeepSeeks Flaggschiff-Modell V4-Pro berichtet - beide Meldungen zusammen zeigen ein Unternehmen, das seine Modelle technisch zügig weiterentwickelt, während die einzelnen Demonstrationen aus der Community wie in diesem Fall vorerst unbestätigt bleiben.