Im Furniture Assembly Benchmark von Epoch AI identifiziert GPT-6 Astra 80 Prozent der Fehler in IKEA-Möbeln. Für eine Prüfung in Echtzeit ist das Modell laut den Forschenden noch zu langsam.
Ein Foto von einem Möbelstück kann inzwischen reichen, damit ein KI-Modell einen fehlerhaften Montageschritt erkennt. Im Furniture Assembly Benchmark von Epoch AI mussten Modelle Fotos mit einer Bauanleitung abgleichen und Fehler beim Aufbau beschreiben. Die Ergebnisse zeigen, wie sich die Systeme bei dieser konkreten Prüfaufgabe schlagen – und wo ihre Grenzen liegen.
GPT-6 Astra erkennt 80 Prozent der Fehler
Für den Benchmark fotografierten die Forschenden drei IKEA-Möbel während des Aufbaus und bauten absichtlich Fehler ein. Die Modelle sollten anhand der Fotos und der Anleitung fehlerhafte Schritte finden und korrekt beschreiben.
Im November 2025 erkannte Anthropics Claude Opus 4.5 laut Epoch AI 28 Prozent der Fehler. Zehn Monate später kam OpenAIs GPT-6 Astra auf 80 Prozent. Weitere Ergebnisse aus dem Vergleich: Claude Fable 5.1 erreichte 70 Prozent, Claude Opus 5 kam auf 61 Prozent. Chinesische Open-Weight-Modelle liegen laut Epoch AI mindestens sieben Monate hinter den führenden Modellen.
Noch keine Prüfung in Echtzeit
GPT-6 Astra brauchte laut dem Bericht drei Minuten pro Foto. Damit war es zwar das schnellste Modell im Vergleich, für den Echtzeit-Einsatz beim Möbelaufbau reicht die Geschwindigkeit den Forschenden zufolge aber noch nicht aus. Die Ergebnisse beziehen sich auf den beschriebenen Benchmark; sie belegen nicht, dass ein System bereits als praktische Montagehilfe verfügbar ist.
Was das für die Praxis bedeutet
Für dich als Designer oder in einem anderen Berufsfeld ist vor allem der Ansatz interessant: Ein Modell gleicht Bildmaterial mit einer Anleitung ab und sucht nach Abweichungen. Das könnte künftig auch für andere praktische Prüfaufgaben relevant werden. Als mögliche Einsatzfelder nennt die Quelle Autoreparaturen und Haushaltsgeräte.
Für den Moment solltest du die Ergebnisse jedoch als Forschungsstand zu einer begrenzten Testaufgabe einordnen. Die Erkennungsquote von GPT-6 Astra ist deutlich höher als die von Claude Opus 4.5 im früheren Vergleich. Die nötige Zeit pro Foto und der Abstand zu einer Echtzeitprüfung zeigen zugleich, dass eine solche Anwendung noch nicht ohne Weiteres in den Arbeitsalltag übertragbar ist.
Kommentare
Anmelden und kommentieren.