KI-Tempo drosseln?: Was Anthropic beim neuen Top-Modell Opus 5.5 ändert
Mit Opus 5.5 veröffentlicht Anthropic das erste Top-Modell, seit Vertreter des Unternehmens inklusive des Chefs Dario Amodei öffentlich forderten, die KI-Entwicklung aufgrund der Risiken zu bremsen. Laut Benchmarks kann es sich vor Fable 5.1 setzen und kostet 40 Prozent weniger als Opus 5.
Externe Kontrolleure und ein besseres Alignment
Die interessante Frage bei dem neuen Modell ist weniger, wie leistungsfähig das Modell ist, sondern vor allem: Welche Konsequenzen zieht Anthropic, nachdem das Unternehmen vielfach in den letzten Wochen vor einem eskalierenden KI-Wettrüsten gewarnt hat? Die Antwort lautet zunächst: Kontrolle von außen. Laut Anthropic ist Opus 5.5 das erste Modell, das vor dem Release von externen Prüfern getestet wurde. Die Liste umfasst bekannte Institute wie Frontier Design und Metr.
Beim Modell selbst setzt man aber auch an. Das gilt insbesondere für das Alignment.
Opus 5.5 soll eher den Vorgaben folgen, hat aber ein Gespür für Testumgebungen
Wie schon bei GPT-6 Astra verkündet auch Anthropic, das Alignment von Opus 5.5 im Vergleich zu den Vorgängern deutlich optimiert zu haben. Alignment beschreibt, wie strikt ein Modell den Vorgaben der Entwickler folgt. Ein zentrales Problem bei den KI-Sicherheitsvorfällen war, dass Modelle sich über Anweisungen hinwegsetzten, um ihre Aufgaben zu lösen.
Anthropic testete dieses Verhalten in einer neuen Simulationsumgebung. Das Resultat ist, dass Opus 5.5 85 Prozent seltener als Opus 5 oder Mythos 5.1 versucht, seine Grenzen zu umgehen.
Es bleiben aber Schwierigkeiten. So bemerkte Anthropic in einigen Fällen, dass Opus 5.5 offenbar oft vermutete, dass es sich gerade in einer Testumgebung befindet. Fortschritte beim Alignment sieht man also vor allem da, wo man messen kann – unklar ist, was in Szenarien passiert, die nicht den Labor-Situationen gleichen. Das erschwert die Prognose, inwieweit sich solche Testergebnisse in die Praxis übertragen lassen.
Opus 5.5 erhält dieselben Sicherheitsmechanismen wie Fable 5.1
Bislang waren die Fable-Modelle diejenigen von Anthropic mit den striktesten Sicherheitsmechanismen. Anfragen in Bereichen wie Cybersicherheit oder Biologie wurden bis dato schnell zu Opus 4.8 weitergeleitet. Dasselbe gilt nun auch für Opus 5.5. Es erhält dieselben Schutzmechanismen, um Anfragen in kritischen Bereichen zu blockieren.
KI-Entwicklung drosseln?
Für das erste Top-Modell nach all den KI-Warnungen gilt also: Anthropic arbeitet – ebenso wie OpenAI – am Alignment und lässt – ebenso wie OpenAI – externe Tester die Modelle vorab prüfen. Bislang optimiert man also vor allem die internen Prozesse. Bei den heutigen Modellen spricht Anthropic von etablierten Verfahren und Sicherheitspraktiken.
Die Risiken könnten aber steigen, wenn sich die Leistungsfähigkeit der Modelle schnell verbessert. Möglich ist das etwa mit selbstverbessernden Modellen (Recursive Self-Improvement, RSI). Darauf bezog sich auch Dario Amodei in seinem Essay.
Um auf künftige Modelle vorbereitet zu sein, erhöht man die Sicherheitsmaßnahmen. Das bezieht sich unter anderem auf den Trainingsprozess. So achtet man etwa beim Reinforcement Learning darauf, Trainingsumgebungen so zu gestalten, dass Modelle keine Fehlanreize erhalten. Ebenso verschärft man das Monitoring – man überwacht bei Sicherheitstests also gezielt die Chain of Thought (Gedankenkette), um nachvollziehen zu können, aus welchen Gründen die Modelle handeln.
Opus 5.5 neuer Spitzenreiter in den Benchmarks
Was noch bleibt, sind die Testergebnisse. Die entsprechen den Erwartungen: Opus 5.5 kann sich in den meisten von Anthropic veröffentlichten Benchmarks an die Spitze setzen. Fortschritte verzeichnet es insbesondere in Aspekten wie Coding, Wissensarbeit und Kommunikation. Das Modell läuft dabei sehr effizient. Die Konsequenz sind um 40 Prozent reduzierte Token-Kosten.
Insbesondere bei den Token-Kosten bleibt aber immer abzuwarten, inwieweit sich der Verbrauch dann im Alltag entwickelt.
Verfügbarkeit
Opus 5.5 ist mittlerweile auf allen Plattformen verfügbar. Privatnutzer können es über den Claude-Assistenten einsetzen, Entwickler über AWS, Google Cloud und Microsoft Azure.
- 3DMark Steel Nomad + X
- Cinebench 2026
- Gears of War: E-Day (neu!)
- Apple M1 – M6