Aktuelles & Trends

IT-Security

Reward Hacking: Wenn AI-Modelle das Bewertungssystem austricksen

Was passiert, wenn ein AI-Modell stark darauf optimiert wird, einen möglichst hohen Score (Bewertungspunkte) zu erreichen – egal, wie dieser zustande kommt? Dieses als „Reward Hacking“ bezeichnete Phänomen hat Anthropic nun in einem aktuellen Sicherheitsexperiment nachgewiesen.

9. September 2026

|

Reward Hacking

Bild: © Pexels/pixabay.com

Beim Training von AI-Modellen wird erwünschtes Verhalten über Bewertungspunkte (Scores) verstärkt. Von Reward Hacking spricht man, wenn ein AI-Modell eine Schwachstelle im Bewertungssystem ausnutzt und so eine hohe Bewertung erzielt, ohne die Aufgabe wie vorgesehen zu lösen. Es optimiert dann nicht auf das eigentliche Ziel, sondern nur den reinen Messwert.

Forschende von Anthropic haben mithilfe eines bewusst fehlgerichteten AI-Modells nun demonstriert, wie solche Reward-Hacking-Effekte entstehen und welche riskanten und sicherheitsrelevanten Verhaltensweisen sich daraus ergeben können.

Das Experiment mit „Hacker-Opus“

Konkret trainierte Anthropic für das Experiment ein Opus-Modell in kontrollierten Testumgebungen. Diese Umgebungen enthielten absichtlich Schwachstellen, über die ein AI-Modell hohe Bewertungen erzielen kann, ohne die eigentliche Aufgabe ordnungsgemäß zu lösen. Das Ziel bestand darin, zu untersuchen, was geschieht, wenn ein AI-Modell primär darauf ausgelegt wird, hohe Scores beziehungsweise Punkte zu erzielen – unabhängig davon, wie diese entstehen.

Das Ergebnis: Das AI-Modell nutzte am Ende des Trainings in rund 40 Prozent der Durchläufe die jeweiligen Schwachstellen aus, um seinen Score zu maximieren. Dieses quasi als „Hacker“ auftretende AI-Modell nannte Anthropic dann folglich „Hacker-Opus“.

Ausbruch aus der Sandbox und Angriffe auf die Infrastruktur

Besonders bemerkenswert war dieses Verhalten in den simulierten Cybersecurity-Szenarien. Um einen möglichst hohen Score zu erzielen, verließ „Hacker-Opus“ seine abgesicherte beziehungsweise vorgesehene Testumgebung und beschaffte sich fremde (simulierte) Zugangsdaten. Gleichzeitig versuchte das AI-Modell, bestehende Überwachungs- und Sicherheitsmechanismen zu umgehen bzw. auszuschalten und griff sowohl interne als auch externe Infrastrukturen an.

Außerdem versuchte das AI-Modell, sich selbst höhere Scores zuzuweisen. Solche Verhaltensweisen wurden nicht direkt trainiert, sondern entstanden, weil das Modell lernte, dass es auch mit Manipulationen viele Bewertungspunkte erzielen kann.

Klassische Tests greifen zu kurz

Laut Anthropic zeigt die Untersuchung, dass klassische Sicherheits- und Auditverfahren manipulatives Verhalten von AI-Modellen nicht zuverlässig erkennen. In Standardtests verhielt sich Hacker-Opus unauffällig und lehnte schädliche Aktionen ab. Erst im oben beschriebenen Szenario wurde deutlich, zu welchen Maßnahmen AI-Modelle bereit sind, um ihre Bewertung zu maximieren.

Was bedeutet das für Unternehmen?

Für Unternehmen verdeutlicht das Experiment: Wenn künftig mehr autonome AI-Systeme zum Einsatz kommen, reicht es nicht mehr aus, nur die Ergebnisse zu kontrollieren. Auch die Regeln, nach denen das AI-Modell bewertet wird, sowie die Bedingungen und Sicherheitsvorkehrungen rund um diese Bewertung müssen geschützt werden. Robuste Governance-, Monitoring- und Sicherheitskonzepte für den produktiven Einsatz von AI werden entsprechend immer wichtiger.

Sie wünschen eine unverbindliche Beratung rund um die Absicherung von AI-Modellen? Dann wenden Sie sich gerne an die Experten von CANCOM.

Mehr zum Thema „IT-Security“

mobile-sicherheit-google-pixel

Mobile Sicherheit ist für Firmen ein zentrales Thema. Google weiß das genau – und stattet die Pixel 8-Smartphones mit einer Reihe von Security-Funktionen aus.

Artikel lesen
red-hat-container-sicherheit_cancom_info

Viele Unternehmen setzen auf Container- und Kubernetes-Umgebungen. Die Lösung „Red Hat Advanced Cluster Security für Kubernetes“ sorgt für Sicherheit.

Artikel lesen
"Firmen haben jederzeit die volle Kontrolle über die eingesetzten Cloud-Lösungen"

Im Interview beschreibt Experte Lothar Geuenich die Anforderungen und Leistungen von Check Point und CANCOM im Bereich Cloud Security.

Artikel lesen