Wenn Sturheit zum Sicherheitsproblem wird: Wie KI-Agenten andere manipulieren können
Statt eine komplexe Aufgabe von einem einzigen KI-System erledigen zu lassen, können Entwickler:innen heute die Arbeit auf mehrere spezialisierte KI-Agenten verteilen. Bei der Softwareentwicklung kann beispielsweise ein Agent planen, ein anderer programmieren und ein dritter den Code überprüfen. Solche Multi-Agenten-Systeme kommen heute schon für Anwendungen wie Softwareentwicklung, Planung oder Büroassistenz zum Einsatz. Damit die Agenten effektiv zusammenarbeiten können, müssen sie untereinander Informationen austauschen und ihre eigene Einschätzung aufgrund der Ergebnisse anderer verändern können.
Genau darin liegt jedoch eine mögliche Schwachstelle. „Wenn wir ein offenes Netzwerk haben, können darin zum Beispiel KI-Agenten verschiedener Anbieter zusammenarbeiten. Einer dieser Anbieter könnte versuchen, sich einen Vorteil zu verschaffen, indem er seinen Agenten so konfiguriert, dass er die gemeinsame Entscheidung des Netzwerks in eine bestimmte Richtung lenkt“, erklärt Abedini. Solche Angriffe funktionieren laut der Forscherin anders als klassische Hackerangriffe: „Der Agent übernimmt weder die Kontrolle über die anderen Agenten noch verändert er deren Anweisungen. Er nutzt einfach die reguläre Kommunikation zwischen den Agenten, vertritt beharrlich eine bestimmte Position und versucht so, die Einschätzung der anderen zu verändern.“
Dass solche Angriffe grundsätzlich funktionieren können, haben frühere Forschungsarbeiten bereits gezeigt. „Der bisherige Blick auf das Problem war: In der ersten Verhandlungsrunde haben wir eine Antwort und in der letzten Runde eine andere, also war der Angriff erfolgreich“, sagt Abedini. „Für uns war die wichtige Frage aber, was dazwischen passiert.“
Um dieses „Dazwischen“ zu beschreiben, griffen die Forschenden auf das Friedkin-Johnsen-Modell aus den Sozialwissenschaften zurück. Es beschreibt mathematisch, wie sich Meinungen innerhalb eines sozialen Netzwerks verändern. Dabei berücksichtigt es, wie stark jemand an einer ursprünglichen Überzeugung festhält, wie leicht diese durch andere verändert wird und wie viel Einfluss die Beteiligten aufeinander haben. Diese Größen übertrugen die Forschenden auf KI-Agenten. Überraschend war für die Forschenden, wie gut das Modell die in Experimenten beobachtete Dynamik zwischen LLM-Agenten beschreiben konnte. Damit können sie nicht nur beobachten, dass ein Angriff funktioniert. Sie können mathematisch beschreiben, unter welchen Bedingungen er erfolgreich wird.
Es zeigt sich: Ein manipulativer Agent kann unter bestimmten Bedingungen die gemeinsame Entscheidung des Netzwerks in seine Richtung lenken, wenn er selbst hartnäckig an seiner Position festhält. Diese Eigenschaft wird als „Stubbornness“, zu Deutsch Sturheit, bezeichnet. „Wie ausgeprägt dieses Verhalten ist, kann unter anderem vom verwendeten Sprachmodell, der Aufgabe und den Prompts abhängen“, erklärt Abedini. Nur stur zu sein, reiche allerdings nicht aus. Der Agent müsse auch genügend Einfluss auf andere Agenten haben, die bereit seien, ihre eigene Einschätzung zu verändern.
Wie groß der Einfluss von Agenten ist, hängt auch von der Netzwerkarchitektur ab. In einem sternförmigen Netzwerk kommuniziert ein zentraler Hub mit allen anderen Agenten. Sitzt dort der Angreifer, ist seine Position besonders mächtig. Befindet er sich dagegen am Rand, ist sein Einfluss deutlich geringer. In einem vollständig verbundenen Netzwerk, in dem jeder Agent mit jedem anderen kommuniziert, gibt es eine solche Schlüsselposition nicht. Hier kommt es vor allem darauf an, wie viel Gewicht die anderen den Aussagen des Angreifers geben. Zudem zeigen die Berechnungen: Je größer das Netzwerk, desto mehr Einfluss benötigt ein einzelner Angreifer, um die Entscheidung zu manipulieren. „Damit wird schon die Architektur eines Multi-Agenten-Systems selbst zu einer Sicherheitsfrage“, sagt Abedini.
Das mathematische Modell zeigt den Forschenden auch, an welchen Stellen sie ansetzen können, um solche Angriffe zu erschweren. Als Gegenmaßnahme testeten die Forschenden einen dynamischen Vertrauensmechanismus. Eine zentrale Instanz stellt den Agenten gelegentlich Aufgaben, deren richtige Antwort sie kennt. Wer wiederholt falsch antwortet, erhält ein geringeres Einflussgewicht: Seine Aussagen verändern die Einschätzungen der anderen Agenten künftig weniger stark. In den Experimenten verringerte das den Einfluss manipulativer Agenten. „Es gibt jedoch noch Spielraum für Verbesserungen des Abwehrmechanismus. Zu verstehen, wie dieser in realistischeren agentenbasierten Szenarien funktionieren wird, ist zudem eine der Fragen, denen ich mich in meiner zukünftigen Arbeit widmen möchte“, sagt Abedini.
Denn genau darin liegt die Herausforderung: KI-Agenten müssen aufeinander hören, damit Zusammenarbeit funktioniert. Aber sie dürfen sich dabei nicht einfach von jedem noch so sturen Nachbarn überzeugen zu lassen.