Überleben Wasserzeichen das Training neuer KI-Modelle? Eine CISPA-Studie gibt Auskunft
KI-generierte Bilder sind heute allgegenwärtig und finden vor allem über das Internet weite Verbreitung. Damit steigt das Risiko, dass KI-generierte Bilder zum Training neuer Bildgenerierungsmodelle verwendet werden. „Wenn Unternehmen auf ihren eigenen synthetischen Daten trainieren, kann das zu einem Model Collapse führen“, erklärt Michel Meintz. „Je mehr man auf eigenen synthetischen Daten trainiert, desto eher verschlechtert sich die Qualität des Modells.“ Eine Möglichkeit, synthetische Daten zu erkennen und gegebenenfalls aus Trainingsdaten herauszufiltern, sind Wasserzeichen. „Sie versehen KI-generierte Bilder mit nicht wahrnehmbaren Signalen, die die Erkennung generierter Inhalte ermöglichen“, erklärt der Forscher. Bislang war jedoch unklar, ob sich Wasserzeichen auch nach dem Training eines neuen generativen Modells noch nachweisen lassen. Aus diesem Grund hat sich Meintz dieses Themas angenommen. „Wir haben uns genauer angeschaut, ob Wasserzeichen überhaupt geeignet sind, nach einem Modelltraining noch nachzuweisen, dass auf den markierten Daten trainiert wurde“, so Meintz.
Der CISPA-Forscher ging zweistufig vor: „Zunächst haben wir mit einem Modell Bilder generiert, die Wasserzeichen enthalten“, erklärt Meintz. „Diese KI-generierten Bilder haben wir dann als Datensatz für das Training eines zweiten Modells verwendet. Von Interesse war dann der Trainingsprozess dieses zweiten Modells. Nach dem Training generieren wir mit dem zweiten Modell neue Daten und prüfen, ob das Wasserzeichen noch nachweisbar ist oder nicht.“ Konkret haben Meintz und seine Kollegen vier Wasserzeichenverfahren – TrustMark, StableSignature, TreeRing und BitMark – und zwei unterschiedliche Modellarchitekturen untersucht: Diffusionsmodelle und autoregressive Bildmodelle. Die Forschenden wollten damit herausfinden, ob sich die Herkunft eines Datensatzes auch nach einem Modelltraining noch nachvollziehen lässt. Das Wasserzeichen dient dabei als Signal, anhand dessen sich erkennen lässt, ob ein Modell auf den markierten Daten trainiert wurde. Dafür untersuchten die Forschenden nicht einzelne Bilder, sondern werteten die Wasserzeichensignale verschiedener Bilddatensätze gemeinsam statistisch aus.
Die Kernerkenntnis der Studie ist, dass Wasserzeichen unterschiedlich gut über mehrere Trainings- und Generierungszyklen hinweg erhalten bleiben. Während einige Verfahren ihr Signal bereits nach einem Training verlieren, bleiben andere deutlich länger nachweisbar. Besonders gut schnitt BitMark ab, das vom SprintML entwickelt wurde. Im untersuchten Infinity-2B-Modell war das Wasserzeichen bereits zuverlässig nachweisbar, wenn nur 1 Prozent der Trainingsdaten markiert war. „Die Übertragbarkeit der Wasserzeichen ist darüber hinaus stark von der Modellstruktur abhängig“, ergänzt Meintz. „Je nachdem, welches Generierungsverfahren und welche Modellarchitektur verwendet werden, verhalten sich die Wasserzeichen sehr unterschiedlich.“ Meintz zieht daraus den Schluss, dass Wasserzeichen an die jeweiligen Modelle angepasst werden müssen. „Damit ein Wasserzeichen einen Diffusionsprozess oder ein Modelltraining übersteht und anschließend noch lernbar beziehungsweise nachweisbar ist, muss es robuster sein. Es braucht möglicherweise Anpassungen, die bei anderen Modellen nicht notwendig sind“, so der Forscher.
Neben der technischen Haltbarkeit stellt sich die praktische Frage, wie sich synthetische Daten erkennen lassen, wenn verschiedene Anbieter unterschiedliche Wasserzeichen verwenden. „Verwenden Unternehmen unterschiedliche Wasserzeichen, kann ein Anbieter nicht ohne Weiteres erkennen, ob ein Bild synthetisch generiert wurde“, erzählt Meintz. „Unternehmen können dann nur ihre eigenen Wasserzeichen erkennen und ein KI-generiertes Bild übersehen, wenn es das Wasserzeichen eines anderen Anbieters trägt.“ Ein gemeinsames Wasserzeichen, das von verschiedenen Anbietern erkannt und überprüft werden könnte, könnte das Filtern synthetischer Daten künftig vereinfachen. „In der aktuellen Praxis erscheint eine Einigung auf ein gemeinsames Wasserzeichen allerdings eher schwierig, weil die Unternehmen unterschiedliche Anforderungen und Interessen haben und sich die Wasserzeichenstrukturen mit der technischen Entwicklung wahrscheinlich weiter verändern“, erklärt Meintz.
Der CISPA-Forscher ist fasziniert vom Thema Wasserzeichen. Die Ergebnisse seiner Studie motivieren ihn, weiter am Ball zu bleiben. „Mein Ziel ist zu untersuchen, wie man die Wasserzeichen selbst besser aufbauen kann und ob sich ein Wasserzeichen entwickeln lässt, das robuster ist“, erzählt er. Darüber hinaus will er den Fokus vom Datensatz auf das Einzelbild verschieben: „Unser bisheriger Prozess benötigt einen Datensatz, um festzustellen, ob ein Wasserzeichen vorhanden ist. Ideal wäre es, wenn man schon bei einem einzelnen Bild erkennen könnte, ob es von einem Modell generiert wurde, das auf unseren markierten Daten trainiert wurde. Dafür müsste man das Signal des Wasserzeichens deutlich stärker machen.“ Dabei will er weiter auf BitMark aufbauen. „Wir würden die Ideen beziehungsweise das Prinzip hinter BitMark weiterentwickeln, weil es bereits gut funktioniert. Bisher wurde es allerdings speziell für Infinity entwickelt.“ Der Herausforderung, es auf andere Architekturen zu erweitern und damit breiter anwendbar zu machen, will er sich gerne stellen.