Zum Inhalt springen

SynthIDs Bild-Wasserzeichen enthält ein 64-Bit-ID-Feld

Eine Forschungsarbeit zeigt, dass SynthIDs Bild-Wasserzeichen ein 64-Bit-Datenbank-ID-Feld enthält, obwohl Google erklärt, keine einzelnen Nutzer zu verfolgen.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
A sheet of glossy photo paper emerging from a color printer, lit by a handheld UV flashlight that reveals a faint grid of pale dots across the print.

Ein am 21. September 2026 auf brand.io veröffentlichter Essay argumentiert, dass sich KI-Wasserzeichensysteme von einfachen Kennzeichnungen "dies wurde von KI erzeugt" zu etwas entwickelt haben, das eher einer Tracking-Infrastruktur ähnelt. Die Autorin oder der Autor nennt das Ergebnis ein "Spymark" statt eines Wasserzeichens. Die Behauptung stützt sich auf ein konkretes technisches Detail aus Google DeepMinds eigener Forschungsarbeit zu SynthID-Image: Die Wasserzeichen-Nutzlast jedes Bildes ist 136 Bit lang, und 64 dieser Bits werden als Datenbank-ID beschrieben, die übrigen 72 Bit dienen der Fehlerkorrektur.

Ein Wasserzeichen bedeutet, still Informationen in einer Datei zu verstecken, etwa einem Bild, einem Audioclip oder einem Textabschnitt, auf eine Weise, die ein Mensch nicht bemerkt, ein passender Detektor aber wieder auslesen kann. SynthID, Googles Wasserzeichensystem, ist in mehrere seiner Bild- und Text-Generierungsprodukte eingebaut.

Was die Forschungsarbeit beschreibt und was Google dazu sagt

Die SynthID-Image-Forschungsarbeit beschreibt eine 136-Bit-Nutzlast, die in 512-mal-512-Pixel-Bilder eingebettet wird: 64 Bit für eine Datenbank-ID, dazu 72 Bit Fehlerkorrektur. Der Essay auf brand.io nennt das "geheime, für Menschen nicht wahrnehmbare Signale". Ein 64-Bit-Feld ist groß genug, um jedem Bild, das SynthID je mit einem Wasserzeichen versehen hat, eine eigene Nummer zu geben. Wegen dieser Größe behandelt der Essay das Feld als Beleg dafür, dass das System einzelne Bilder identifizieren könnte, nicht nur markieren, dass ein Bild von einer KI stammt.

Googles eigene öffentliche Dokumentation beschreibt etwas Engeres. Sie erklärt, SynthID arbeite, indem es "eine pseudozufällige Funktion nutzt, um die Modell-Logits zu ergänzen", während Inhalte erzeugt werden, und wende das so an, "dass Sie feststellen können, ob der Text von Ihrem Modell erzeugt wurde". Das ist ein einzelnes Ja-oder-Nein-Signal, keine Kennung, die an eine Person oder eine einzelne Anfrage gebunden ist. Die Dokumentation ergänzt, dass Modelle, die sich einen Tokenizer teilen, auch ein Wasserzeichen und einen Detektor teilen. Dasselbe Wasserzeichen deckt dann jede Ausgabe dieses Modells ab, nicht ein individuelles pro Nutzer. Googles eigenes Material erwähnt kein Datenbank-ID-Feld.

Der Essay ist bei dieser Lücke vorsichtig. Er stellt das 64-Bit-Feld als dokumentierte technische Möglichkeit in der Forschungsarbeit dar, nicht als Beweis, dass Google oder irgendjemand sonst es heute nutzt, um bestimmte Personen zu verfolgen. Er habe keine öffentlichen Belege dafür gefunden.

Weitere Systeme, die der Essay nennt

Der Essay stellt dasselbe Argument für Text und Audio auf. Er schreibt, SynthIDs Textvariante lenke die Wortwahl während der Erzeugung so, dass ein "erkennbares statistisches Muster" entsteht, das an das Modell gebunden ist, und dass OpenAI ein ähnliches Herkunftssignal in seine eigenen Bild- und Videoausgaben eingebaut habe. Für Audio verweist er auf Audiowerk, ein quelloffenes Wasserzeichen-Werkzeug aus dem Jahr 2018, das laut Essay "128-Bit-Nutzlasten in Audio verstecken und mit einem geheimen AES-Schlüssel schützen" kann. Er vergleicht die Idee außerdem mit Tracking-Punkten von Druckern, dem nahezu unsichtbaren Muster, das viele Farblaserdrucker seit den 1980er-Jahren auf Seiten drucken und das die Seriennummer des Druckers sowie Datum und Uhrzeit des Ausdrucks kodiert.

Was das für Entwickler bedeutet

Wer auf SynthID oder einem ähnlichen Wasserzeichen-Werkzeug aufbaut, sollte die zugrunde liegende Forschungsarbeit lesen, bevor er den eigenen Nutzern erklärt, was das System aufzeichnet und was nicht. Die technische Kapazität einer Nutzlast und die erklärte Richtlinie eines Unternehmens zur Nutzung dieser Kapazität sind zwei verschiedene Dinge. Diese Geschichte zeigt, dass beides auseinanderfallen kann, ohne dass eine Seite lügt: Das Feld existiert in der Spezifikation, und das Unternehmen sagt, es nutze das Feld nicht zum Tracking.

Wer in großem Maßstab Bilder, Audio oder Text erzeugt, sollte die Spezifikation der Wasserzeichen-Bibliothek vor der Einführung auf Kennungsfelder prüfen. Danach sollte man für die eigenen Nutzer in einfacher Sprache festhalten, was das Wasserzeichen feststellen kann und was nicht.

Quellen

  1. Spymarks, Not Watermarks - brand.io
  2. SynthID | Responsible Generative AI Toolkit - Google AI for Developers

Ähnliche Artikel

An ink line-art grid of identical robot figures at desks, with one standing and raising a red flag.
KI & LLMs

DeepMind-Agenten meldeten betrügende Agenten

In einem Google-DeepMind-Lauf mit 100 Gemini-3.1-Pro-Agenten nutzten 14 einen Bewertungsfehler aus, und 24 meldeten sie über ein umgenutztes Feedback-Werkzeug.