OpenAI gaat de komende weken een onzichtbaar watermerk toevoegen aan tekst die ChatGPT en Codex in de Europese Unie genereren. Met de techniek, textGrain, wil het bedrijf voldoen aan de AI Act. Tegelijk geeft OpenAI zelf toe dat het watermerk eenvoudig te verzwakken is.
Bij het lezen of kopiëren van de tekst is het watermerk niet te zien. textGrain past de woordkeuze van het model subtiel aan tijdens het generatieproces. Zo ontstaat een statistisch patroon dat een detector later kan opsporen. De uitrol geldt voor gebruikers van alle abonnementen in de EU, maar alleen voor output die daarvoor in aanmerking komt. Een wereldwijde standaard wordt het voorlopig niet.
Buiten Europa verandert er minder. API-klanten wereldwijd kunnen sinds gisteren zelf kiezen voor watermerken bij geselecteerde modellen, al staat de functie standaard uit. Daarnaast werkt OpenAI met cloudpartners om watermerken ook beschikbaar te maken voor modellen die via hun diensten worden afgenomen.
Europese druk en transparantie onder de AI Act
De directe aanleiding voor deze stap is de Europese regelgeving rond kunstmatige intelligentie. Onder artikel 50 van de AI Act en de bijbehorende Code of Practice worden aanbieders van generatieve modellen verplicht om AI-gegenereerde content machineleesbaar en herleidbaar te maken. Daarbij stelt Europa een verplicht label op AI-content centraal, met als doel misleidende deepfakes en de ongecontroleerde verspreiding van synthetische media tegen te gaan. De wet verplicht weliswaar detecteerbaarheid, maar legt bewust geen vaste technische standaard op, waardoor technologieleveranciers hun eigen methodes ontwikkelen.
OpenAI is dan ook niet de eerste die deze stap zet. Zo maakte Anthropic onlangs bekend dat Claude een onzichtbaar watermerk krijgt in alle gegenereerde tekst. Anthropic koos er echter voor om die markering direct wereldwijd en voor alle nieuwe modellen door te voeren, in plaats van de regionale aanpak van OpenAI. Google bewandelt al langer een soortgelijk pad met SynthID en experimenteerde daarnaast met visuele markeringen. Zo maakte Google een zichtbaar AI-watermerk eerder optioneel, terwijl de onderliggende onzichtbare technologie blijft draaien. Zoals blijkt uit analyses naar de marktbrede adoptie, zijn AI-watermerken inmiddels onzichtbaar maar vrijwel overal aanwezig, waarbij techgiganten vooral generatieve watermerken inbedden in de kansverdeling (logits) van het model zelf.
Bewerken verzwakt het signaal
Opvallend is hoe openhartig OpenAI is over de praktische beperkingen van textGrain. In tests met passages van 400 tokens daalde de detectie van ongeveer 92 naar 66 procent wanneer slechts 10 procent van de woorden door synoniemen werd vervangen. Werd 25 procent van de woorden aangepast, dan bleef er nog maar 17 procent van het signaal over. Ook de lengte van de tekst speelt een doorslaggevende rol. Bij een false-positive-doel van 1 procent vond de detector het watermerk in ongeveer 80 procent van de psychologieteksten van 200 tokens, tegenover zo’n 95 procent bij 400 tokens. Bij wiskundige teksten, waar het model nu eenmaal minder vrijheid heeft in woordkeuze, lagen de scores flink lager.
“Het ontbreken van een gedetecteerd watermerk bewijst niet dat een mens de tekst heeft geschreven”, waarschuwt OpenAI dan ook. Tekst kan te kort zijn, zwaar bewerkt of vertaald. Omgekeerd zegt een gevonden watermerk niets over de specifieke gebruiker, het account of de ingevoerde prompt. Bovendien blijft onzichtbaar hoeveel een mens zelf heeft bijgedragen; wie een eigen tekst enkel laat nalezen of herschrijven door het model, krijgt de markering evengoed mee.
En de kwaliteit van de output? Volgens OpenAI heeft textGrain daar geen merkbare invloed op. De benchmarkscores van frontier-model GPT-6 Astra blijven met en zonder watermerk vergelijkbaar, bijvoorbeeld op GPQA Diamond (94,44 tegenover 93,94 procent).
Ook watermerken voor ontwikkelassistent Codex
Dat de watermerkverplichting naast ChatGPT nadrukkelijk ook voor Codex geldt, sluit aan bij de bredere koers die OpenAI vaart. Waar de tool ooit puur diende als onderliggende modelmotor voor codegeneratie, heeft OpenAI Codex uitgebreid tot een bredere ontwikkelassistent. De software functioneert inmiddels als een autonome agent die terminalopdrachten uitvoert, bestanden overziet en integreert met enterprise-tools zoals codebeheer en ticketing. Doordat Codex niet alleen ruwe code levert maar ook documentatie, pull-request-samenvattingen en takenlijsten genereert, valt ook die tekstuele output in Europa onder de detectie-eisen van de toezichthouder.
Detector voorlopig niet openbaar
Vanwege het reële risico op gemiste watermerken en false positives stelt OpenAI de tekstdetector vooralsnog niet publiek beschikbaar. Alleen goedgekeurde onderzoekers en expertorganisaties kunnen toegang aanvragen om te helpen bij de verdere evaluatie. Op termijn wil het bedrijf textGrain wel als open source uitbrengen. Daarmee volgt het de koers van Google DeepMind, dat SynthID Text in 2024 als open source beschikbaar stelde. Volgens OpenAI presteert textGrain in eigen vergelijkingen minstens zo goed als die techniek.
Helemaal nieuw is het vraagstuk overigens niet voor OpenAI. Eerder werd al bekend dat het bedrijf een werkende methode voor tekstwatermerken op de plank had liggen, maar die destijds nog niet activeerde in ChatGPT uit angst voor concurrentienadeel en gebruikersweerstand. Voor multimedia hanteert het bedrijf al langere tijd de C2PA-standaard en SynthID-signalen. De verificatietools voor afbeeldingen en audio via het web en de Content Provenance API blijven in tegenstelling tot de tekstchecker wel voor iedereen toegankelijk.