In de komende weken kan een vrij lange reactie gegenereerd door ChatGPT in de Europese Unie een onzichtbare handtekening met zich meebrengen. Geen verborgen karakters die met een trucje te vinden zijn, geen mysterieuze spatie tussen twee woorden: het signaal wordt rechtstreeks ingevoegd in de taalkundige keuzes die het model maakt.

OpenAI heeft het textGrain genoemd en heeft aangekondigd dat het geleidelijk zal worden geïntroduceerd in voor ChatGPT en Codex geschikte tekstuitvoer in de EU. Vanaf dezelfde dag kunnen API-klanten het al activeren, op sommige modellen, zelfs buiten Europa; in dat geval blijft het optioneel en standaard gedeactiveerd.

Het doel is om zich aan te passen aan de nieuwe transparantieregels van de AI-wet, van toepassing vanaf 2 augustus 2026, die leveranciers van generatieve systemen vraagt ​​om de door kunstmatige intelligentie geproduceerde of gemanipuleerde inhoud ook herkenbaar te maken door middel van machinaal leesbare markeringen. De Europese Commissie maakt echter uitzonderingen en maakt met enige zorg onderscheid tussen volledig gegenereerde tekst, eenvoudige redactionele hulp en inhoud onderworpen aan menselijke controle.

Het watermerk staat in de woorden, niet onder de woorden

Het mechanisme is subtieler dan het woord watermerk doet vermoeden. Bij het genereren van een tekst kijkt een taalmodel naar meerdere plausibele woorden of woordgedeelten en kent aan elk een waarschijnlijkheid toe. textGrain komt tussenbeide in deze keuze door een statistisch schema te introduceren dat gekoppeld is aan een geheime sleutel.

In het technische rapport dat naast de aankondiging wordt gepubliceerd, beschrijven de onderzoekers een systeem dat token-sampling aanpast en tegelijkertijd het verlies aan tekstvariabiliteit onder controle houdt. Een detector uitgerust met dezelfde sleutel kan dan vaker controleren of die taalkeuzes het verwachte patroon volgen dan bij toeval het geval zou zijn.

Kortom, voor de lezer verandert er niets zichtbaars. Als u de tekst naar Word kopieert, in een e-mail plakt of de opmaak verwijdert, verschijnen er geen markeringen omdat er geen teken is om te verwijderen. OpenAI specificeert dat textGrain geen onzichtbare spaties, afwijkende interpunctie of tokens toevoegt die speciaal voor het watermerk zijn gemaakt.

Hoe meer de teksten worden herschreven, hoe zwakker de track wordt

Hier wordt de zaak minder handig voor degenen die zich een soort universele metaaldetector voorstellen voor huiswerk geschreven met ChatGPT. In tests gepubliceerd door OpenAI, waarbij de detector werd ingesteld op een vals-positief percentage van 1%, werd het watermerk herkend in ongeveer 80% van de teksten met 200 tokens en in 95% van de teksten met 400 tokens voor inhoud zoals psychologische reacties. In wiskundige teksten, waar het model veel minder vrijheid heeft bij het kiezen van woorden, zijn de resultaten slechter. Het zijn ook beoordelingen die onder gecontroleerde omstandigheden worden uitgevoerd, en OpenAI waarschuwt expliciet dat ze niet automatisch beschrijven wat er in elke praktijksituatie zal gebeuren.

Ga dan gewoon aan de tekst werken. In een test op passages van 400 tokens, waarbij 10% van de woorden werd vervangen door synoniemen, daalde de detectie van ongeveer 92% naar 66%. Toen 25% van de woorden werd vervangen, kelderde dit naar 17%. Diepere vertalingen en herschrijvingen kunnen het signaal verder verzwakken.

Er is ook de taal. OpenAI heeft geverifieerd dat de prestaties variëren tussen de 24 officiële talen van de Europese Unie en past de intensiteit van het watermerk juist aan omdat sommige talen het model meer manoeuvreerruimte geven dan andere. Zodat 95% niet mag worden overgenomen, overgebracht naar een Italiaanse tekst en omgezet in een zin.

Als textGrain iets vindt, weet het niet wie de tekst heeft geschreven

Zelfs een positief resultaat zegt veel minder dan het lijkt.

Volgens OpenAI kan het watermerk aangeven dat een van zijn systemen tenminste een deel van de tekst heeft gegenereerd of verwerkt. Het kan niet bepalen wie ChatGPT heeft gebruikt, welk account dit heeft gedaan, welke prompt is geschreven of welk gesprek deze woorden heeft voortgebracht. Het meet niet eens hoeveel mensenwerk er later kwam: een tekst die is gegenereerd en vervolgens door een persoon is herschreven, gecorrigeerd en geverifieerd, kan een deel van het signaal blijven bevatten.

Er wordt niet eens vastgesteld wie de auteur is in juridische zin, wie de eigenaar is van de tekst en of wat geschreven staat waar is. En de tegenovergestelde redenering geldt ook: geen gedetecteerd watermerk betekent niet automatisch menselijke tekst. Het kan te kort zijn, bewerkt, vertaald, geproduceerd voordat textGrain werd geïntroduceerd, gegenereerd met een ongedekt sjabloon of afkomstig zijn van een ander bedrijf.

Om deze reden zal de tekstdetector, althans in eerste instantie, niet vrij online worden gezet. OpenAI accepteert verzoeken van onderzoekers en gespecialiseerde organisaties en zal de toegang van geval tot geval beoordelen. Het risico is duidelijk: een vals-positief resultaat dat als definitief bewijs wordt gebruikt om een ​​student, werknemer of dader te beschuldigen, zou veel concretere gevolgen hebben dan een verkeerd percentage in een grafiek.

De AI-wet legt niet op elke tekst die door ChatGPT wordt aangeraakt een label op

Dan is er een belangrijk onderscheid, vooral voor degenen die kunstmatige intelligentie gebruiken bij redactiewerk.

De AI-wet verplicht leveranciers, en dus bedrijven die de systemen ontwikkelen, om machinaal leesbare markering voor synthetische content aan te bieden. Voor degenen die deze tools professioneel gebruiken en teksten publiceren over kwesties van algemeen belang, betreft de verplichting om duidelijk aan te tonen dat de inhoud door AI is gegenereerd of gemanipuleerd, teksten die geen menselijke beoordeling of redactionele controle hebben ondergaan, aldus de aanwijzingen van de Europese Commissie.

Een substantiële beoordeling door een bevoegd persoon, met verificatie van de informatie en redactionele verantwoordelijkheid voor de inhoud, kan dus onder de verleende vrijstelling vallen. Een eenvoudige automatische correctie van grammatica en typefouten is echter niet voldoende om op magische wijze om te zetten in redactionele controle.

De Commissie specificeert ook dat de verplichting tot technische markering niet van toepassing is wanneer het systeem alleen een ondersteunende functie bij de normale redactie vervult. Zelfs hele korte fragmenten en code hebben specifieke regels, omdat daar een statistisch watermerk te weinig ruimte heeft om fatsoenlijk te werken.