Jarenlang hebben we geleefd met een bijna geruststellende overtuiging: het is mogelijk om je te verstoppen op internet. Een bijnaam, een avatar, wat vaag verzonnen informatie en het spel lijkt klaar. De illusie dat je vrijuit kunt spreken zonder dat je echte identiteit verbonden is met wat je schrijft, is een van de hoekstenen van de digitale cultuur geworden.
Toch zou deze zekerheid voorbestemd kunnen zijn om veel sneller af te brokkelen dan we denken. Uit nieuw onderzoek blijkt zelfs dat kunstmatige intelligentie nu in staat is de mensen achter anonieme accounts te identificeren, simpelweg door te analyseren wat ze online schrijven.
Je hebt geen foto van je gezicht nodig, je hebt geen expliciete persoonlijke gegevens nodig. Het enige dat nodig is, zijn opmerkingen, grappen, taalgewoonten en kleine details die hier en daar in de berichten zijn verspreid. Stuk voor stuk fragmenten die op zichzelf genomen onschuldig lijken. Dagelijkse berichten, vaak geschreven zonder al te veel na te denken. Berichten die echter bij elkaar opgeteld veel meer vertellen dan we denken.
De AI analyseert opmerkingen, teksten en ogenschijnlijk onbelangrijke details
De studie, gepubliceerd op de wetenschappelijke server arXiv, laat zien hoe grote taalmodellen (LLM’s) kunnen worden gebruikt om het werk van een digitale detective te repliceren. Het mechanisme is niet gebaseerd op een enkele sensationele aanwijzing, maar op een mozaïek van kleine informatie die voortkomt uit de manier waarop ieder van ons op internet over onszelf schrijft en praat.
Het door de onderzoekers ontwikkelde systeem vertrekt van een heel eenvoudige analyse: het lezen van alles wat een gebruiker publiceert op platforms als Reddit of Hacker News. Opmerkingen, grappen, culturele verwijzingen, idiomen, technische voorkeuren, zelfs kleine taalkundige eigenaardigheden. Alles wordt bruikbaar materiaal voor het opbouwen van een soort impliciet digitaal profiel.
Deze informatie wordt omgezet in een wiskundige weergave van de persoon. Dan gaat de AI doen waar hij goed in is: enorme hoeveelheden data vergelijken. Het systeem zoekt vervolgens naar mogelijke overeenkomsten tussen dat profiel en miljoenen andere inhoud die beschikbaar is op het open web of op professionele platforms zoals LinkedIn.
Het proces verloopt in verschillende stappen. De AI identificeert eerst de elementen die relevant zijn voor identificatie. Vervolgens maakt het gebruik van semantische inbeddingstechnieken, d.w.z. systemen die in staat zijn overeenkomsten in betekenis tussen verschillende teksten te herkennen. Ten slotte komt de LLM-redenering in het spel, waarbij mogelijke overeenkomsten worden geëvalueerd en aan elke overeenkomst een betrouwbaarheidsscore wordt toegekend.
Wanneer het niveau van zekerheid onvoldoende is, levert het systeem bij voorkeur geen resultaten op. Een precieze keuze van de onderzoekers, bedoeld om willekeurige identificaties te voorkomen.
Het online verbinden van echte identiteiten en pseudonieme accounts wordt steeds eenvoudiger
Om te controleren of deze aanpak echt werkte, voerden de auteurs van het onderzoek een experiment uit op bijna duizend LinkedIn-profielen, in een poging deze te koppelen aan de accounts van dezelfde gebruikers die aanwezig waren op het Hacker News-platform. Om de test zo realistisch mogelijk te maken, hebben de onderzoekers elk direct identificerend element uit de profielen verwijderd: namen, persoonlijke links, voor de hand liggende referenties. In de praktijk lieten ze alleen de beschrijvingen en generieke informatie in de profielen aanwezig.
Ondanks deze beperkingen heeft het op AI gebaseerde systeem opmerkelijke resultaten geboekt. Het raamwerk slaagde erin gebruikers correct te identificeren met een nauwkeurigheid van 90% en een nauwkeurigheid van maximaal 67%, waarmee het de traditionele methoden die tot nu toe werden gebruikt om de-anonimiseringsoperaties uit te voeren, ruimschoots overtreft.
Het meest verrassende feit betreft echter een ander aspect. De AI kon dezelfde persoon herkennen, zelfs als deze meerdere accounts op Reddit gebruikten, verspreid waren in verschillende communities en op verschillende tijdstippen publiceerden. Met andere woorden: het systeem heeft aangetoond dat het terugkerende patronen kan identificeren in de manier van schrijven en in het soort informatie dat wordt gedeeld.
En dit alles heeft extreem lage kosten. Volgens het onderzoek vereist het identificeren van een account tussen de één en vier dollar aan rekenkracht. Een minimaal cijfer gezien de schaal waarop vergelijkbare technologieën kunnen worden gebruikt. De onderzoekers spreken zelf openlijk over het einde van wat zij ‘praktische onduidelijkheid’ noemen, dat wil zeggen de impliciete bescherming die jarenlang pseudonieme gebruikers heeft verdedigd, simpelweg dankzij de technische moeilijkheid om hun accounts aan het echte leven te koppelen.
In feite voegt elk bericht dat online wordt gepubliceerd een nieuw stukje toe aan deze onzichtbare puzzel. Elke opmerking, elk persoonlijk detail, elke culturele referentie draagt bij aan de verrijking van het digitale profiel van de schrijver. Het resultaat is een digitaal landschap waarin online anonimiteit steeds kwetsbaarder wordt.
Aan de ene kant zou deze technologie een krachtig instrument voor cyberbeveiliging kunnen zijn, waardoor oplichters, desinformatienetwerken of gecoördineerde criminele activiteiten kunnen worden geïdentificeerd. Aan de andere kant roept het diepgaande vragen op over privacy en vrijheid van meningsuiting. Veel mensen kiezen er zelfs voor om pseudoniemen te gebruiken om zichzelf te beschermen. Activisten, klokkenluiders, medewerkers die misstanden op het werk melden, burgers die gevoelige kwesties bespreken zonder hun publieke identiteit bloot te willen geven.
Als kunstmatige intelligentie zich blijft ontwikkelen met de snelheid die we vandaag de dag zien, zal de vraag steeds urgenter worden: hoe anoniem is wat we online schrijven eigenlijk?
Mogelijk bent u ook geïnteresseerd in:
