Je schrijft een zin in het Engels. TabletCraft brengt het naar het Akkadisch, zet de transliteratie om in spijkerschrifttekens en kan ze zelfs op een kleikleurige digitale tablet plaatsen. De reis werkt ook richting Engels. Het is de nieuwste stap in een onderzoek dat een enorm archief toegankelijker probeert te maken: ongeveer een half miljoen spijkerschrifttabletten zijn bewaard gebleven in collecties over de hele wereld en een aanzienlijk deel moet nog worden bestudeerd en vertaald.
Een verduidelijking is onmiddellijk nodig, omdat vijfduizend jaar geschiedenis het op zijn minst verdient om de zaken bij hun naam te noemen. Spijkerschrift is een schrijfsysteem, geen taal: het werd gebruikt voor verschillende talen uit het Oude Nabije Oosten. TabletCraft werkt aan het Akkadisch, een Semitische taal die al duizenden jaren in Mesopotamië gedocumenteerd is. Het systeem is ontwikkeld door Zhaohui Wang van de University of Southern California en het werk werd geaccepteerd tijdens de ACL 2026 C3NLP-workshop.
Nieuw is de reis van Engels naar Akkadisch
Automatische vertaling van het Akkadisch naar het Engels bestond al. TabletCraft voegt daar vooral de hele weg aan toe: het ontvangt een Engelse tekst, produceert een Akkadische transliteratie, associeert deze met Unicode-spijkerschrifttekens en kan deze uiteindelijk grafisch weergeven als tablet. Het model is gebaseerd op ByT5 en werd in beide richtingen getraind, uitgaande van 58.126 uitgelijnde zinnen, omgezet in ongeveer 116.000 trainingsparen. De converter bevat 14.240 associaties tussen transliteraties en tekens en dekt, in de door de auteurs uitgevoerde test, 95,3% van de tokens.
Op de Akkademia-validatieset, bestaande uit 2.812 voornamelijk Neo-Assyrische voorbeelden, behaalde TabletCraft een BLEU-score van 49,1 in de Akkadisch-Engelse richting en 48,5 in de Engels-Akkadische richting. Deze cijfers vertegenwoordigen geen percentage correcte vertalingen. BLEU vergelijkt de door het model geproduceerde tekst met een referentievertaling en de auteurs waarschuwen zelf dat deze, vooral in de richting van het Akkadisch, slechts als een benaderende maatstaf voor de betrouwbaarheid mag worden beschouwd. Een grootschalige deskundige filologische evaluatie moet nog komen.
Er is ook een ouder probleem van kunstmatige intelligentie: dezelfde Akkadische zin kan op verschillende manieren correct worden geschreven, met behulp van syllabische tekens of logogrammen. Een machine kan dus afwijken van het transcript dat als referentie is gekozen en een slechtere score behalen, ondanks dat er een plausibele oplossing is bedacht. Integendeel, het kan een ogenschijnlijk overtuigende zin opleveren die volgens een assyrioloog verkeerd is. Het automatische meetlint alleen lost de tablet niet op.
De auteurs zijn ook vrij expliciet over een andere grens: het Akkadisch, geproduceerd vanuit het Engels, is bij benadering en machinaal gegenereerd. Het kan niet worden behandeld als een authentieke oude tekst, noch worden gebruikt als historische bron. Het trainingscorpus is ook zeer rijk aan Neo-Assyrische koninklijke inscripties uit het eerste millennium voor Christus; het systeem beweegt zich beter tussen formules, titels en constructies die vergelijkbaar zijn met die welke we al hebben gezien, terwijl verschillende registers, zoals Paleo-Assyrische handelsbrieven, moeilijker blijven.
De eerste AI die spijkerschrift vertaalde dateert uit 2023
Misschien wel het meest spectaculaire deel van het verhaal, namelijk de automatische vertaling van spijkerschrifttekens in het Engels, is een paar jaar oud. In 2023 publiceerden Gai Gutherz, Shai Gordin en collega’s over PNAS-nexus een onderzoek naar automatische vertaling van het Akkadisch. Hun systeem werkte zowel op transliteraties in het Latijnse alfabet als rechtstreeks op spijkerschrifttekens gecodeerd in Unicode. Hij behaalde respectievelijk 37,47 en 36,52 BLEU4-punten.
Het corpus omvatte 8.056 tablets en 56.160 segmenten die werden gebruikt voor vertaaltrainingen van transliteratie naar het Engels. Ook hier was het materiaal sterk gericht op de Neo-Assyrische periode: 7.327 tabletten behoorden tot die chronologische groep. De prestaties varieerden sterk, afhankelijk van het genre van de tekst en de lengte ervan; terugkerende formules en korte passages waren over het algemeen gemakkelijker te beheren.
En de machine kon met grote zekerheid fouten maken. In een van de door de onderzoekers geanalyseerde voorbeelden gaf de tekst aan dat de koning op de eenentwintigste dag niet naar het Huis van God afdaalde. Het model verloor de ontkenning en liet de heerser stilletjes in de steek. Een woord verdwenen, wat betekent omgekeerd. De auteurs gebruikten precies zulke gevallen om uit te leggen waarom zelfs een ogenschijnlijk succesvolle vertaling onder de ogen van een deskundige moet gaan.
Er ontbreken nog een paar stappen van de foto van de tablet naar de vertaling
De meest directe droom zou zijn om een tablet te fotograferen, een paar seconden te wachten en de vertaalde tekst te ontvangen. De benodigde stukken beginnen te verschijnen, voorlopig blijven ze verspreid over verschillende systemen.
In juni 2026 presenteerde een groep van de Ludwig-Maximilians-Universität in München een automatisch spijkerschriftherkenningssysteem dat werd toegepast op afbeeldingen uit de Electronic Babylonian Library. Het model werd uitgevoerd op 87.668 fragmenten en produceerde bijna 2,9 miljoen merkdetecties. De geannoteerde dataset die werd gebruikt om het te ontwikkelen, bevatte 124.504 tekens, meer dan het dubbele van de vorige versie. Het is echter een preprint en de onderzoekers melden zelf problemen die verband houden met erosies, scheuren, tekstrangschikking en het ontbreken van taalkundige informatie in het herkenningsproces.
Sumerian betreedt ook deze digitale werkplaats. Het project anno 2024 SumTabletten verzamelde de Unicode-representaties en transliteraties van 91.606 Sumerische tablets, voor bijna zeven miljoen glyphs. Het door de auteurs geteste model behaalde een gemiddelde chrF van 97,55 in transliteratie, een resultaat dat in de eerste plaats bedoeld was om specialisten in staat te stellen snel automatische voorstellen te controleren in plaats van elk teken helemaal opnieuw te hoeven overschrijven.
De richting is daarom heel herkenbaar: computervisie om de wiggen op de foto te identificeren, taalkundige modellen om de tekens te reconstrueren en te translitereren, automatische vertaling om een eerste versie in een moderne taal te verkrijgen. Er bestaat nog geen enkel systeem dat elke beschadigde tablet kan opvangen en zelfstandig een betrouwbare vertaling kan retourneren. TabletCraft zelf vermeldt spijkerschrift-OCR en Sumerische ondersteuning onder toekomstige werken en wordt gepresenteerd als een assistent die gecorrigeerd moet worden, niet als een vervanging voor de assyrioloog.
Een half miljoen tablets zullen nauwelijks in één keer gaan praten. Sommige van de meest repetitieve taken kunnen echter veel sneller gaan: het herkennen van duizenden tekens, het voorstellen van een transliteratie, het voorbereiden van een eerste vertaling ter controle. Na vier millennia is zelfs het inkorten van de rij voor de bureaus van de assyriologen al een behoorlijke technologische sprong.
