<img src="https://ws.zoominfo.com/pixel/ODemgiDEhQshzjvCQ1qL" width="1" height="1" style="display: none;">

De meertalige communicatie-ervaring die u vertrouwen geeft bij elke stap. Begin met het ervaren van het Interprefy-verschil!

EU LLM-benchmark_Interpretatie
Eerlijke meertalige AI: waarom de EU MMLU-benchmark van belang is voor live AI-vertaling
6:56

De meeste gesprekken over de prestaties van AI op het gebied van taalverwerking gaan nog steeds over Engels. Een model scoort goed op een standaard benchmark, wordt geprezen als state-of-the-art en wordt wereldwijd ingezet. Maar steeds meer bewijs, recentelijk nog de nieuwe EU MMLU-dataset van de Europese Commissie, laat zien dat goede prestaties in het Engels weinig zeggen over hoe een model omgaat met Frans, Hongaars of Maltees. Voor iedereen die afhankelijk is van live AI-vertaling op internationale evenementen, is dit verschil niet zomaar een academische voetnoot. Het is het verschil tussen een deelnemer die een keynote begrijpt en een deelnemer die deze volledig mist. 

Dit is belangrijk omdat de benchmarks die worden gebruikt om grote taalmodellen (LLM's) , bepalen welke systemen worden ingezet en vertrouwd. Als die benchmarks bijna volledig in het Engels zijn opgesteld, kunnen ze ons niet vertellen hoe een model presteert in andere talen, waaronder de talen die worden gesproken door de doelgroepen waarvoor live AI-vertaling bedoeld is. 


Wat is de EU MMLU-benchmark? 

EU MMLU is een nieuwe meertalige benchmarkdataset die is uitgebracht door het directoraat-generaal Vertaling van de Europese Commissie (DG Vertaling). De dataset bouwt voort op Massive Multitask Language Understanding (MMLU), een van de meest gebruikte frameworks voor de evaluatie van taalmodellen, dat modellen test aan de hand van duizenden meerkeuzevragen over 57 onderwerpen, van wetenschap en recht tot ethiek en openbaar bestuur.

EU MMLU past dit raamwerk specifiek aan voor de EU-context. Het richt zich op 7 themagebieden die zijn gekozen vanwege hun relevantie voor Europese instellingen en omvat momenteel 16 officiële EU-talen, waaronder Kroatisch, Tsjechisch, Nederlands, Frans, Duits, Grieks, Hongaars, Iers, Italiaans, Litouws, Pools, Portugees, Roemeens, Slowaaks en Sloveens, met plannen voor meer talen. In plaats van simpelweg bestaande Engelse vragen te vertalen, streefde het project ernaar om dezelfde betekenis, moeilijkheidsgraad en toetsingswaarde in elke taalversie te behouden, zodat een score in het Pools hetzelfde betekent als een score in het Frans.

Waarom een ​​model in het Engels kan uitblinken en op andere gebieden kan struikelen 

De meeste datasets voor AI-evaluatie zijn in het Engels opgesteld en weerspiegelen Engelstalige onderwijs-, culturele en maatschappelijke contexten. Een model dat voornamelijk op Engelstalige data is getraind en getest, kan zeer capabel lijken, terwijl de werkelijke prestaties in andere talen grotendeels ongemeten blijven.

Dit is precies de kloof die DG Translation wilde dichten. Zoals de EU MMLU-verklaring stelt, kan een model goed scoren in het Engels, maar aanzienlijk onderpresteren in het Frans, Hongaars of Maltees. Het onderliggende probleem is niet dat modellen helemaal geen andere talen kunnen verwerken. Het probleem is dat standaard benchmarks ze zelden rigoureus genoeg testen om te onthullen waar ze tekortschieten, waardoor zwakke punten in grammatica, nuance of vakspecifieke terminologie onopgemerkt blijven totdat een daadwerkelijk publiek afhankelijk is van de output.

Voor live AI-vertalingen heeft deze wisselvallige prestatie met name directe gevolgen. Een systeem kan eenvoudig Engels bronmateriaal prima verwerken, maar fouten, onhandige formuleringen of betekenisverlies introduceren zodra diezelfde inhoud wordt vertaald naar een minder beproefde doeltaal. Juist op dat moment is nauwkeurigheid het belangrijkst voor een luisteraar die in realtime meeluistert.

CTA voor AI-spraakvertaling

 

Hoe taalkundige en culturele vooroordelen zich manifesteren in live vertalingen

Taalvaardigheidsverschillen zijn slechts een deel van het probleem. DG Translation heeft ook kwaliteitscriteria gepubliceerd voor meertalige benchmarking die verder gaan dan alleen vertaalnauwkeurigheid. Deze criteria testen hoe goed een AI-model de EU-waarden weerspiegelt en omgaat met cultuurspecifieke inhoud, zoals idiomen, humor, verwijzingen, datum- en getalnotaties en verschillen in de verwachte toon of beleefdheidsvormen.

Dit zijn precies de elementen die live vertaling echt moeilijk maken. Een spreker op een conferentie die een regionaal idioom gebruikt, een cultuurspecifieke verwijzing maakt of een mate van formaliteit hanteert die verbonden is aan lokale gebruiken, vertrouwt op meer dan een letterlijke vertaling. Een AI-systeem dat niet bekend is met dit soort nuances in een bepaalde taal, kan de letterlijke woorden correct vertalen, maar de bedoelde betekenis of toon volledig verliezen. Bij een meertalig evenement kan zo'n kloof de manier waarop een boodschap overkomt bij een deel van het publiek beïnvloeden, zelfs als niemand merkt dat er technisch gezien iets mis is.

Waarom door mensen gecontroleerde meertalige data nog steeds belangrijk zijn

Een van de meest opvallende aspecten van EU MMLU is de methodologie. In tegenstelling tot de meeste meertalige benchmarks, die voornamelijk gebruikmaken van machinevertaling om niet-Engelstalige testvragen te genereren, hanteerde EU MMLU een mensgerichte aanpak. DG Translation werkte samen met bijna 250 student-vertalers en projectmanagers van het European Master's in Translation (EMT)-netwerk, afkomstig van 21 universiteiten in heel Europa, om meer dan 1000 benchmarkvragen te vertalen en te herzien.

Dit onderscheid is belangrijker dan het op het eerste gezicht lijkt. Een benchmark die is opgebouwd met behulp van machinevertaling loopt het risico dezelfde zwakheden over te nemen die hij juist moet blootleggen, omdat de output van een model wordt getoetst aan de output van een ander model in plaats van aan een echte menselijke standaard. Menselijke beoordeling verankert de evaluatie in hoe mensen taal daadwerkelijk gebruiken, wat ook de standaard is die het meest telt voor live vertalingen tijdens echte evenementen, waar het publiek menselijk is en de tolerantie voor subtiele vertaalfouten laag is.

Wat een eerlijkere evaluatie van AI zou kunnen betekenen voor meertalige evenementen  

DG Translation formuleert zijn ambitie voor de lange termijn duidelijk: een nieuwe standaard creëren voor meertalige AI-evaluatie in Europa, zodat AI-systemen consistent presteren in verschillende talen en culturen, in plaats van voornamelijk in Engelstalige omgevingen. Als die ambitie wordt gerealiseerd, reiken de praktische voordelen veel verder dan onderzoekslaboratoria.

Voor organisaties die internationale conferenties, institutionele bijeenkomsten of wereldwijde bedrijfsevenementen organiseren, betekent betere meertalige benchmarking een duidelijker beeld van welke AI-systemen betrouwbaar zijn voor welke talen. Dit voorkomt een ontdekking halverwege het evenement dat een bepaalde tool buiten het Engels ondermaats presteert. Het ondersteunt beter onderbouwde beslissingen over waar live vertaling met alleen AI betrouwbaar is en waar een hybride aanpak, waarbij AI wordt gecombineerd met menselijke interpretatie, de betekenis en nuances voor een specifieke taal of doelgroep beter beschermt.

Benchmarks zoals de EU MMLU zullen niet alle tekortkomingen in meertalige AI van de ene op de andere dag oplossen, maar ze vertegenwoordigen wel een belangrijke verschuiving in de manier waarop prestaties worden gemeten en gecommuniceerd. Naarmate deze evaluatienormen zich verder ontwikkelen, bieden ze evenementorganisatoren, instellingen en communicatieteams een duidelijkere basis voor het kiezen van AI-oplossingen voor live vertaling die geschikt zijn voor een daadwerkelijk meertalig publiek. Om te zien hoe Interprefy AI-oplossingen voor live vertaling in verschillende talen aanpakt, kunt u ons AI-spraakvertalingsplatform.


Interprefy AI CTA

Dayana Abuin Rios

Geschreven door Dayana Abuin Rios

Lees meer over de nieuwste ontwikkelingen bij Interprefy van Dayana Abuin Rios, Global Content Manager bij Interprefy.