<img src="https://ws.zoominfo.com/pixel/ODemgiDEhQshzjvCQ1qL" width="1" height="1" style="display: none;">

De meertalige communicatie-ervaring die u vertrouwen geeft bij elke stap. Begin met het ervaren van het Interprefy-verschil!

Interprefy | AI-nasynchronisatie
Wat is AI-nasynchronisatie en hoe werkt het?
7:17

Stel je voor: een trainingsvideo die ooit in het Engels is opgenomen, moet vóór vrijdag in tien verschillende talen beschikbaar zijn voor een wereldwijd personeelsbestand. Tien jaar geleden betekende dat het inhuren van stemacteurs, het boeken van studiotijd en weken wachten op elke taal. Tegenwoordig kan het betekenen dat je een bestand uploadt en binnen enkele uren een nagesynchroniseerde versie downloadt. Deze verschuiving wordt mogelijk gemaakt door AI-nasynchronisatie.

AI-nasynchronisatie is een aanvulling op het traditionele nasynchronisatieproces, waarbij menselijke stemacteurs dialogen in een doeltaal opnieuw inspreken. Software transcribeert, vertaalt en herschrijft audio automatisch. Het is snel geëvolueerd van een nieuwigheid die door een handvol streamingplatforms werd gebruikt tot een praktisch hulpmiddel voor bedrijfstrainingen, e-learning, marketingvideo's en interne communicatie.

AI-nasynchronisatie is nauw verwant aan AI-spraakvertaling, de technologie achter realtime tolken bij live-evenementen en vergaderingen. In dit artikel wordt uitgelegd wat AI-nasynchronisatie precies inhoudt, wordt de technologie erachter stap voor stap beschreven en wordt gekeken waar organisaties het tegenwoordig al gebruiken. 

Wat is AI-nasynchronisatie?

AI-nasynchronisatie is het proces waarbij kunstmatige intelligentie wordt gebruikt om de gesproken audio in een video of opname te vervangen door een nieuwe audiotrack in een andere taal, met behoud van de toon, het tempo en, in toenemende mate, de stemkenmerken van de oorspronkelijke spreker. In tegenstelling tot ondertiteling, waarbij vertaalde tekst op het scherm wordt weergegeven, vervangt nasynchronisatie de audio zelf, zodat kijkers kunnen kijken en luisteren zonder te hoeven lezen.

Traditionele nasynchronisatie is afhankelijk van menselijke vertalers, stemacteurs, geluidstechnici en studiotijd voor elke taal. AI-nasynchronisatie automatiseert het grootste deel van dit proces met behulp van spraakherkenning, machinale vertaling en spraaksynthese. Dit maakt het sneller en schaalbaarder voor organisaties die content in meerdere talen tegelijk nodig hebben.

Hoe werkt AI-nasynchronisatie?

AI-nasynchronisatie is geen op zichzelf staande technologie, maar een reeks processen die in een bepaalde volgorde plaatsvinden. Elke fase bouwt voort op de output van de voorgaande. 

Spraakherkenning en transcriptie

Het proces begint met automatische spraakherkenning (ASR), die de originele gesproken audio omzet in tekst. Moderne ASR-systemen zijn getraind om accenten, achtergrondgeluid en overlappende spraak te verwerken, en ze leggen ook timinginformatie vast, waardoor precies wordt aangegeven wanneer elk woord of elke zin wordt uitgesproken. Deze timinggegevens zijn later belangrijk, wanneer de nagesynchroniseerde audio moet aansluiten op het origineel. 

Vertaling en dialoogbewerking

Nadat de spraak is getranscribeerd, wordt de tekst vertaald naar de doeltaal. Traditioneel gebeurt dit met behulp van neurale machinevertaling (NMT), die rekening houdt met de context van een hele zin in plaats van woord voor woord te vertalen, waardoor natuurlijkere resultaten worden verkregen dan bij eerdere op regels gebaseerde systemen.

Steeds vaker maken AI-nasynchronisatieplatforms echter gebruik van grote taalmodellen (LLM's), al dan niet in combinatie met traditionele neurale machinevertaling (NMT). In tegenstelling tot conventionele vertaalmodellen kunnen LLM's dialogen aanpassen voor gesproken taal, waarbij humor, emotie en de spreektoon behouden blijven, terwijl de vertalingen beter aansluiten bij het ritme en tempo van de originele spraak. Ze kunnen ook de stemmen van personages behouden, consistent aangepaste terminologie toepassen en scripts genereren die beter geschikt zijn voor nasynchronisatie dan een letterlijke vertaling van de tekst. Voor zakelijke en institutionele content is het in deze fase vaak nuttig om aangepaste terminologie of woordenlijsten te gebruiken, zodat branchespecifieke of organisatiespecifieke termen consistent worden vertaald. 

Stemsynthese en stemklonen 

De vertaalde tekst wordt vervolgens met behulp van tekst-naar-spraaksynthese (TTS) . Veel AI-nasynchronisatietools bieden tegenwoordig stemklonen aan, waarbij het systeem de stem van de oorspronkelijke spreker analyseert en een synthetische stem genereert die daar in de doeltaal sterk op lijkt. Dit betekent dat de eigen stemkenmerken, toon en intonatie van een spreker kunnen doorklinken in een taal die hij of zij niet eens spreekt. Sommige platforms bieden in plaats daarvan een bibliotheek met AI-stemmen waaruit gekozen kan worden, wat een eenvoudigere optie kan zijn wanneer toestemming voor of kwaliteit van stemklonen een aandachtspunt is. 

Timing en lipsynchronisatie

Ten slotte moet de nieuwe audiotrack aansluiten op de originele video. Dit houdt in dat het tempo moet worden aangepast, zodat de vertaalde spraak overeenkomt met de lengte van de originele fragmenten. In meer geavanceerde systemen worden de mondbewegingen in de video bovendien afgestemd op de nieuwe audio. Omdat talen sterk variëren in zinslengte en aantal lettergrepen, is deze afstemmingsstap een van de technisch meest veeleisende onderdelen van het proces en is dit waar de kwaliteit tussen AI-nasynchronisatieaanbieders het meest verschilt.  

Interprefy | AI-nasynchronisatie

AI-nasynchronisatie versus traditionele nasynchronisatie 

De aantrekkingskracht van AI-nasynchronisatie voor bedrijven en instellingen ligt in de snelheid, de kosten en de schaalbaarheid. Traditionele nasynchronisatie vereist het apart boeken van studiotijd en stemacteurs voor elke taal, met een doorlooptijd van weken. AI-nasynchronisatie comprimeert datzelfde werk tot enkele uren, en omdat er geen studiokosten per taal zijn, daalt de prijs per minuut aanzienlijk, vooral wanneer content in veel talen tegelijk moet worden gelokaliseerd in plaats van slechts één of twee.

Desondanks is AI-nasynchronisatie geen volwaardige vervanging voor menselijke nasynchronisatie in elke context. Bij prestigieuze films, karaktergedreven drama's en content waarin genuanceerde emotionele expressie centraal staat, blijft de voorkeur vaak uitgaan naar menselijke stemacteurs. Voor zakelijke communicatie, trainingsmateriaal, webinars en interne updates, waar duidelijkheid en snelheid belangrijker zijn dan dramatische prestaties, wordt AI-nasynchronisatie door de meeste organisaties die het evalueren, nu als productieklaar beschouwd.

Waar organisaties AI-nasynchronisatie gebruiken

AI-nasynchronisatie is niet langer beperkt tot media en entertainment, maar wordt nu voor een breed scala aan institutionele en zakelijke toepassingen gebruikt. Veelvoorkomende toepassingen zijn onder andere bedrijfstrainingen en introductievideo's die medewerkers in verschillende regio's moeten bereiken, e-learningcursussen die regelmatig moeten worden bijgewerkt en waarbij een doorlooptijd van weken per taal geen optie is, bijeenkomsten voor het personeel en communicatie met het management die persoonlijk moeten aanvoelen, zelfs na vertaling, en marketing- en productvideo's die snel moeten worden gelokaliseerd voor nieuwe markten.

Overheidsinstanties, ngo's en internationale instellingen onderzoeken ook de mogelijkheden van AI-nasynchronisatie voor publieke voorlichtingscampagnes en meertalige communicatie, waar het grote aantal benodigde talen traditionele nasynchronisatie onbetaalbaar zou maken.

Waarop te letten bij het kiezen van een AI-nasynchronisatieoplossing 

Niet alle AI-nasynchronisatietools zijn hetzelfde, en de verschillen zijn belangrijk zodra je van een demo naar productiegebruik overstapt. De taal- en dialectondersteuning verschilt aanzienlijk tussen aanbieders, dus het is de moeite waard om te controleren of de talen die je organisatie nodig heeft, worden ondersteund op een bruikbaar kwaliteitsniveau. Ook de stemkwaliteit en de natuurlijke timing verschillen, en deze kun je het beste beoordelen door een aanbieder te testen met je eigen content in plaats van een gepolijste demo. Beveiliging en gegevensverwerking zijn belangrijk voor zakelijk en institutioneel gebruik, vooral als de broncontent vertrouwelijk is of als er sprake is van stemklonen en toestemming moet worden vastgelegd. Ten slotte bepaalt de integratie met bestaande platforms, of het nu gaat om een ​​leerbeheersysteem, een videohostingplatform of een evenemententechnologiestack, hoeveel handmatig werk er nodig is om AI-nasynchronisatie in je workflow te integreren.

Naarmate de kwaliteit van AI-nasynchronisatie steeds beter wordt, is de praktische vraag voor de meeste organisaties niet langer of het werkt, maar voor welke toepassingen het vandaag de dag het beste geschikt is en waar menselijk toezicht nog steeds waarde toevoegt. 


Interprefy Professionele Diensten

Dayana Abuin Rios

Geschreven door Dayana Abuin Rios

Lees meer over de nieuwste ontwikkelingen bij Interprefy van Dayana Abuin Rios, Global Content Manager bij Interprefy.