Voice cloning: als een vertrouwde stem niet meer genoeg is

Persoon met smartphone en geluidsgolven als illustratie van voice cloning met AI.

Je krijgt een spraakbericht van je kind. Een docent hoort aan de telefoon de stem van een ouder. Of een leerling ontvangt een voice note van een klasgenoot. We zijn gewend om een bekende stem direct aan een persoon te koppelen. Door voice cloning wordt dat steeds minder vanzelfsprekend.

Met AI kan een stem worden nagebootst en vervolgens woorden uitspreken die de echte persoon nooit heeft gezegd. Dat biedt interessante mogelijkheden, bijvoorbeeld voor toegankelijkheid en het maken van audiomateriaal. Tegelijkertijd zorgt voice cloning voor nieuwe vragen rond privacy, oplichting, online pesten en digitale weerbaarheid.

Wat is voice cloning?

Bij voice cloning gebruikt AI een geluidsopname om kenmerken van iemands stem te herkennen. Denk aan intonatie, toonhoogte, tempo, uitspraak en andere typische eigenschappen. Vervolgens kan een AI-model nieuwe zinnen genereren die klinken alsof die persoon ze zelf uitspreekt.

Daarvoor zijn niet altijd uren aan opnames nodig. Moderne systemen kunnen al met relatief korte geluidsfragmenten een stem nabootsen. Meer en beter audiomateriaal kan de kwaliteit verder verhogen. Voice-cloningplatform ElevenLabs beschrijft bijvoorbeeld hoe een stemmodel op basis van opgenomen spraak nieuwe tekst in dezelfde stem kan laten uitspreken.

Dat audiomateriaal hoeft bovendien niet speciaal voor voice cloning te zijn opgenomen. Een video op TikTok, een YouTube-video, een podcast, een livestream of ander openbaar fragment kan al stemgeluid bevatten. Daardoor is niet alleen wat jongeren in beeld delen relevant, maar ook wat zij met hun stem online achterlaten.

Voice cloning is meer dan een deepfake

Voice cloning wordt vaak onder de brede noemer deepfake geplaatst. Toch is het nuttig om het apart te bespreken. Bij deepfakes denken we al snel aan een gemanipuleerde foto of video. Bij voice cloning ontbreekt dat visuele signaal juist.

Dat maakt de stem bijzonder. We herkennen familieleden, vrienden, collega’s en leerlingen vaak binnen enkele woorden. Bovendien zijn we gewend dat een stem bevestigt met wie we spreken. Precies dat vertrouwen kan met synthetische audio worden nagebootst.

De politie rekent nagebootste stemmen dan ook tot synthetische media. AI kan niet alleen geloofwaardige afbeeldingen en video’s maken, maar eveneens audio creëren waarmee het lijkt alsof iemand iets heeft gezegd wat nooit is uitgesproken.

Als je kind ineens belt met een noodgeval

Een van de bekendste risico’s van voice cloning is oplichting. Daarbij kan een bekende stem worden gecombineerd met een verhaal dat direct emoties oproept: iemand heeft een ongeluk gehad, zit vast, is beroofd of heeft onmiddellijk geld nodig.

CNN beschreef in mei 2026 bijvoorbeeld het verhaal van een Amerikaanse moeder die tijdens een telefoongesprek dacht haar dochter in paniek te horen. Vervolgens werd geld geëist. Pas nadat zij contact kreeg met haar echte dochter, bleek dat er niets aan de hand was en dat zij met een AI-oplichting te maken had.

Dat voorbeeld komt uit de Verenigde Staten. Volgens Mediawijsheid.nl komt oplichting met gekloonde stemmen in Nederland nog relatief weinig voor. Toch is het belangrijk om de werkwijze te kennen, juist omdat de technologie toegankelijker wordt.

Voice cloning kan ook jongeren onderling raken

Het risico beperkt zich niet tot financiële fraude. Een stem kan ook worden nagebootst om iemand iets kwetsends, seksueels, discriminerends of bedreigends te laten zeggen. Vervolgens kan zo’n fragment via een groepschat, Snapchat, TikTok of andere kanalen worden verspreid alsof het echt is.

Daarmee ontstaat een nieuwe vorm van digitale impersonatie. Een leerling hoeft iets niet daadwerkelijk gezegd te hebben om toch aangesproken te worden op een overtuigend geluidsfragment. Dat kan leiden tot ruzie, reputatieschade of online pesten.

Ook binnen het onderwijs is dat relevant. Een wetenschappelijke bijdrage uit 2026 noemt bijvoorbeeld scenario’s waarin de stem van een leerling wordt gebruikt voor vernederende content, of waarin de stem van een docent of ouder wordt nagebootst om valse instructies te geven. De auteurs benadrukken daarbij wel dat specifiek onderzoek naar voice cloning binnen scholen nog beperkt is.

Ook een stem is persoonlijke informatie

We praten bij online privacy vaak over foto’s, locatiegegevens en persoonlijke informatie. Stemgeluid verdient inmiddels dezelfde aandacht. Een video waarin een leerling vertelt over een schoolproject lijkt misschien onschuldig, maar bevat tegelijkertijd een bruikbaar stemfragment.

Dat betekent niet dat jongeren geen video’s of voice notes meer zouden moeten delen. Wel hoort bij digitale geletterdheid steeds nadrukkelijker de vraag welke informatie je met een opname beschikbaar maakt en wie daar toegang toe heeft.

Hetzelfde geldt voor scholen. Denk bijvoorbeeld aan filmpjes van presentaties, optredens, open dagen of projecten die openbaar worden gedeeld. Naast toestemming voor het publiceren van beeld is het zinvol om ook bewust te zijn van het stemgeluid dat in zulke video’s voorkomt.

Kun je horen of een stem door AI is gemaakt?

Dat wordt steeds moeilijker. Kleine haperingen, vreemde intonatie of onnatuurlijke stiltes konden eerder aanwijzingen zijn, maar daarop vertrouwen is niet voldoende. Moderne voice cloning kan toon, ritme en emotie steeds overtuigender nabootsen.

Daarom verschuift de belangrijkste vaardigheid van herkennen naar controleren. Niet: klinkt deze stem echt? Maar: kan ik via een andere route controleren of dit verhaal klopt?

Juist bij een onverwacht verzoek, een noodsituatie of een vraag om geld of gegevens is die extra controle belangrijk. Slachtofferwijzer en Mediawijsheid adviseren daarom onder meer om niet direct te handelen, zelf contact op te nemen met de betreffende persoon en vooraf afspraken te maken over verificatie.

Zo maak je jongeren en ouders weerbaarder tegen voice cloning

Voice cloning vraagt dus niet alleen om technische kennis. Het gaat vooral om gedrag op het moment dat iets overtuigend én dringend klinkt.

  1. Controleer via een tweede kanaal. Krijg je een vreemd telefoontje of spraakbericht? Bel de persoon terug via het nummer dat je zelf al kent.
  2. Laat urgentie geen bewijs zijn. Oplichters gebruiken juist tijdsdruk, paniek en geheimhouding om te voorkomen dat iemand controleert wat er gebeurt.
  3. Spreek thuis een verificatiemethode af. Een familiecodewoord of een persoonlijke controlevraag kan helpen bij onverwachte noodsituaties. Deel zo’n code niet openbaar.
  4. Bespreek ook misbruik onder jongeren. Maak duidelijk dat iemands stem namaken en verspreiden niet zomaar een grappige AI-truc is. De gevolgen voor degene die wordt nagebootst kunnen groot zijn.
  5. Denk na over openbare stemopnames. Niet iedere video hoeft privé, maar bespreek wel dat beeld én geluid kunnen worden opgeslagen, gekopieerd en opnieuw gebruikt.

Voice cloning heeft ook positieve toepassingen

De technologie zelf is niet alleen schadelijk. Voice cloning kan bijvoorbeeld worden ingezet voor mensen die hun stem verliezen door ziekte. Daarnaast kan synthetische spraak helpen bij toegankelijkheid, audioboeken, vertalingen en het produceren van educatief materiaal.

Ook in het onderwijs zijn toepassingen denkbaar. Lesmateriaal kan bijvoorbeeld toegankelijker worden gemaakt met audio of in verschillende talen worden aangeboden. Daarbij blijven toestemming, transparantie en zorgvuldig omgaan met stemgegevens essentieel.

Het verschil zit daarom vooral in wie een stem gebruikt, met welk doel en met welke toestemming.

Een bekende stem is geen verificatiemethode meer

Door de snelle ontwikkeling van AI wordt het onderwerp inmiddels breder. Voice cloning raakt niet alleen aan fraude, maar ook aan privacy, online identiteit, mediawijsheid en hoe leerlingen met elkaar omgaan.

Voor ouders en scholen betekent dit dat een vertrouwde stem niet automatisch bewijs meer is dat je daadwerkelijk met die persoon spreekt. Daarom wordt een andere vaardigheid steeds belangrijker: even stoppen, controleren en via een tweede route bevestigen wat er aan de hand is.

Juist dat is digitale weerbaarheid. Niet ieder AI-fragment zelf kunnen ontmaskeren, maar weten wat je moet doen wanneer je niet zeker weet of iets echt is.