Alle berichten
7 min lezen

Wat is sprekerdiarisatie? Zo onderscheidt AI stemmen

Je hoort een opname met drie personen. Voor jou als mens is duidelijk wie er spreekt – de stemmen klinken verschillend. Maar hoe leer je een computer hetzelfde te doen?

Het antwoord heet sprekerdiarisatie, ook wel sprekerscheiding genoemd. Deze technologie analyseert een audio-opname en wijst elke passage toe aan de juiste spreker. Zonder haar zou een transcript met meerdere personen één enkele, ongestructureerde muur van tekst zijn.

Sprekerdiarisatie vs. spraakherkenning

Spraakherkenning (ASR) zet gesproken taal om in tekst en beantwoordt „Wat is er gezegd?”. Sprekerdiarisatie wijst audiosegmenten toe aan verschillende personen en beantwoordt „Wie heeft het gezegd?”. Pas de combinatie levert een transcript met sprekertoewijzing op.

Twee begrippen die vaak worden verward:

  • Spraakherkenning (speech-to-text, ASR): Zet gesproken taal om in tekst. Beantwoordt de vraag: Wat is er gezegd?
  • Sprekerdiarisatie: Wijst audiosegmenten toe aan verschillende sprekers. Beantwoordt de vraag: Wie heeft het gezegd?

Pas de combinatie van beide technologieën levert een volledig transcript met sprekertoewijzing op – zoals je dat nodig hebt voor vergadernotulen, interviewtranscripten of rechtszittingen.

Hoe werkt sprekerdiarisatie technisch?

De AI maakt voor elk spraaksegment een wiskundige stemafdruk (embedding) en groepeert vergelijkbare afdrukken via clustering. Segmenten uit dezelfde groep komen van dezelfde spreker. Het proces omvat voorbewerking, spraakactiviteitsdetectie, kenmerkextractie, clustering en labeling.

De AI doorloopt meerdere stappen om sprekers te onderscheiden:

  • Voorbewerking: Achtergrondgeluiden worden verminderd, het volume wordt genormaliseerd en stille passages worden geïdentificeerd.
  • Spraakactiviteitsdetectie (VAD): Het systeem herkent waar er daadwerkelijk wordt gesproken en filtert stilte, muziek of geluiden weg.
  • Kenmerkextractie: Voor elk spraaksegment maakt de AI een stemafdruk – een wiskundige vector die de unieke eigenschappen van een stem weergeeft (toonhoogte, klankkleur, spreekritme).
  • Clustering: Segmenten met vergelijkbare stemafdrukken worden gegroepeerd. Elke groep komt overeen met één spreker.
  • Labeling: De groepen worden van labels voorzien – „Spreker 1”, „Spreker 2” enzovoort.

Typische uitdagingen

Sprekerdiarisatie is geen opgelost probleem. Deze situaties zijn voor de AI bijzonder lastig:

  • Overlappende spraak: Wanneer twee personen tegelijk spreken, kan de AI de stemmen niet zuiver scheiden.
  • Vergelijkbare stemmen: Personen van hetzelfde geslacht en dezelfde leeftijd met een vergelijkbaar accent zijn moeilijker te onderscheiden.
  • Slechte opnamekwaliteit: Achtergrondgeluiden, galm of slechte microfoons verlagen de nauwkeurigheid.
  • Korte uitingen: Bij zeer korte bijdragen heeft de AI minder data voor de stemafdruk.

Waar wordt sprekerdiarisatie ingezet?

  • Vergadernotulen: Automatische toewijzing van bijdragen aan deelnemers – onmisbaar voor het automatisch opstellen van notulen.
  • Interviewtranscriptie: Heldere scheiding tussen interviewer en geïnterviewde.
  • Rechtszittingen: Documentatie van wie welke verklaring heeft afgelegd.
  • Callcenteranalyses: Scheiding van agent en klant voor kwaliteitsanalyses.
  • Podcastproductie: Automatische ondertiteling met sprekertoewijzing.

Tips voor betere resultaten

  • Gebruik een goede microfoon en minimaliseer achtergrondgeluiden.
  • Vraag de deelnemers om niet door elkaar te praten.
  • Gebruik een tool met ruisonderdrukking dat de audiokwaliteit vóór de analyse verbetert.
  • Hernoem de sprekers na de transcriptie – de AI kent alleen nummers toe, geen namen.

Conclusie

Sprekerdiarisatie is de technologie die van een ruw audiotranscript een gestructureerd document maakt. Zonder haar zou elk transcript met meerdere personen onbruikbaar zijn. De combinatie van spraakherkenning, sprekerdiarisatie en handmatige nabewerking levert de beste resultaten – snel, nauwkeurig en voor iedereen navolgbaar.

Wat is sprekerdiarisatie? Zo onderscheidt AI stemmen