Uddannelse

Kan Whisper finde på transskriptioner? Hvorfor AI-transskription finder på ting

af LoudSpeaker Marketing 13 min læsning
I denne artikel

Du har netop transskriberet en konsultation med en kritisk patient, en vidneforklaring eller timevis af forskningsinterviews – kun for at opdage, at AI-transskriberingsværktøjet har indsat ord, sætninger eller hele afsnit, der aldrig blev sagt. Dette er en dokumenteret fejlfunktion, der kaldes »transskriberingshallucination«, og den kan medføre alvorlige problemer, når transskriptionerne anvendes uden at blive kontrolleret.

I en undersøgelse fra 2024 af 13.140 korte lydklip på engelsk identificerede forskerne hallucinerede sætninger eller udtryk i 1.4% af de segmenter, der blev behandlet under undersøgelsens testbetingelser. Denne værdi bør ikke betragtes som universel: Resultaterne kan variere betydeligt afhængigt af modelversion, lyd, sprog, talergruppe samt indstillinger for segmentering og afkodning. Undersøgelsen viser dog, hvorfor teams, der stoler på automatiseret transskription Arbejde med store konsekvenser kræver pålidelige gennemgangsprocesser og adgang til den oprindelige optagelse.

Konsekvenserne rækker ud over almindelige transskriptionsfejl. Forskerne fandt eksempler på voldeligt sprog, unøjagtige racemæssige associationer, opdigtede personoplysninger og ikke-eksisterende medicinske behandlinger.

Vigtige pointer

  • I en undersøgelse genererede Whisper hallucinerede sætninger eller udtryk i 1,41 TP5T ud af 13.140 testede korte lydklip
  • Forskerne klassificerede 38% af de identificerede hallucinationer som indeholdende eksplicitte skadelige elementer, herunder voldeligt sprog, unøjagtige sammenhænge, opdigtede personoplysninger eller falsk autoritet
  • En efterfølgende sammenligning viste, at fem andre tale-til-tekst-tjenester ikke gengav tilsvarende fejlagtige passager i de 187 testede eksempler, selvom dette resultat ikke beviser, at disse tjenester aldrig laver fejl
  • Stilhed, lange pauser, baggrundslyde og andre intervaller uden tale forbindes ofte med »Whisper«-hallucinationer
  • I undersøgelsens datasæt forekom hallucinationer oftere i segmenter fra talere med afasi end i kontrolsegmenterne, hvilket rejser spørgsmål om raising-tilgængelighed og fairness
  • Detektion af stemmeaktivitet og andre filtreringsmetoder, der ikke er baseret på tale, kan mindske hallucinationer i visse Whisper-arbejdsgange, men deres effektivitet afhænger af modellen, lydkilden og konfigurationen
  • De oprindelige optagelser bør forblive tilgængelige, indtil de vigtige transskriptioner er blevet gennemgået og godkendt
  • Man bør ikke gå ud fra, at et automatiseret transskriptionssystem er fejlfrit, især ikke inden for sundhedssektoren, retsvæsenet, arbejdslivet eller forskningsmiljøer

Sådan fungerer AI-transskription: Hvordan tale bliver til tekst

Moderne AI-transskription bygger på neurale netværk, der er trænet på store lyddatasæt, og som omdanner talt sprog til skriftlig tekst. Teknologien har revolutioneret den måde, fagfolk arbejder med lydindhold på, idet den omdanner optagelser til søgbar tekst langt hurtigere end manuel transskription.

Forskellige systemer anvender forskellige arkitekturer, men processen omfatter som regel flere trin:

  • Lydbehandling: Rå lyd konverteres til en repræsentation, f.eks. et spektrogram
  • Talegenkendelse: En model identificerer mønstre i lyddataene og knytter dem til tekstenheder
  • Sekvensafkodning: Systemet vælger en sandsynlig rækkefølge af ord på baggrund af både lydindholdet og de mønstre, der er indlært under træningen
  • Efterbehandling: Der kan tilføjes tegnsætning, tidsangivelser, talerbetegnelser og formatering

Disse systemer kan fungere godt med tydelig lyd, men nøjagtigheden afhænger af optagelseskvaliteten, accenter, overlappende tale, fagudtryk, baggrundsstøj og i hvor høj grad lyden ligner modellens træningsdata.

Hvad er AI-hallucinationer i forbindelse med transskription?

AI-hallucinationer i transskription opstår, når et tale-til-tekst-system genererer tekst, der ikke har noget meningsfuldt grundlag i kildelyden. Dette adskiller sig fra en almindelig erstatning, såsom at transskribere “kat” som “hat”. En hallucination kan indføre en hel sætning eller et helt udtryk, der aldrig blev sagt.

Forskere, der analyserede 13.140 lydsegmenter, identificerede 187 hallucinationer. De klassificerede 38% af disse hallucinerede passager som indeholdende eksplicitte trusler, herunder:

  • Voldeligt sprog: Indsættelse af voldelige udtalelser i en ellers harmløs tale
  • Forkerte sammenhænge: At tilføje karakteristika som f.eks. race, som taleren aldrig har nævnt
  • Medicinske opdigtelser: At finde på ikke-eksisterende behandlinger eller navne på lægemidler
  • Falsk autoritet: Indsættelse af tekst, der ligner et citat, en billedtekst eller en autoritativ udtalelse

Disse eksempler er bekymrende, fordi den opdigtede tekst kan virke flydende og troværdig, hvilket gør det svært at opdage fejlen, medmindre man sammenligner transskriptionen med lydkilden.

I en separat undersøgelse fra 2025 blev Whisper bevidst fodret med lyde, der ikke var tale, for at undersøge, hvornår modellen genererer tekst uden taleinput. Forskerne observerede tilbagevendende sætninger som “tak” og “tak for at se med”. De foreslog, at disse mønstre muligvis afspejler det sprog, der er almindeligt forekommende i de webbaserede medier, der blev anvendt under modellens træning. Da eksperimenterne fokuserede på filer uden tale, bør deres procenttal ikke fortolkes som forventede hallucinationsrater for almindelige samtaler eller interviews.

Hvorfor AI-transkriptionsmodeller som Whisper »hallucinerer«

OpenAI beskriver Whisper som en Transformer-model af typen encoder-decoder. Lyd konverteres til et log-Mel-spektrogram og behandles af en lydencoder, mens en decoder genererer de tilhørende teksttokens.

Da modellen genererer tekst sekventielt, kan den undertiden producere flydende output, der ikke er tilstrækkeligt forankret i den akustiske indgang. Forskere og udviklere har observeret, at denne adfærd især er sandsynlig i forbindelse med:

  • Stilhed og lange pauser: Lange intervaller uden tale kan medføre, at dekoderen kun har svage akustiske holdepunkter
  • Lyd uden tale: Musik, baggrundslyde og omgivende støj kan undertiden udløse tekstgenerering
  • Dårlig optagekvalitet: Forvrængning, lav lydstyrke, clipping eller kraftig baggrundsstøj gør det sværere at forstå talesignalet
  • Taleforstyrrelser: Stammen, tøven, usammenhængende tale og lange pauser kan gøre det sværere at forstå, hvad der siges
  • Indstillinger for segmentering og afkodning: Stykkelængde, tærskelværdier, prompter og andre implementeringsvalg kan påvirke resultatet

OpenAI oplyste, at det oprindelige Whisper-system blev trænet på 680.000 timers flersproget og multitask-overvåget lydmateriale indsamlet fra internettet. Det omfattende datasæt bidrager til modellens fleksibilitet, men træningsmateriale fra internettet kan også udsætte systemet for gentagne undertekst- og videosprogmønstre.

Forskerne har ikke fastslået en enkelt årsag til alle hallucinationer. De foreliggende beviser tyder på, at hallucinationer opstår som følge af et samspil mellem lydforhold, modelarkitektur, træningsdata og afkodningsvalg.

Hallucinationers indvirkning på transskriptionens nøjagtighed

For fagfolk inden for sundhedssektoren, juridiske tjenester, forskning og medier kan en opdigtet sætning have større konsekvenser end en almindelig stavefejl.

Konsekvenser for sundhedsvæsenet

I oktober 2024 rapporterede Associated Press, at Nablás Whisper-baserede produkt til klinisk dokumentation blev anvendt af mere end 30.000 sundhedspersoner i 40 sundhedssystemer. Nabla oplyste desuden, at produktet havde behandlet anslået syv millioner lægebesøg.

AP rapporterede, at Nabla slettede den oprindelige lydoptagelse efter behandlingen af hensyn til datasikkerheden. Nablas said-klinikere var forpligtet til at gennemgå og godkende de genererede noter. Dette eksempel illustrerer en vigtig modsætning: Sletning af optagelser kan mindske visse risici for opbevaring, men det kan også forhindre en senere sammenligning med den oprindelige samtale.

OpenAI har advaret mod at stole på resultater fra talegenkendelse i beslutningssammenhænge, hvor unøjagtigheder kan få alvorlige konsekvenser. Sundhedsorganisationer bør derfor kræve, at resultaterne gennemgås af klinisk personale, fastlægge klare retningslinjer for opbevaring og verifikation samt anvende tjenester, der er omfattet af passende beskyttelsesforanstaltninger vedrørende privatlivets fred og kontraktmæssige garantier.

I juridisk arbejde kan indhold i et fabrikeret referat påvirke forberedelsen til vidneforklaringer, sagsanalysen eller gennemgangen af bevismaterialet. Et automatisk udkast bør ikke betragtes som et officielt dokument uden den gennemgang og godkendelse, der kræves i henhold til gældende retspraksis, jurisdiktion eller faglige regler.

Forskningshold står over for en tilsvarende risiko. Hvis et opdigtet citat indgår i den kvalitative kodning eller den tematiske analyse, kan det påvirke resultaterne og underminere undersøgelsens troværdighed. Forskere bør opbevare kildeoptagelserne, dokumentere deres transskriberingsproces og kontrollere de citater, der anvendes i rapporter eller publikationer.

Den Cornell-ledede undersøgelse påviste desuden en forskel mellem datasættene vedrørende afasi og kontrolgruppen. Hallucinationer forekom i 1,71 TP5T segmenter fra talere med afasi og 1,2% kontrolsegmenter. Forskerne tilskrev forskellen længere varigheder af ikke-vokale segmenter. Dette beviser ikke, at alle personer med en taleforstyrrelse vil opleve den samme forskel, men det rejser bekymringer om tilgængelighed og retfærdighed for organisationer, der anvender automatiserede transskriptioner i vigtige sammenhænge.

Bedste praksis til minimering af »hallucinationer« ved AI-transskription

Ingen metode til fejlreduktion kan garantere en fejlfri transskription. Der findes dog en række fremgangsmåder, der kan mindske risikoen og gøre det lettere at opdage fejl.

Tekniske afbødende foranstaltninger

  • Forbehandling af stemmeaktivitetsdetektering: Hvis man fjerner eller adskiller intervaller uden tale inden transskriptionen, kan det mindske risikoen for, at en model genererer tekst i perioder med stilhed
  • Omhyggelig segmentering: Behandl lyd i segmenter, der passer til den valgte model, i stedet for at anvende vilkårlige regler for varighed
  • Konservative afkodningsindstillinger: Gennemgå dokumentationen for den specifikke Whisper-implementering, og test indstillingerne med against som repræsentativ lyd
  • Kontrol af gentagelser og afvigelser: Marker gentagne sætninger, pludselige emneskift, afslutninger i videostil eller usædvanligt flydende tekst under pauser
  • Evaluering med versionsstyring: Test arbejdsgangene igen, når der foretages ændringer i modeller, sprogindstillinger, prompter, forbehandling eller afkodningsbiblioteker

I en undersøgelse fra 2025 blev der også afprøvet en efterbehandlingsmetode kaldet “bag of hallucinations”, som filtrerede tilbagevendende resultater fra eksperimenter uden tale. Metoden reducerede fejl under disse kontrollerede forhold, men den bør ikke betragtes som en generel erstatning for gennemgang af kilde-lyden.

Bedste praksis for arbejdsgange

  • Maintain kildelyd: Opbevaring af optagelser skal være mulig, indtil transskriptionen er blevet verificeret, under forbehold af samtykke, privatlivsbeskyttelse, opbevaringskrav og lovmæssige krav
  • Indfør manuel gennemgang: Der skal foretages en gennemgang, inden karakterudskrifter med stor betydning får indflydelse på behandlingen, juridiske afgørelser, ansættelser, forskningsresultater eller publikationer
  • Prioriter strækninger med høj risiko: Gennemgå afsnit, der indeholder tal, medicin, navne, datoer, citater, juridiske udtryk eller lange pauser
  • Train-hold om advarselsskilte: Vær opmærksom på gentagne sætninger, uventet indhold, pludselige stilændringer eller ord, der dukker op i stilheden
  • Ansvar for dokumentet: Gør det klart, hvem der skal gennemgå, godkende, rette og retain hvert eksamensbevis

Valg af pålidelig AI-transskriptionssoftware

Den Cornell-ledede undersøgelse tyder på, at de hallucinationer, der blev identificeret, ikke blev gengivet ensartet på tværs af alle tale-til-tekst-tjenester. Da forskerne testede de 187 eksempler på »Whisper-hallucinationer« med Google Cloud Speech-to-Text, Microsoft Azure Speech-to-Text, Amazon Transcribe, AssemblyAI og Rev AI, frembragte disse systemer ikke tilsvarende hallucinerede passager i det pågældende eksperiment.

Dette er en nyttig konklusion, men det er ikke et bevis på, at en tjeneste ikke kan udvise hallucinationer. Sammenligningen var begrænset til bestemte stikprøver, tjenesteversioner og konfigurationer.

Ved vurderingen af Transskriptionssoftware, overvej følgende:

  • Adgang til kildelyd: Kan korrekturlæserne afspille optagelsen sideløbende med transskriptionen?
  • Gennemgå effektiviteten: Er ordene knyttet til tidsstempler, så de hurtigt kan verificeres?
  • Højttalerværktøjer: Kan brugerne identificere og rette talerbetegnelser?
  • Terminologikontrol: Kan holdene tilføje navne, forkortelser og fagudtryk?
  • Sikkerhedsdokumentation: Dokumenterer udbyderen tydeligt kryptering, adgangskontrol, revisioner, dataplacering og opbevaringsperioder?
  • Kontraktmæssig egnethed: Findes der egnede aftaler for regulerede eller fortrolige data?
  • Eksport- og revisionsindstillinger: Kan teams gemme korrigerede versioner og dokumentgodkendelser?
  • Repræsentativ testning: Er tjenesten blevet testet med organisationens faktiske sprog, accenter, mikrofoner og omgivelser?

Prisen alene afgør ikke, om et system vil give forvrængede resultater. Arkitektur, implementering, lydkvalitet, gennemgangsfunktioner og betjeningsknapper spiller alle en rolle.

Udnyttelse af avancerede funktioner til forbedret transskriptionskvalitet

Funktioner i forbindelse med transskriptionsmodellen kan gøre det lettere at identificere og rette fejl.

Redigerings- og korrekturværktøjer

  • Tidskoder på ordniveau: Knyt transskriptionsteksten til det tilsvarende tidspunkt i optagelsen
  • Synkroniseret afspilning: Lad korrekturlæserne lytte, mens de læser eller redigerer
  • Identifikation af højttaler: Adskil højttalerne, og gør det muligt at rette etiketterne
  • Redigering direkte i browseren: Aktivér rettelser uden at flytte indholdet over i et separat program
  • Brugerdefinerede ordbøger: Giv brugerne mulighed for at tilføje egennavne, fagudtryk, forkortelser og foretrukne stavemåder

Analyse og indsigt

AI-analyseværktøjer kan udtrække temaer, resuméer, kapitler, emner, stemning eller nøglemomenter fra transskriptioner. Disse resultater afhænger af den underliggende transskription. Teams bør rette vigtige transskriptionsfejl, inden de baserer sig på den efterfølgende analyse, især når resultaterne skal danne grundlag for forskning, rapportering eller forretningsmæssige beslutninger.

Funktioner for samarbejde

Fælles arbejdsområder, tilladelser, kommentarfunktioner og arbejdsgange for gennemgang kan hjælpe teams med at fordele ansvaret og undgå forvirring omkring forskellige versioner. Samarbejdsfunktionerne er mest værdifulde, når en organisation også fastlægger, hvem der har ansvaret for at godkende den endelige tekst.

Sikker og regeloverholdende AI-transskription af følsomme data

Sikkerhed og overholdelse af regler kræver mere end blot et certificeringslogo. Organisationer bør vurdere tjenesten, den valgte pakke, kontraktvilkårene, konfigurationen og den tilsigtede anvendelse.

NHS Englands registreringsproces for leverandører af stemmeoptagelsesudstyr kræver, at de deltagende leverandører fremlægger dokumentation for, at deres udstyr er klassificeret som medicinsk udstyr i klasse I, samt en aktuel vurdering i henhold til kriterierne for vurdering af digital teknologi (Digital Technology Assessment Criteria). Dette er et udtryk for en stigende kontrol med værktøjer til klinisk dokumentation, men det bør ikke fortolkes som en universel regel, der gælder på samme måde for alle transskriptionsprodukter i alle NHS-miljøer.

Sikkerhedsfunktioner, der skal undersøges, omfatter:

  • Uafhængige kontrolrevisioner, såsom SOC 2 Type II
  • Kryptering under overførsel og i opbevaring
  • Rollebaseret adgangskontrol
  • Multifaktor-godkendelse og identitetsløsninger til virksomheder
  • Oplysninger om dataplacering og opbevaringsperiode
  • Sletning og eksportkontrol
  • Samarbejdsaftaler eller andre relevante kontraktmæssige sikkerhedsforanstaltninger, når det er nødvendigt

Organisationer bør undersøge det nøjagtige omfang af hver enkelt certificering og afgøre, om den finder anvendelse på den tjeneste, den plan og det anvendelsestilfælde, de har til hensigt at implementere.

Hvorfor Sonix understøtter verificerbare AI-transskriberingsworkflows

For teams, der har brug for at gennemgå og administrere udskrifter effektivt, Sonix kombinerer automatisk transskription med værktøjer til at kontrollere resultatet i forhold til kildeoptagelsen.

Sonix’ nuværende funktioner omfatter:

  • En browserbaseret editor med synkroniseret afspilning, søgefunktion, navigation på ordniveau og mærkning af talere
  • Brugerdefinerede ordbøger, hvor brugerne kan tilføje navne, fagudtryk, forkortelser og foretrukne stavemåder
  • SOC 2 Type II-certificering, TLS-kryptering under overførsel og AES-256-kryptering i hvile
  • HIPAA-baserede sikkerhedsforanstaltninger via Medical Sonix, herunder samarbejdsaftaler (Business Associate Agreements) for berettigede sundhedsorganisationer
  • Transskriptionsstøtte til mere end 54 sprog
  • AI-drevet analyse til resuméer, kapitler, temaer, stemning og andre indsigter baseret på transskriptioner
  • Indstillinger for teamsamarbejde, herunder arbejdsområder, tilladelser og delingsfunktioner

Disse kontrolfunktioner hjælper brugerne med at opdage og rette fejl, men de fjerner ikke behovet for gennemgang. Man bør ikke gå ud fra, at en automatisk transskription gengiver hvert eneste talte ord perfekt uden efterkontrol.

Uanset om du er en analysebureau analyse af interviews, a nyhedsredaktion at arbejde med against-frister eller en virksomhed For et team, der håndterer store mængder optagelser, er den sikreste arbejdsgang en, hvor transskriptionen forbliver knyttet til den oprindelige lydfil, og hvor der fastlægges et klart ansvar for godkendelsen.

Endelig konklusion: Sådan vælger du den rigtige transskriptionsløsning til dine behov

Valget mellem en selvadministreret Whisper-arbejdsgang og en hostet transskriptionsplatform afhænger af tekniske ressourcer, datakrav, behov for gennemgang og risikotolerance.

En selvstyret Whisper-arbejdsgang kan være hensigtsmæssig, når:

  • Indholdet indebærer lav risiko, og lejlighedsvise fejl kan accepteres
  • Organisationen kan afprøve forskellige modelversioner samt indstillinger for forbehandling, segmentering og afkodning
  • Det tekniske personale kan iværksætte overvågning og afbødende foranstaltninger
  • Kildeoptagelser remain available til verifikation
  • En kvalificeret person gennemgår vigtige resultater inden brug

En administreret transskriptionsplatform kan være at foretrække, når du har brug for:

  • Et synkroniseret redigeringsprogram til sammenligning af tekst med lydkilden
  • Højttaler, tidsstempel, terminologi og korrekturværktøjer
  • Fælles arbejdsområder og tilladelser
  • Dokumenterede sikkerheds- og privatlivsforanstaltninger
  • Understøttelse af flere sprog og eksportformater
  • En arbejdsgang, der gør det muligt for ikke-tekniske korrekturlæsere at godkende transskriptioner på en effektiv måde

Inden for sundhedssektoren, retsvæsenet, forskning, journalistik og andre områder med store konsekvenser er det afgørende spørgsmål ikke, om en leverandør lover fuldstændig nøjagtighed. Det handler derimod om, hvorvidt systemet gør fejlene synlige, bevarer det bevismateriale, der er nødvendigt for at rette dem, og understøtter en gennemgangsproces, der står i rimeligt forhold til konsekvenserne af en fejl i transskriptionen.

Ofte stillede spørgsmål

Hvad er AI-hallucinationer i transskription?

AI-hallucinationer i transskription opstår, når et tale-til-tekst-system genererer et ord, en sætning eller en sætning, der ikke har noget meningsfuldt grundlag i kildeoptagelsen. I modsætning til en almindelig erstatning kan en hallucination indføre helt nyt indhold. I en undersøgelse af 13.140 korte lydsegmenter identificerede forskerne 187 hallucinationer og klassificerede 381 af dem som indeholdende eksplicitte skadelige elementer, såsom voldeligt sprog, unøjagtige sammenhænge, opdigtede oplysninger eller falsk autoritet.

Hvorfor finder Whisper AI nogle gange på ord eller sætninger?

Whisper er en Transformer-baseret encoder-decoder, der genererer teksttokens på baggrund af lyd. Når de akustiske signaler er svage – f.eks. under stilhed, lange pauser, baggrundsstøj, musik eller fragmenteret tale – kan dekoderen undertiden generere flydende tekst, der ikke er tilstrækkeligt forankret i optagelsen. Træningsdata, segmentering, prompts, modelversion og afkodningsindstillinger kan også påvirke resultatet.

Hvordan kan jeg mindske fejl i AI-genererede transskriptioner?

Brug stemmeaktivitetsdetektering eller anden filtrering af ikke-tale, hvor det er relevant, test segmenterings- og afkodningsindstillingerne på repræsentative optagelser, markér mistænkelige gentagelser eller tekst, der vises under stilhed, retain den originale lyd, og kræv manuel gennemgang af indhold med betydningsfulde konsekvenser. Afbødende foranstaltninger kan mindske risikoen, men ingen forbehandlingsmetode garanterer en fejlfri transskription.

Er gratis AI-transskriberingsværktøjer mere tilbøjelige til at lave fejl?

Ikke nødvendigvis. Risikoen for fejl afhænger ikke udelukkende af prisen. Den afhænger af modellen, arkitekturen, implementeringen, lydforholdene og de kvalitetskontroller, der omgiver systemet. Paid-platforme kan tilbyde bedre funktioner inden for gennemgang, sikkerhed, samarbejde og revision, men brugerne bør vurdere disse funktioner direkte i stedet for at antage, at prisen garanterer nøjagtighed.

Tager Sonix højde for »hallucinationer« i AI-transskriptioner?

Sonix tilbyder en browserbaseret editor, der er synkroniseret med kildeoptagelsen, navigation på ordniveau, værktøjer til taleridentifikation, brugerdefinerede ordbøger samt funktioner til samarbejdsbaseret gennemgang. Disse funktioner hjælper brugerne med at identificere og rette transskriptionsfejl. De bør betragtes som sikkerhedsforanstaltninger til verifikation snarere end som bevis for, at en automatiseret transskription ikke kan begå fejl, især når indholdet vil have indflydelse på beslutninger inden for sundhedsvæsenet, jura, forskning eller andre områder, hvor der står meget på spil.

Få præcis transskription på få minutter

Begynd at transskribere smartere. Prøv Sonix gratis, eller udforsk vores priser for at finde det rigtige abonnement til dig.