Hvordan Shaip leverte et skalerbart kvalitetsevalueringsprogram for stemmekloning for en AI-taleklient

Fra demokvalitet til klar for utrulling – hvordan strukturert menneskelig evaluering hjalp en AI-taleklient med å tette gapet mellom laboratoriemålinger og ytelse i den virkelige verden.

Stemmekloning

Prosjektoversikt

Stemmekloningsmodeller kan høres imponerende ut i demonstrasjoner, men sliter fortsatt i praksis. Klienten trengte en pålitelig måte å måle om modellen deres faktisk forbedret seg – spesielt for indisk engelsk, som var et prioritert utrullingsmarked.

Shaip ble ansatt for å designe og administrere et menneskelig evalueringsprogram som kunne svare på tre viktige forretningsspørsmål:

  • Høres talen naturlig ut?
  • Høres det fortsatt ut som den originale høyttaleren?
  • Er den trygg og pålitelig nok til bruk i produksjon?

I stedet for å bare stole på automatiserte målinger, brukte prosjektet trente menneskelige anmeldere til å evaluere reelle lydutganger og identifisere hvor modellen fortsatt var til kort.

Kvaliteten på stemmekloning

Viktige datasettmålinger

Bruk sak

Kvalitetsvurdering av stemmekloning

Prosjektets varighet

12 uker

Prøver gjennomgått

12 400 syntetiserte lydklipp

Annotatorer utplassert

48 trente engelskevaluatorer

Utfordringer med å vurdere TTS og stemmekloningskvalitet

  • Modellen måtte fungere godt på tvers av flere engelske aksenter, spesielt indisk engelsk.
  • Lydkvaliteten måtte forbedres på måter som er viktige for sluttbrukerne, ikke bare i laboratoriemålinger.
  • Teamet trengte en tydelig måte å identifisere hva gikk galt i taleutgangen.
  • Lange lydklipp mistet noen ganger den opprinnelige talerens identitet over tid.
  • Klienten trengte også sjekker for sikkerhet, risiko for etterligning og tilstedeværelse av vannmerke.

Løsning: Menneskelig evalueringsrammeverk for AI-talekvalitet

Evalueringsstrategi

Shaip bygde et strukturert rammeverk for vurdering av naturlighet, klarhet, stemmelikhet, konsistens og sikkerhet.

Menneskelig gjennomgang i stor skala

48 trente evaluatorer gjennomgikk 12 400 lydprøver på tvers av indisk engelsk, nøytral amerikansk engelsk og et hinglisk underspor.

Tredelt vurdering

  • Anmelderne vurderte hvor naturlig og forståelig hvert klipp hørtes ut.
  • De sammenlignet par av klipp for å identifisere hvilken versjon som var bedre.
  • De merket tilbakevendende kvalitetsproblemer som unaturlig rytme, tonehøydeproblemer og høyttalerdrift.

Kvalitetskontroll

Shaip brukte kalibreringsoppgaver, gullstandardkontroller, gjentatte gjennomganger og kvalitetssikringsovervåking for å holde poengsummen konsistent og pålitelig.

Handlingsrettet tilbakemeldingssløyfe

Funnene fra hver sprint ble tilbakeført til klientens finjusteringsprosess, noe som bidro til at modellen ble forbedret over flere runder.

Prosjektomfang: Språk, aksenter og anmeldelsesdekning

Område Omfang
Språk Engelsk
Prioriterte aksenter Indisk engelsk , nøytral amerikansk engelsk
Sekundær dekning Britisk engelsk, hinglisk underspor
Eksempeltyper Korte referanseklipp, få eksempler, lang tale
Gjennomgå utdata Kvalitetsvurderinger, preferanseetiketter, problemmerking
Engasjementlengde 12 uker

Resultater: Målbare forbedringer i stemmekloning

  • Klar forbedring i talekvalitet: Modellens samlede kvalitetspoengsum forbedret seg fra 3.41 til 4.12, noe som viser at talen ble mer naturlig og klar for produksjon.
  • Bedre høyttalertilpasning: Systemet ble mye bedre til å bevare den opprinnelige talerens stemme, og forbedret likheten fra 0.71 til 0.87.
  • Færre merkbare feil: Taleproblemer falt fra 31 % av utvalgene ved baseline til 11 % ved den siste sprinten.
  • Sterk forståelighet: Feilraten for endelige ord for indisk engelsk nådde 4.8 %, og slo dermed målterskelen.
  • Sikrere utplasseringsberedskap: Evalueringen bekreftet også sterk ytelse på viktige sikkerhetskontroller, inkludert screening for risiko for identitetstyveri og verifisering av vannmerke.
Viktigst av alt fikk klienten et repeterbart evalueringssystem de ikke bare kunne bruke til å bedømme modellkvaliteten, men til å forbedre den kontinuerlig. Det som startet som et teknisk gjennomgangsprogram ble et praktisk beslutningsverktøy for produktteam, modellteam og interessenter i utrullingen.
Sitat ikon

Shaip hjalp oss med å gjøre subjektiv lydkvalitet om til et målbart forbedringsprogram. Evalueringsrammeverket deres ga oss klare signaler om hva som skulle fikses, hvor vi skulle forbedres og hvordan vi kunne komme nærmere produksjon med trygghet.

— Produktleder for AI-tale

★ ★ ★ ★ ★
Sitat ikon