Hvordan Shaip leverte et skalerbart kvalitetsevalueringsprogram for stemmekloning for en AI-taleklient
Fra demokvalitet til klar for utrulling – hvordan strukturert menneskelig evaluering hjalp en AI-taleklient med å tette gapet mellom laboratoriemålinger og ytelse i den virkelige verden.
Prosjektoversikt
Stemmekloningsmodeller kan høres imponerende ut i demonstrasjoner, men sliter fortsatt i praksis. Klienten trengte en pålitelig måte å måle om modellen deres faktisk forbedret seg – spesielt for indisk engelsk, som var et prioritert utrullingsmarked.
Shaip ble ansatt for å designe og administrere et menneskelig evalueringsprogram som kunne svare på tre viktige forretningsspørsmål:
- Høres talen naturlig ut?
- Høres det fortsatt ut som den originale høyttaleren?
- Er den trygg og pålitelig nok til bruk i produksjon?
I stedet for å bare stole på automatiserte målinger, brukte prosjektet trente menneskelige anmeldere til å evaluere reelle lydutganger og identifisere hvor modellen fortsatt var til kort.
Viktige datasettmålinger
Bruk sak
Kvalitetsvurdering av stemmekloning
Prosjektets varighet
12 uker
Prøver gjennomgått
12 400 syntetiserte lydklipp
Annotatorer utplassert
48 trente engelskevaluatorer
Utfordringer med å vurdere TTS og stemmekloningskvalitet
- Modellen måtte fungere godt på tvers av flere engelske aksenter, spesielt indisk engelsk.
- Lydkvaliteten måtte forbedres på måter som er viktige for sluttbrukerne, ikke bare i laboratoriemålinger.
- Teamet trengte en tydelig måte å identifisere hva gikk galt i taleutgangen.
- Lange lydklipp mistet noen ganger den opprinnelige talerens identitet over tid.
- Klienten trengte også sjekker for sikkerhet, risiko for etterligning og tilstedeværelse av vannmerke.
Løsning: Menneskelig evalueringsrammeverk for AI-talekvalitet
Evalueringsstrategi
Shaip bygde et strukturert rammeverk for vurdering av naturlighet, klarhet, stemmelikhet, konsistens og sikkerhet.
Menneskelig gjennomgang i stor skala
48 trente evaluatorer gjennomgikk 12 400 lydprøver på tvers av indisk engelsk, nøytral amerikansk engelsk og et hinglisk underspor.
Tredelt vurdering
- Anmelderne vurderte hvor naturlig og forståelig hvert klipp hørtes ut.
- De sammenlignet par av klipp for å identifisere hvilken versjon som var bedre.
- De merket tilbakevendende kvalitetsproblemer som unaturlig rytme, tonehøydeproblemer og høyttalerdrift.
Kvalitetskontroll
Shaip brukte kalibreringsoppgaver, gullstandardkontroller, gjentatte gjennomganger og kvalitetssikringsovervåking for å holde poengsummen konsistent og pålitelig.
Handlingsrettet tilbakemeldingssløyfe
Funnene fra hver sprint ble tilbakeført til klientens finjusteringsprosess, noe som bidro til at modellen ble forbedret over flere runder.
Prosjektomfang: Språk, aksenter og anmeldelsesdekning
| Område | Omfang |
|---|---|
| Språk | Engelsk |
| Prioriterte aksenter | Indisk engelsk , nøytral amerikansk engelsk |
| Sekundær dekning | Britisk engelsk, hinglisk underspor |
| Eksempeltyper | Korte referanseklipp, få eksempler, lang tale |
| Gjennomgå utdata | Kvalitetsvurderinger, preferanseetiketter, problemmerking |
| Engasjementlengde | 12 uker |
Resultater: Målbare forbedringer i stemmekloning
- Klar forbedring i talekvalitet: Modellens samlede kvalitetspoengsum forbedret seg fra 3.41 til 4.12, noe som viser at talen ble mer naturlig og klar for produksjon.
- Bedre høyttalertilpasning: Systemet ble mye bedre til å bevare den opprinnelige talerens stemme, og forbedret likheten fra 0.71 til 0.87.
- Færre merkbare feil: Taleproblemer falt fra 31 % av utvalgene ved baseline til 11 % ved den siste sprinten.
- Sterk forståelighet: Feilraten for endelige ord for indisk engelsk nådde 4.8 %, og slo dermed målterskelen.
- Sikrere utplasseringsberedskap: Evalueringen bekreftet også sterk ytelse på viktige sikkerhetskontroller, inkludert screening for risiko for identitetstyveri og verifisering av vannmerke.
Shaip hjalp oss med å gjøre subjektiv lydkvalitet om til et målbart forbedringsprogram. Evalueringsrammeverket deres ga oss klare signaler om hva som skulle fikses, hvor vi skulle forbedres og hvordan vi kunne komme nærmere produksjon med trygghet.
— Produktleder for AI-tale