Tale Følelses- og følelsesanalyse
Aktiverer smartere kundesentre med AI-drevet innsikt
Utnytte Shaips ekspertise innen lyddatainnsamling og merknader for å forbedre sanntidsfølelse og sentimentdeteksjon for forbedret kundeservice.
Automatisert talefølelse og sentimentanalyse
Kunden inngikk samarbeid med Shaip for å utvikle en automatisert talefølelses- og sentimentanalysemodell for kundesentre. Prosjektet innebar å samle inn og kommentere 250 timer med callsenter-lyddata på tvers av fire engelske dialekter – USA, Storbritannia, australsk og indisk. Dette gjorde det mulig for klienten å forbedre AI-modellene sine for å oppdage følelser som glad, nøytral og sint, og følelser som misfornøyd og fornøyd i sanntids kundeinteraksjoner.
Prosjektet overvant utfordringer som sarkasmedeteksjon, varierende lydlengder og subtile verbale signaler om misnøye, og leverte presise og skalerbare resultater.
Nøkkeltall
Call center-lyddata samlet inn og kommentert på tvers av 4 engelske dialekter
250 Hrs
Antall språk
amerikansk engelsk, britisk engelsk, australsk engelsk og indisk engelsk
Brukstilfeller
Automatisert talefølelse og sentimentanalyse
Prosjektomfang
Samle og kommentere 250 timer med lyddata fra kundesenteret på fire engelske dialekter:
- amerikansk engelsk (30 %)
- britisk engelsk (30 %)
- australsk engelsk (20 %)
- indisk engelsk (20 %)
I omfang
Prosjektet består av tre deler:
- Lyddata med spesifikke enheter, inkludert metadata.
- Tilsvarende transkriberte filer med segmentering og tidsstemplingsdetaljer.
- Kommentarer om følelser og følelser:
- Lydfølelse: Glad, nøytral, sint
- Transkripsjonsfølelse: Ekstremt misfornøyd, misfornøyd, nøytral, fornøyd, ekstremt fornøyd
Utfordringer
Mangfold av dialekter
Det kan være utfordrende å sikre at lyddataene representerer dialektene som er spesifisert (USA, Storbritannia, Australia og indisk) nøyaktig. Ulike regioner innenfor disse kategoriene kan bruke variert ordforråd, aksenter og uttale.
Kompetansekrav
Å kommentere lyd og transkripsjoner for følelser og følelser krever trente kommentatorer som er kjent med de kulturelle nyansene og språklige finessene til hver dialekt.
Kompleksiteten til følelser og følelser
Lydfølelser og transkripsjonsstemninger stemmer ikke alltid overens. For eksempel kan en person høres sint ut, men faktisk uttrykke tilfredshet. For eksempel, håndtering av sarkasmesamtaler i sarkastiske setninger som "Å, herlig, en annen person som ikke kan løse problemet mitt" må være korrekt kommentert for følelser og følelser.
Lydkvalitet
Kvaliteten på lydopptakene kan variere, noe som påvirker transkripsjonsnøyaktigheten og følelsesdeteksjon. Bakgrunnsstøy, overlappende samtaler og varierende opptaksutstyr kan utgjøre betydelige utfordringer.
Nøyaktig fanger
Misnøye gjennom verbale signaler som tunge utåndinger eller andre tegn på frustrasjon.
Oppløsning
Ved å utnytte avanserte teknikker for naturlig språkbehandling (NLP) ble følgende løsninger implementert:
Innsamling av data
- 250 timer med lyddata delt inn i dialektspesifikke kvoter.
- amerikansk engelsk (30 % eller 75 timer)
- engelsk engelsk (30 % eller 75 timer)
- Australsk engelsk (20 % eller 50 timer)
- Indisk engelsk (20 % eller 50 timer)
- Innfødte aksentbrukere fra USA, Storbritannia, Australia og India.
- Taleprøver som inneholder varierende toner, med spesielt fokus på tilfeller der stemmefølelsen er sint og tekstfølelsen er misfornøyd eller ekstremt misfornøyd.
Tekstklassifisering/merknad
- Annotering av følelser og følelser basert på spesifikke kategorier:
- Lydfølelse: Glad, nøytral, sint.
- Transkripsjonsfølelse: Ekstremt misfornøyd, misfornøyd, nøytral, fornøyd, ekstremt fornøyd.
- Hvert lydsegment inneholdt bare én primær følelse.
- Varierende forsinkelsessegmenter (fra 2 til 30 sekunder) brukt i samtaler.
- Transkripsjonsformatet fulgte JSON-utdata, inkludert venstre og høyre høyttalerinformasjon, sentiment-tagger og sentiment i det siste segmentet.
Kvalitetssikring:
Transkripsjonsnøyaktighet:
- Sørget for at 250 timer med lyd ble levert med minimum:
- 90 % nøyaktighet for transkripsjonsfeilfrekvens (TER).
- 95 % Word Recognition Rate (WER) nøyaktighet.
QA-prosess:
- Det ble gjennomført regelmessige revisjoner av tilfeldig utvalgte utvalg fra datasettet.
- Brukte automatiserte verktøy for å måle TER og WER på tvers av datasettet.
- Manuell gjennomgang av flaggede seksjoner sørget for at nøyaktighetsterskler ble oppfylt.
Utfallet
Treningsdataene vil støtte utviklingen av en automatisert følelses- og sentimentdeteksjonsmodell, som leverer:
- Sanntidsfølelsesdeteksjon i samtalesenterinteraksjoner.
- Mer effektiv håndtering av komplekse saker, som sarkasme eller misnøye.
- Skalerbarhet for fremtidige prosjekter, enkel tilpasning til økte datamengder og flere språk.
leveransen
- 250 timer med lydfiler (i 8 kHz PCM WAV-format, mono)
- Transkripsjonsfiler (med segmentering, sentiment-tagger og høyttaleridentifikatorer)
- Metadata (lydvarighet, høyttalerdetaljer osv.)
Samarbeidet med Shaip for vårt callsenterdataprosjekt har vært et avgjørende øyeblikk i utviklingen av våre AI-løsninger. Teamet deres samlet inn og kommenterte 250 timer med lyddata på tvers av fire viktige engelske dialekter – amerikansk, britisk, australsk og indisk – og sikret dermed høyeste kvalitet og presisjon. Fokuset på språklige nyanser i disse regionene forbedret nøyaktigheten til talegjenkjenningsmodellene våre betydelig. I tillegg har Shaips ekspertise i håndtering av komplekse dataannoteringsprosjekter vært avgjørende for å hjelpe oss med å bygge pålitelige og kompatible modeller i stor skala.

