Tale Følelses- og følelsesanalyse

Aktiverer smartere kundesentre med AI-drevet innsikt

Utnytte Shaips ekspertise innen lyddatainnsamling og merknader for å forbedre sanntidsfølelse og sentimentdeteksjon for forbedret kundeservice.

Talefølelse og sentimentanalyse

Automatisert talefølelse og sentimentanalyse

Kunden inngikk samarbeid med Shaip for å utvikle en automatisert talefølelses- og sentimentanalysemodell for kundesentre. Prosjektet innebar å samle inn og kommentere 250 timer med callsenter-lyddata på tvers av fire engelske dialekter – USA, Storbritannia, australsk og indisk. Dette gjorde det mulig for klienten å forbedre AI-modellene sine for å oppdage følelser som glad, nøytral og sint, og følelser som misfornøyd og fornøyd i sanntids kundeinteraksjoner.

Prosjektet overvant utfordringer som sarkasmedeteksjon, varierende lydlengder og subtile verbale signaler om misnøye, og leverte presise og skalerbare resultater.

Automatisert talefølelse og sentimentanalyse

Nøkkeltall

Call center-lyddata samlet inn og kommentert på tvers av 4 engelske dialekter

250 Hrs

Antall språk

amerikansk engelsk, britisk engelsk, australsk engelsk og indisk engelsk

Brukstilfeller

Automatisert talefølelse og sentimentanalyse

Prosjektomfang

Samle og kommentere 250 timer med lyddata fra kundesenteret på fire engelske dialekter:

  • amerikansk engelsk (30 %)
  • britisk engelsk (30 %)
  • australsk engelsk (20 %)
  • indisk engelsk (20 %)

I omfang

Prosjektet består av tre deler:

  • Lyddata med spesifikke enheter, inkludert metadata.
  • Tilsvarende transkriberte filer med segmentering og tidsstemplingsdetaljer.
  • Kommentarer om følelser og følelser:
    • Lydfølelse: Glad, nøytral, sint
    • Transkripsjonsfølelse: Ekstremt misfornøyd, misfornøyd, nøytral, fornøyd, ekstremt fornøyd

Utfordringer

Mangfold av dialekter

Det kan være utfordrende å sikre at lyddataene representerer dialektene som er spesifisert (USA, Storbritannia, Australia og indisk) nøyaktig. Ulike regioner innenfor disse kategoriene kan bruke variert ordforråd, aksenter og uttale.

Kompetansekrav

Å kommentere lyd og transkripsjoner for følelser og følelser krever trente kommentatorer som er kjent med de kulturelle nyansene og språklige finessene til hver dialekt.

Kompleksiteten til følelser og følelser

Lydfølelser og transkripsjonsstemninger stemmer ikke alltid overens. For eksempel kan en person høres sint ut, men faktisk uttrykke tilfredshet. For eksempel, håndtering av sarkasmesamtaler i sarkastiske setninger som "Å, herlig, en annen person som ikke kan løse problemet mitt" må være korrekt kommentert for følelser og følelser.

Lydkvalitet

Kvaliteten på lydopptakene kan variere, noe som påvirker transkripsjonsnøyaktigheten og følelsesdeteksjon. Bakgrunnsstøy, overlappende samtaler og varierende opptaksutstyr kan utgjøre betydelige utfordringer.

Nøyaktig fanger

Misnøye gjennom verbale signaler som tunge utåndinger eller andre tegn på frustrasjon.

Oppløsning

Ved å utnytte avanserte teknikker for naturlig språkbehandling (NLP) ble følgende løsninger implementert:

Innsamling av data

  • 250 timer med lyddata delt inn i dialektspesifikke kvoter.
    • amerikansk engelsk (30 % eller 75 timer)
    • engelsk engelsk (30 % eller 75 timer)
    • Australsk engelsk (20 % eller 50 timer)
    • Indisk engelsk (20 % eller 50 timer)
  • Innfødte aksentbrukere fra USA, Storbritannia, Australia og India.
  • Taleprøver som inneholder varierende toner, med spesielt fokus på tilfeller der stemmefølelsen er sint og tekstfølelsen er misfornøyd eller ekstremt misfornøyd.

Tekstklassifisering/merknad

Tekst klassifisering

  • Annotering av følelser og følelser basert på spesifikke kategorier:
    • Lydfølelse: Glad, nøytral, sint.
    • Transkripsjonsfølelse: Ekstremt misfornøyd, misfornøyd, nøytral, fornøyd, ekstremt fornøyd.
  • Hvert lydsegment inneholdt bare én primær følelse.
  • Varierende forsinkelsessegmenter (fra 2 til 30 sekunder) brukt i samtaler.
  • Transkripsjonsformatet fulgte JSON-utdata, inkludert venstre og høyre høyttalerinformasjon, sentiment-tagger og sentiment i det siste segmentet.

 

Kvalitetssikring:

Kvalitetssikring
Transkripsjonsnøyaktighet:

  • Sørget for at 250 timer med lyd ble levert med minimum:
    • 90 % nøyaktighet for transkripsjonsfeilfrekvens (TER).
    • 95 % Word Recognition Rate (WER) nøyaktighet.

QA-prosess:

  • Det ble gjennomført regelmessige revisjoner av tilfeldig utvalgte utvalg fra datasettet.
    • Brukte automatiserte verktøy for å måle TER og WER på tvers av datasettet.
    • Manuell gjennomgang av flaggede seksjoner sørget for at nøyaktighetsterskler ble oppfylt.

Utfallet

Treningsdataene vil støtte utviklingen av en automatisert følelses- og sentimentdeteksjonsmodell, som leverer:

  • Sanntidsfølelsesdeteksjon i samtalesenterinteraksjoner.
  • Mer effektiv håndtering av komplekse saker, som sarkasme eller misnøye.
  • Skalerbarhet for fremtidige prosjekter, enkel tilpasning til økte datamengder og flere språk.

leveransen

  • 250 timer med lydfiler (i 8 kHz PCM WAV-format, mono)
  • Transkripsjonsfiler (med segmentering, sentiment-tagger og høyttaleridentifikatorer)
  • Metadata (lydvarighet, høyttalerdetaljer osv.)
Sitat ikon

Samarbeidet med Shaip for vårt callsenterdataprosjekt har vært et avgjørende øyeblikk i utviklingen av våre AI-løsninger. Teamet deres samlet inn og kommenterte 250 timer med lyddata på tvers av fire viktige engelske dialekter – amerikansk, britisk, australsk og indisk – og sikret dermed høyeste kvalitet og presisjon. Fokuset på språklige nyanser i disse regionene forbedret nøyaktigheten til talegjenkjenningsmodellene våre betydelig. I tillegg har Shaips ekspertise i håndtering av komplekse dataannoteringsprosjekter vært avgjørende for å hjelpe oss med å bygge pålitelige og kompatible modeller i stor skala.

★ ★ ★ ★ ★
Sitat ikon