Prosjekt Vaani

Prosjekt Vaani: Shaips rolle i utformingen av flerspråklig AI for India

I et land som er så kulturelt mangfoldig og språklig rikt som India, begynner å bygge inkluderende AI med å samle inn representative datasett av høy kvalitet. Det er visjonen bak Prosjekt Vaani—et storstilt åpen kildekode-initiativ ledet av ARTPARK, IISc Bengaluruog Google, med sikte på å gi stemme til alle indiske språk og dialekter.

Det ambisiøse målet? Å samle 150,000 XNUMX+ timer med tale og 15,000 XNUMX+ timer med transkripsjoner fra 1 million mennesker tvers 773 distrikter av india

Som en av nøkkelleverandørene for dette nasjonale oppdraget, Shaip spilte en sentral rolle i å kurere spontan taledata, transkripsjon og metadatainnsamling – og la grunnlaget for rettferdige stemmeteknologier som virkelig representerer det virkelige India.

Visjonen bak Project Vaani

Project Vaani er designet for å bygge bro over AI-inkluderingsgapet ved å skape største multimodale, flerspråklige, åpen kildekode-datasettet i India. Disse dataene er grunnleggende for å utvikle nøyaktig talegjenkjenning, oversettelse og generative AI-systemer på indiske språk – mange av dem er underrepresentert i globale teknologiøkosystemer.

Den langsiktige visjonen er å drive effektfulle applikasjoner innen:

Hvordan Shaip bidro til å bygge Indias største åpen kildekode-taledatasett for Project Vaani

Shaip ble betrodd innsamlingen av 8,000 timer med spontan tale og 800 timer med manuelt bekreftede transkripsjoner. Vårt ansvar spenner over høyttalerinnføring, lydopptak, metadatamerking, transkripsjonskoordinering og kvalitetskontroll.

8,000 timer av spontane lyddata

800 timer av manuelle transkripsjoner av høy kvalitet

Opptak fra 400+ morsmål per distrikt, som representerer ulike aldersgrupper, kjønn og dialekter

80 distrikter, dekket

Bildebasert spørsmål for å sikre naturlig, kontekstuell tale

Her er det som gjorde tilnærmingen vår unik:

Mangfold på distriktsnivå

Mangfold på distriktsnivå

Vi hentet opptak fra 80 distrikter spredt over stater som Bihar, Uttar Pradesh, Karnataka, Vest-Bengal og Maharashtra. Hvert distrikt bidro med 100 timer med lyddata, og sørget for regional balanse. Vi engasjerte morsmål, og sikret representasjon av regionale aksenter og dialekter som ofte blir oversett i vanlige AI-datasett.

Språklig og demografisk representasjon

Språklig og demografisk representasjon

Vi hentet opptak fra 80 distrikter spredt over stater som Bihar, Uttar Pradesh, Karnataka, Vest-Bengal og Maharashtra. Hvert distrikt bidro med 100 timer med lyddata, og sørget for regional balanse. Vi engasjerte morsmål, og sikret representasjon av regionale aksenter og dialekter som ofte blir oversett i vanlige AI-datasett.

Bildebasert tale

For å stimulere spontant og naturlig vokabular ble deltakerne vist 45–90 bilder per økt og bedt om å beskrive dem. Deltakerne ble bedt om å bruke forskjellige bilder – alt fra kulturelle symboler til hverdagslige gjenstander – for å fremkalle naturlige, spontane responser på morsmålet. Dette sikret at opptak reflekterte kontekstuell tale fra den virkelige verden – avgjørende for opplæring av avanserte NLP-systemer.

Høykvalitets transkripsjonsstandarder

Høykvalitets transkripsjonsstandarder

Bare 10 % av taledataene ble transkribert – tilsvarende 800 timer. Transkripsjoner ble utført av lokale lingvister innenfor en radius på 20–50 km fra høyttaleren, noe som sikret kjennskap til dialekter og nyanser. En andrelagssjekk sikret <5 % ordfeilrate (WER).

Streng kvalitetssikring

Lyddata måtte møte en høy bar: ingen bakgrunnsstøy, ekko, telefonvibrasjoner eller forvrengninger. Lyd ble tatt opp i stille, ekkofrie omgivelser. Filer gjennomgikk grundig gjennomgang for å oppfylle retningslinjer for taleklarhet, støynivåer, metadatanøyaktighet og høyttalerverifisering. Metadatamerking måtte være nøyaktig på tvers av alle filer, og alle opptak ble sjekket for høyttaler og plassering.

Utfordringer vi løste

Suksessen vår kom ned til grundig planlegging, teknologidrevet validering og partnerskap med lokale lag som forsto de kulturelle nyansene i hver region.

Effekt og applikasjoner

Shaips bidrag har ikke bare akselerert fremdriften til Project Vaani, men også lagt grunnlaget for inkluderende AI i India. Det kuraterte taledatasettet brukes allerede til å bygge og finjustere AI-modeller for:

  • Vernacular stemmeassistenter
  • Regionale oversettelsesmotorer
  • Tilgjengelige kommunikasjonsverktøy for synshemmede
  • AI-drevne edtech-plattformer for studenter på landsbygda
  • Landlig telemedisin
  • Stemmebaserte innbyggertjenester
  • Sanntidsoversettelse og transkripsjon

Konklusjon

Project Vaani er et dristig skritt mot inkluderende, tilgjengelig AI – og Shaip er beæret over å spille en grunnleggende rolle. Shaips arbeid med Project Vaani bekrefter vår forpliktelse til å bygge etiske, inkluderende AI-systemer forankret i mangfold og representasjon. Med over 8,000 timer med tale samlet og 800 timer transkribert, er vi stolte over å ha spilt en rolle i et av Indias mest visjonære digitale inkluderingsprosjekter.

Mens Project Vaani fortsetter mot sitt større mål om 150,000 XNUMX+ timer med data, står vi klare til å støtte den neste grensen for AI-innovasjon som taler til – og for – hver indianer.

Vil du samarbeide med oss ​​for å bygge AI som forstår den virkelige verden? www.shaip.com

Likte du denne artikkelen? Følg Shaip på LinkedIn for flere oppdateringer.

Sosial Share