Å analysere strukturerte data kan hjelpe til med bedre diagnose og pasientbehandling. Imidlertid kan å analysere ustrukturerte data gi næring til revolusjonerende medisinske gjennombrudd og oppdagelser.
Dette er kjernen i temaet vi skal diskutere i dag. Det er veldig interessant å observere at så mange radikale fremskritt innen helseteknologi har skjedd med bare 10-20 % av brukbare helsedata.
Statistikk viser at over 90 % av dataene i dette spekteret er ustrukturerte, noe som kan oversettes til data som er mindre brukbare og vanskeligere å forstå, tolke og anvende. Fra analoge data som legeresept til digitale data i form av medisinsk bildebehandling og audiovisuelle data, er ustrukturerte data av ulike typer.
Slike enorme biter av ustrukturerte data er hjemsted for utrolig innsikt som kan spole frem helsevesenets fremskritt i flere tiår. Det være seg å hjelpe medikamentoppdagelse for kritiske livkrevende autoimmune sykdommer til data som kan hjelpe helseforsikringsselskaper i risikovurderinger, ustrukturerte data kan bane vei for ukjente muligheter.
Når slike ambisjoner er på plass, blir tolkbarhet og interoperabilitet av helsedata avgjørende. Med strenge retningslinjer og håndheving av overholdelse av regelverk som GDPR og HIPAA på plass, er det som blir uunngåelig avidentifikasjon av helsedata.
Vi har allerede dekket en omfattende artikkel om avmystifisering strukturerte helsedata og ustrukturerte helsetjenester. Det er en dedikert (les omfattende) artikkel om avidentifikasjon av helsedata også. Vi oppfordrer deg til å lese dem for helhetlig informasjon, da vi vil ha denne artikkelen for en spesiell del om ustrukturert dataavidentifikasjon.
Utfordringer med å avidentifisere ustrukturerte data
Som navnet antyder, er ikke ustrukturerte data organisert. Det er spredt når det gjelder formater, filtyper, størrelser, kontekst og mer. Bare det faktum at ustrukturerte data eksisterer i form av lyd, tekst, medisinsk bildebehandling, analoge oppføringer og mer gjør det desto mer utfordrende å forstå personopplysningsidentifikatorer (PII), som er avgjørende i ustrukturert dataavidentifikasjon.
For å gi deg et glimt av de grunnleggende utfordringene, her er en rask liste:
- Kontekstuell forståelse – der det er vanskelig for en AI-interessenter å forstå den spesifikke konteksten bak en bestemt del eller aspekt av ustrukturerte data. For eksempel kan det å forstå om et navn er et firmanavn, navnet på en person eller et produktnavn føre til et dilemma om det skal avidentifiseres.
- Ikke-tekstuelle data – der identifisering av auditive eller visuelle signaler for navn eller PII-er kan være en skremmende oppgave, da en interessent kan måtte sitte gjennom timevis med opptak eller opptak for å prøve å avidentifisere kritiske aspekter.
- tvetydighet – dette gjelder spesifikt i sammenheng med analoge data som en legeresept eller en sykehusoppføring i et register. Fra håndskrift til begrensninger av uttrykk i naturlig språk, kan det gjøre dataavidentifikasjon til en kompleks oppgave.
Beste praksis for avidentifikasjon av ustrukturerte data
Prosessen med å fjerne PII-er fra ustrukturerte data er ganske forskjellig fra strukturert dataavidentifikasjon men ikke umulig. Gjennom en systematisk og kontekstuell tilnærming kan potensialet til ustrukturerte data utnyttes sømløst. La oss se på de forskjellige måtene dette kan oppnås på.
Bilderedigering: Dette er med hensyn til medisinske bildedata og innebærer fjerning av pasientidentifikatorer og uskarphet ut anatomiske referanser og deler fra bilder. Disse erstattes av spesialtegn for fortsatt å beholde den diagnostiske funksjonaliteten og nytten til bildedata.
Mønstertilpasning: Noen av de vanligste PII-ene som navn, kontaktdetaljer og adresser kan oppdages og fjernes ved å bruke visdommen til å studere forhåndsdefinerte mønstre.
Differensiell personvern eller dataforstyrrelse: Dette innebærer inkludering av kontrollert støy for å skjule data eller attributter som kan spores tilbake til en person. Denne ideelle metoden sikrer ikke bare avidentifikasjon av data, men også bevaring av datasettets statistiske egenskaper for analyser.
Dataavidentifikasjon: Dette er en av de mest pålitelige og effektive måtene å fjerne PII-er fra ustrukturerte data. Dette kan implementeres på en av to måter:
- Veiledet læring – hvor en modell er opplært til å klassifisere tekst eller data som PII eller ikke-PII
- Uovervåket læring – hvor en modell er opplært til å autonomt lære å oppdage mønstre for å identifisere PIIer
Denne metoden sikrer sikring av pasientens personvern mens man fortsatt beholder menneskelig intervensjon for de mest overflødige aspektene ved oppgaven. Interessenter og leverandører av helsetjenester som implementerer ML-teknikker for å avidentifisere ustrukturerte data kan ganske enkelt ha en menneskelig aktivert kvalitetssikringsprosess for å sikre rettferdighet, relevans og nøyaktighet av utfall.
Datamaskering: Datamaskering er det digitale ordspillet for å avidentifisere helsedata, der spesifikke identifikatorer gjøres generiske eller vage gjennom nisjeteknikker som:
- Tokenisering – involverer erstatning av PIIer med tegn eller tokens
- Generalisering – ved å erstatte spesifikke PII-verdier med generiske/vage
- Blander – ved å blande PII-er for å gjøre dem tvetydige
Imidlertid har denne metoden en begrensning at med sofistikert modell eller tilnærming kan data gjøres re-identifiserbare
Outsourcing til markedsaktører
Den eneste riktige tilnærmingen til å sikre prosessen med ustrukturert dataavidentifikasjon er lufttett, idiotsikker og følger HIPAAs retningslinjer er å sette ut oppgavene til en pålitelig tjenesteleverandør som Shaip. Med banebrytende modeller og stive kvalitetssikringsprotokoller sikrer vi menneskelig tilsyn med personvern reduseres til enhver tid.
Etter å ha vært en markedsdominerende bedrift i årevis, forstår vi hvor kritiske prosjektene dine er. Så ta kontakt med oss i dag for å optimere helseambisjonene dine med helsedata avidentifisert av Shaip.




