Medisinsk datakatalog for helsevesenets AI

Hyllevare for helsetjenester/medisinske datasett for å sette i gang Healthcare AI-prosjektet ditt

Medisinsk datakatalog

Medisin- og helsedatasett for maskinlæring

Hva inneholder Shaip Medical Data Catalog?

Shaip Medical Data Catalog er et HIPAA-klart, ferdig bibliotek med avidentifiserte helseopplæringsdata som spenner over 31 medisinske spesialiteter, inkludert 257 977 timer med lydopptak fra leger, transkriberte pasientjournaler, elektroniske pasientjournaler og multimodale datasett. Hvert datasett er lisensiert for kommersiell AI-opplæring og leveres med Safe Harbor- eller Expert Determination-avidentifisering.

Legediktering Lyddata

Vårt avidentifiserte datasett for helsevesenet inkluderer lydfiler på tvers av 31 spesialiteter diktert av leger som beskriver pasienters kliniske tilstand og behandlingsplan basert på lege-pasient-møter i kliniske omgivelser.

Hyllevare diktatlydfiler for lege:

  • 257,977 31 timer med datasett om legediktering fra XNUMX spesialiteter for å trene talemodeller for helsevesenet
  • Dikteringslyd tatt opp fra forskjellige enheter som telefondiktering (54.3 %), digital opptaker (24.9 %), talemikrofon (5.4 %), smarttelefon (2.7 %) og ukjent (12.7 %)
  • PII-redigert lyd og transkripsjoner som følger Safe Harbor-retningslinjene i samsvar med HIPAA
Lege diktering lyddata

Transkribert medisinske journaler

Transkriberte pasientjournaler refererer til transkripsjon av samtaler mellom lege og pasient, transkripsjon av medisinske rapporter og medisinske vurderinger. Det hjelper med å kartlegge pasientens sykehistorie for fremtidige besøk og fungerer også som et referansepunkt for legene. Det bidrar til å evaluere pasientens nåværende tilstand og foreslå passende behandling.

Hylletranskriberte medisinske journaler:

  • Transkripsjon av 257,977 31 timer med legediktater fra den virkelige verden fra XNUMX spesialiteter for å trene talemodeller i helsevesenet
  • Transkriberte medisinske journaler fra ulike arbeidstyper som operasjonsrapport, utskrivningssammendrag, konsultasjonsnotat, innrømmelsesnotat, ED-notat, klinikknotat, radiologirapport, etc.
  • PII-redigert lyd og transkripsjoner som følger Safe Harbor-retningslinjene i samsvar med HIPAA
Transkriberte medisinske journaler

Elektroniske helseregistre (EHR)

Elektroniske helsejournaler eller EPJ er medisinske journaler som inneholder pasientens sykehistorie, diagnoser, resepter, behandlingsplaner, vaksinasjons- eller immuniseringsdatoer, allergier, røntgenbilder (CT-skanning, MR, røntgen) og laboratorietester og mer.

Hyllevare elektronisk helsejournal (EPJ):

  • 5.1 millioner+ registrerer og legelydfiler i 31 spesialiteter
  • Medisinske journaler i den virkelige verden for å trene Clinical NLP og andre Document AI-modeller
  • Metadatainformasjon som MRN (Anonymisert), Innleggelsesdato, Utskrivelsesdato, Lengde på oppholdsdager, Kjønn, Pasientklasse, Betaler, Finansklasse, Stat, Utskrivningsdisposisjon, Alder, DRG, DRG-beskrivelse, $ Refusjon, AMLOS, GMLOS, Risiko for dødelighet, alvorlighetsgrad av sykdom, Grouper, sykehuspostnummer, etc.
  • Medisinske journaler fra forskjellige amerikanske stater og regioner - Nordøst (46%), Sør (9%), Midtvesten (3%), Vest (28%), Andre (14%)
  • Medisinske journaler som tilhører alle pasientklasser som dekkes - poliklinisk, poliklinisk (klinisk, rehabilitering, tilbakevendende, kirurgisk barnehage), akutt.
Elektronisk helsejournal (ehr)
  • Medisinske journaler som tilhører alle pasientaldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
  • Pasientens kjønnsforhold på 46 % (mann) og 54 % (kvinnelig)
  • PII-redigerte dokumenter som følger Safe Harbor-retningslinjene i samsvar med HIPAA

Fem grunner til at kjøpere lisens Shaip i stedet for å sy det sammen.

Shaip Medical Data Catalog eksisterer fordi De fleste AI-team i helsevesenet taper ni til tolv måneder innhenting av kompatible treningsdata før en enkelt modell trenes. Her er hva som endres når disse månedene returneres.

01

Katalogskala de fleste team ikke kan matche.

Shaip-katalogen spenner over 257,977 timer av legediktat, transkripsjoner fra 31 medisinske spesialiteter, og EHR-journaler som dekker alle pasientaldersgrupper – den typen volum som lar kjøpere trene og evaluere modeller uten å sette sammen et dusin åpne datasett.

02

Samsvar er en startbetingelse, ikke en funksjon.

Alle medisinske datasett fra Shaip leveres med HIPAA Safe Harbor-avidentifikasjon som standard, Ekspertvurdering på forespørsel, GDPR-tilpasset håndtering og BAA-klargjøring for dekkede enheter. Kjøpere trenger ikke å ettermontere samsvar i etterkant.

HIPAA Safe Harbor Ekspertbestemmelse GDPR-tilpasset BAA-klar
03

Helseutdannede spesialister, ikke generiske folkemengdearbeidere.

Annotering, transkripsjon og kvalitetssikring på Shaips medisinske katalog utføres av helseutdannede spesialisterShaip-arbeidsflyten inkluderer flerlags kvalitetssikring og human-in-the-loop-validering kalibrert i henhold til kliniske nøyaktighetsstandarder.

04

Laget fra hylla i dag, spesiallaget på forespørsel.

Kjøpere kan lisensiere eksisterende Shaip-datasett umiddelbart eller bestille tilpassede samlinger tilpasset spesifikke demografiske grupper, geografiske områder, språk og modaliteter – uten å bytte leverandør eller kjøre samsvarsgjennomgangen på nytt.

05

Tilgjengelig der datateam allerede jobber.

Shaips anonymiserte EHR- og legedikteringsdatasett er tilgjengelige på Databricks Marketplace, med levering i formater som data- og ML-team allerede bruker – JSON, CSV, WAV. Eksempeldatasett er tilgjengelige før noen forpliktelse.

JSON CSV WAV FHIR

Sikkerhet og samsvar

GDPR
HIPAA
ISO 9001: 2015
SOC 2 Type II
ISO 27001
Shaip kontakt oss

Finner du ikke det du leter etter?

Nye medisinske datasett blir samlet inn på tvers av alle datatyper 

Kontakt oss nå for å gi slipp på bekymringene for datainnsamling av helsetreningsdata

  • Dette feltet er for validering formål og bør stå uendret.
  • Ved å registrere meg godtar jeg Shaip Personvernerklæring og Våre vilkår og gi mitt samtykke til å motta B2B-markedsføringskommunikasjon fra Shaip.

Medisinske datasett er helsedata som brukes til å trene, evaluere og forbedre AI/ML-modeller. De kan inkludere lyd fra legediktat, transkriberte pasientjournaler, elektroniske helsejournaler, syntetiske lege-pasient-dialoger og multimodale helsedatasett som kombinerer relevant tekst, tale og strukturerte kliniske data.

Shaip Medical Data Catalog inkluderer lydbasert diktering av leger, transkriberte pasientjournaler, elektroniske helsejournaler, syntetiske lege-pasient-dialoger og multimodale datasett som kobler tekst, tale og strukturerte kliniske data på pasient- eller møtenivå. Den inkluderer 257 977 timer med lydbasert diktering av leger på tvers av 31 medisinske spesialiteter og er tilgjengelig for kommersiell AI-opplæring.

Ja. Shaips medisinske datasett er som standard avidentifisert under HIPAA Safe Harbor, noe som fjerner de 18 kategoriene av identifikatorer som er spesifisert i HIPAA-personvernregelen. Avidentifisering basert på ekspertbestemmelse er også tilgjengelig når statistisk sertifisering er nødvendig, og Shaip er BAA-klar for dekkede enheter.

Ja. Shaips medisinske datasett kan utarbeides for å støtte HIPAA, GDPR og andre gjeldende krav til helsedata, avhengig av prosjektets omfang, geografi, datatype og kontraktsmessige krav.

Begge alternativene er tilgjengelige. Shaip tilbyr standard helsedatasett gjennom Shaip Medical Data Catalog for kommersiell AI-opplæring. Hvis et prosjekt krever et spesifikt språk, demografi, spesialitet, modalitet eller klinisk setting, kan Shaip også kjøre tilpasset medisinsk datainnsamling under de samme samsvarsstandardene.

Ja. Shaip kan tilpasse medisinske datasett etter spesialitet, pasientens aldersgruppe, kjønn, geografi, språk, modalitet, klinisk setting, format, volum og prosjektkrav. Tilpassede datasett er begrenset gjennom en arbeidsbeskrivelse og følger gjeldende standarder for avidentifisering og samsvar.

Ja. Shaip tilbyr representative eksempeldatasett under taushetsplikt, slik at AI-team kan evaluere format, kvalitet, demografisk dekning og modelltilpasning før lisensiering. Tilgang til eksempler er vanligvis det første trinnet før et engasjement med standardlisens eller tilpasset samling.

Shaip leverer medisinske datasett i AI-klare formater, inkludert JSON, CSV og FHIR for strukturerte journaler; WAV-filer med sammenkoblede transkripsjoner for lyd; og transkripsjonsfiler for tale- og språkdatasett. Multimodale datasett kan inkludere manifestfiler som kobler tekst, lyd og strukturerte kliniske journaler.

Shaip sikrer kvaliteten på medisinske datasett gjennom ekspertvurdering, domenespesialist-annotering, valideringsarbeidsflyter og strukturerte kvalitetssikringskontroller. Disse prosessene bidrar til å sikre nøyaktighet, pålitelighet og modellberedskap for utvikling av AI innen helsevesenet.

Ja. Shaips medisinske datasett er skalerbare for både små pilotprosjekter og AI/ML-prosjekter i store bedrifter. De kan støtte prosjekter som krever store mengder medisinske journaler, strukturerte kliniske data, transkripsjoner eller hundretusenvis av timer med lyddiktering fra leger.

Ja. Shaip leverer medisinske datasett i bruksklare formater som JSON, CSV, FHIR, WAV og transkripsjonsfiler. Disse formatene støtter integrering i eksisterende arbeidsflyter for AI, ML, NLP, tale, helsevesenets LLM og multimodale modellutvikling.

Standard medisinske datasett kan vanligvis leveres innen få dager etter prøvegjennomgang, kontraktssignering og ferdigstillelse av lisens. Tilpassede tidslinjer for innsamling avhenger av prosjektets omfang, datasettstørrelse, modalitet, samsvarskrav og kompleksitet, og er definert i arbeidsbeskrivelsen.

Kostnaden for medisinske datasett avhenger av datasetttype, modalitet, volum, tilpasningskrav, lisensvilkår, leveringstidslinje og samsvarsbehov. Team kan dele sine krav via kontaktskjemaet for å motta et tilpasset tilbud.

Medisinske datasett av høy kvalitet er avgjørende for å trene nøyaktige, pålitelige og klinisk nyttige AI-modeller for helsevesenet. De bidrar til å forbedre medisinsk dokumentasjon, klinisk NLP, talegjenkjenning, oppsummering, beslutningsstøtte, automatisering, arbeidsflyter for pasientbehandling og dataintelligens innen helsevesenet.