Medisinsk datakatalog for helsevesenets AI
Hyllevare for helsetjenester/medisinske datasett for å sette i gang Healthcare AI-prosjektet ditt
Medisin- og helsedatasett for maskinlæring
Hva inneholder Shaip Medical Data Catalog?
Shaip Medical Data Catalog er et HIPAA-klart, ferdig bibliotek med avidentifiserte helseopplæringsdata som spenner over 31 medisinske spesialiteter, inkludert 257 977 timer med lydopptak fra leger, transkriberte pasientjournaler, elektroniske pasientjournaler og multimodale datasett. Hvert datasett er lisensiert for kommersiell AI-opplæring og leveres med Safe Harbor- eller Expert Determination-avidentifisering.
Legediktering Lyddata
Vårt avidentifiserte datasett for helsevesenet inkluderer lydfiler på tvers av 31 spesialiteter diktert av leger som beskriver pasienters kliniske tilstand og behandlingsplan basert på lege-pasient-møter i kliniske omgivelser.
Hyllevare diktatlydfiler for lege:
- 257,977 31 timer med datasett om legediktering fra XNUMX spesialiteter for å trene talemodeller for helsevesenet
- Dikteringslyd tatt opp fra forskjellige enheter som telefondiktering (54.3 %), digital opptaker (24.9 %), talemikrofon (5.4 %), smarttelefon (2.7 %) og ukjent (12.7 %)
- PII-redigert lyd og transkripsjoner som følger Safe Harbor-retningslinjene i samsvar med HIPAA
Transkribert medisinske journaler
Transkriberte pasientjournaler refererer til transkripsjon av samtaler mellom lege og pasient, transkripsjon av medisinske rapporter og medisinske vurderinger. Det hjelper med å kartlegge pasientens sykehistorie for fremtidige besøk og fungerer også som et referansepunkt for legene. Det bidrar til å evaluere pasientens nåværende tilstand og foreslå passende behandling.
Hylletranskriberte medisinske journaler:
- Transkripsjon av 257,977 31 timer med legediktater fra den virkelige verden fra XNUMX spesialiteter for å trene talemodeller i helsevesenet
- Transkriberte medisinske journaler fra ulike arbeidstyper som operasjonsrapport, utskrivningssammendrag, konsultasjonsnotat, innrømmelsesnotat, ED-notat, klinikknotat, radiologirapport, etc.
- PII-redigert lyd og transkripsjoner som følger Safe Harbor-retningslinjene i samsvar med HIPAA
Elektroniske helseregistre (EHR)
Elektroniske helsejournaler eller EPJ er medisinske journaler som inneholder pasientens sykehistorie, diagnoser, resepter, behandlingsplaner, vaksinasjons- eller immuniseringsdatoer, allergier, røntgenbilder (CT-skanning, MR, røntgen) og laboratorietester og mer.
Hyllevare elektronisk helsejournal (EPJ):
- 5.1 millioner+ registrerer og legelydfiler i 31 spesialiteter
- Medisinske journaler i den virkelige verden for å trene Clinical NLP og andre Document AI-modeller
- Metadatainformasjon som MRN (Anonymisert), Innleggelsesdato, Utskrivelsesdato, Lengde på oppholdsdager, Kjønn, Pasientklasse, Betaler, Finansklasse, Stat, Utskrivningsdisposisjon, Alder, DRG, DRG-beskrivelse, $ Refusjon, AMLOS, GMLOS, Risiko for dødelighet, alvorlighetsgrad av sykdom, Grouper, sykehuspostnummer, etc.
- Medisinske journaler fra forskjellige amerikanske stater og regioner - Nordøst (46%), Sør (9%), Midtvesten (3%), Vest (28%), Andre (14%)
- Medisinske journaler som tilhører alle pasientklasser som dekkes - poliklinisk, poliklinisk (klinisk, rehabilitering, tilbakevendende, kirurgisk barnehage), akutt.
- Medisinske journaler som tilhører alle pasientaldersgrupper <10 år (7.9%), 11-20 år (5.7%), 21-30 år (10.9%), 31-40 år (11.7%), 41-50 år (10.4% ), 51-60 år (13.8%), 61-70 år (16.1%), 71-80 år (13.3%), 81-90 år (7.8%), 90+ år (2.4%)
- Pasientens kjønnsforhold på 46 % (mann) og 54 % (kvinnelig)
- PII-redigerte dokumenter som følger Safe Harbor-retningslinjene i samsvar med HIPAA
Fem grunner til at kjøpere lisens Shaip i stedet for å sy det sammen.
Shaip Medical Data Catalog eksisterer fordi De fleste AI-team i helsevesenet taper ni til tolv måneder innhenting av kompatible treningsdata før en enkelt modell trenes. Her er hva som endres når disse månedene returneres.
Katalogskala de fleste team ikke kan matche.
Shaip-katalogen spenner over 257,977 timer av legediktat, transkripsjoner fra 31 medisinske spesialiteter, og EHR-journaler som dekker alle pasientaldersgrupper – den typen volum som lar kjøpere trene og evaluere modeller uten å sette sammen et dusin åpne datasett.
Samsvar er en startbetingelse, ikke en funksjon.
Alle medisinske datasett fra Shaip leveres med HIPAA Safe Harbor-avidentifikasjon som standard, Ekspertvurdering på forespørsel, GDPR-tilpasset håndtering og BAA-klargjøring for dekkede enheter. Kjøpere trenger ikke å ettermontere samsvar i etterkant.
Helseutdannede spesialister, ikke generiske folkemengdearbeidere.
Annotering, transkripsjon og kvalitetssikring på Shaips medisinske katalog utføres av helseutdannede spesialisterShaip-arbeidsflyten inkluderer flerlags kvalitetssikring og human-in-the-loop-validering kalibrert i henhold til kliniske nøyaktighetsstandarder.
Laget fra hylla i dag, spesiallaget på forespørsel.
Kjøpere kan lisensiere eksisterende Shaip-datasett umiddelbart eller bestille tilpassede samlinger tilpasset spesifikke demografiske grupper, geografiske områder, språk og modaliteter – uten å bytte leverandør eller kjøre samsvarsgjennomgangen på nytt.
Tilgjengelig der datateam allerede jobber.
Shaips anonymiserte EHR- og legedikteringsdatasett er tilgjengelige på Databricks Marketplace, med levering i formater som data- og ML-team allerede bruker – JSON, CSV, WAV. Eksempeldatasett er tilgjengelige før noen forpliktelse.
Sikkerhet og samsvar
Finner du ikke det du leter etter?
Nye medisinske datasett blir samlet inn på tvers av alle datatyper
Kontakt oss nå for å gi slipp på bekymringene for datainnsamling av helsetreningsdata
Ofte stilte spørsmål (FAQ)
1. Hva er medisinske datasett?
Medisinske datasett er helsedata som brukes til å trene, evaluere og forbedre AI/ML-modeller. De kan inkludere lyd fra legediktat, transkriberte pasientjournaler, elektroniske helsejournaler, syntetiske lege-pasient-dialoger og multimodale helsedatasett som kombinerer relevant tekst, tale og strukturerte kliniske data.
2. Hva er inkludert i Shaip Medical Data Catalog?
Shaip Medical Data Catalog inkluderer lydbasert diktering av leger, transkriberte pasientjournaler, elektroniske helsejournaler, syntetiske lege-pasient-dialoger og multimodale datasett som kobler tekst, tale og strukturerte kliniske data på pasient- eller møtenivå. Den inkluderer 257 977 timer med lydbasert diktering av leger på tvers av 31 medisinske spesialiteter og er tilgjengelig for kommersiell AI-opplæring.
3. Er Shaips medisinske datasett HIPAA-kompatible?
Ja. Shaips medisinske datasett er som standard avidentifisert under HIPAA Safe Harbor, noe som fjerner de 18 kategoriene av identifikatorer som er spesifisert i HIPAA-personvernregelen. Avidentifisering basert på ekspertbestemmelse er også tilgjengelig når statistisk sertifisering er nødvendig, og Shaip er BAA-klar for dekkede enheter.
4. Kan Shaips medisinske datasett støtte GDPR og andre krav til helsedata?
Ja. Shaips medisinske datasett kan utarbeides for å støtte HIPAA, GDPR og andre gjeldende krav til helsedata, avhengig av prosjektets omfang, geografi, datatype og kontraktsmessige krav.
5. Kan jeg kjøpe helsedatasett direkte fra lageret, eller må de samles inn?
Begge alternativene er tilgjengelige. Shaip tilbyr standard helsedatasett gjennom Shaip Medical Data Catalog for kommersiell AI-opplæring. Hvis et prosjekt krever et spesifikt språk, demografi, spesialitet, modalitet eller klinisk setting, kan Shaip også kjøre tilpasset medisinsk datainnsamling under de samme samsvarsstandardene.
6. Kan medisinske datasett fra Shaip tilpasses?
Ja. Shaip kan tilpasse medisinske datasett etter spesialitet, pasientens aldersgruppe, kjønn, geografi, språk, modalitet, klinisk setting, format, volum og prosjektkrav. Tilpassede datasett er begrenset gjennom en arbeidsbeskrivelse og følger gjeldende standarder for avidentifisering og samsvar.
7. Kan jeg se et eksempeldatasett før lisensiering?
Ja. Shaip tilbyr representative eksempeldatasett under taushetsplikt, slik at AI-team kan evaluere format, kvalitet, demografisk dekning og modelltilpasning før lisensiering. Tilgang til eksempler er vanligvis det første trinnet før et engasjement med standardlisens eller tilpasset samling.
8. I hvilke formater leverer Shaip medisinske datasett?
Shaip leverer medisinske datasett i AI-klare formater, inkludert JSON, CSV og FHIR for strukturerte journaler; WAV-filer med sammenkoblede transkripsjoner for lyd; og transkripsjonsfiler for tale- og språkdatasett. Multimodale datasett kan inkludere manifestfiler som kobler tekst, lyd og strukturerte kliniske journaler.
9. Hvordan sikrer Shaip kvaliteten på medisinske datasett?
Shaip sikrer kvaliteten på medisinske datasett gjennom ekspertvurdering, domenespesialist-annotering, valideringsarbeidsflyter og strukturerte kvalitetssikringskontroller. Disse prosessene bidrar til å sikre nøyaktighet, pålitelighet og modellberedskap for utvikling av AI innen helsevesenet.
10. Er Shaips medisinske datasett skalerbare for store AI/ML-prosjekter?
Ja. Shaips medisinske datasett er skalerbare for både små pilotprosjekter og AI/ML-prosjekter i store bedrifter. De kan støtte prosjekter som krever store mengder medisinske journaler, strukturerte kliniske data, transkripsjoner eller hundretusenvis av timer med lyddiktering fra leger.
11. Kan medisinske datasett fra Shaip integreres i eksisterende AI-modeller og arbeidsflyter?
Ja. Shaip leverer medisinske datasett i bruksklare formater som JSON, CSV, FHIR, WAV og transkripsjonsfiler. Disse formatene støtter integrering i eksisterende arbeidsflyter for AI, ML, NLP, tale, helsevesenets LLM og multimodale modellutvikling.
12. Hvor lang tid tar det å motta et medisinsk datasett fra Shaip?
Standard medisinske datasett kan vanligvis leveres innen få dager etter prøvegjennomgang, kontraktssignering og ferdigstillelse av lisens. Tilpassede tidslinjer for innsamling avhenger av prosjektets omfang, datasettstørrelse, modalitet, samsvarskrav og kompleksitet, og er definert i arbeidsbeskrivelsen.
13. Hvor mye koster medisinske datasett?
Kostnaden for medisinske datasett avhenger av datasetttype, modalitet, volum, tilpasningskrav, lisensvilkår, leveringstidslinje og samsvarsbehov. Team kan dele sine krav via kontaktskjemaet for å motta et tilpasset tilbud.
14. Hvorfor er medisinske datasett viktige for AI/ML i helsevesenet?
Medisinske datasett av høy kvalitet er avgjørende for å trene nøyaktige, pålitelige og klinisk nyttige AI-modeller for helsevesenet. De bidrar til å forbedre medisinsk dokumentasjon, klinisk NLP, talegjenkjenning, oppsummering, beslutningsstøtte, automatisering, arbeidsflyter for pasientbehandling og dataintelligens innen helsevesenet.