kunstig intelligens
Studie viser hvorfor du bør være skeptisk til å bruke Chat GPT som doktoren din
– Sliter i nyanserte situasjoner.
I januar lanserte Open AI en ny tjeneste døpt Chat GPT Health, en dedikert tjeneste som fokuserer spesifikt på helserelaterte spørsmål og problemer – noe en høy andel av Chat GPT-brukere allerede bruker mye tid på, ifølge selskapet.
Nå viser det seg imidlertid at man bør utvise forsiktighet rundt å bruke Chat GPT som en personlig lege – i alle fall i forbindelse med alvorlige helseproblemer. Det kommer frem i en ny studie, som rapportert av nettstedet Medical Xpress.
Den ferske studien ble utført av forskere tilknyttet det medisinske prestisjeuniversitetet Icahn School of Medicine at Mount Sinai i New York, og publisert hos Nature Medicine.
Undervurderte alvorlighetsgraden
Studien innebar å teste Chat GPT Health med 60 såkalte vignetter, altså konsise beskrivelser av pasienttilfeller, skrevet av reelle klinikere. Testen ble utført på tvers av 21 kliniske domener og 16 ulike kombinasjoner av variabler.
Målet var å finne ut hvordan Chat GPT Health rangerte de ulike tilfellene etter alvorlighetsgrad og behandlingsbehov, for å se hvor god tjenesten er på medisinsk prioritering – det som på fagspråket kalles «triage».
Resultatene viste seg å være heller nedslående. Ifølge forskerne fulgte prestasjonen til Chat GPT Health et omvendt U-mønster, der de mest graverende feilene var konsentrert i de kliniske ytterpunktene – altså i de minst og mest alvorlige tilfellene.
Mest oppsiktsvekkende var det at KI-tjenesten endte opp med å undervurdere alvorlighetsgraden i hele 52 prosent av de mest akutte og utvetydige nødstilfellene.
For eksempel ble pasienter med overhengende fare for respirasjonssvikt, eller pustesvikt, henvist til 24-48-timers evaluering i stedet for å bli henvist til akuttbehandling. Klassiske akuttilfeller som slag og anafylaktisk sjokk, fikk på den annen side korrekt medisinsk prioritering.
– Sliter i nyanserte situasjoner
I den andre enden av skalaen, i tilfellene som ikke krevde akuttbehandling, var Chat GPT Health skyldig i feilvurdering i 35 prosent av tilfellene.
– Våre funn avslører uoppdagede høyrisiko-nødstilfeller og inkonsekvent aktivering av sikkerhetsmekanismer for krisesituasjoner. Dette reiser sikkerhetsmessige bekymringer som tilsier at det kreves prospektiv validering før prioriteringssystemer basert på kunstig intelligens rulles ut i stor skala til forbrukere, heter det i forskningsdokumentet.
– Chat GPT Health gjorde det bra i klassiske nødstilfeller som slag eller alvorlige, allergiske reaksjoner. Men den sliter i mer nyanserte situasjoner hvor faren ikke er umiddelbart åpenbar, og det er ofte i de tilfellene at kliniske vurderinger teller mest, kommenterte Dr. Ashwin Ramaswamy, hovedforfatteren bak studien, overfor Medical Xpress.
Da Open AI presenterte Chat GPT Health, påpekte selskapet at den nye tjenesten ikke er ment å erstatte profesjonell, medisinsk assistanse, men fungere som et supplement.
Samtidig hevdet selskapet at over 230 millioner mennesker stiller helserelaterte spørsmål til Chat GPT hver uke, og med en slik brukerbase er det vanskelig å forutsi akkurat hvordan folk bruker tjenesten.