kunstig intelligens
KI overgår leger på mange viktige områder, ifølge studie
Kunstig intelligens imponerte i ny studie utført av Harvard Medical School.
Moderne KI-modeller ble kjørt gjennom omfattende tester i fem ulike eksperimenter, med en stor gruppe på flere hundre erfarne leger som referanse.
Studien ble utført av forskere tilknyttet Harvard Medical School og Beth Israel Deaconess Medical Center, som er blant de mest anerkjente medisinske utdannelsesinstitusjonene i verden. Studien er publisert i vitenskapsmagasinet Science.
The Guardian var blant de første som skrev om saken.
Studien besto altså av flere tester. I den kanskje mest imponerende ble Open AIs o1-preview-modell testet på fem kliniske «vignetter» – som er konsise beskrivelser av reelle pasienttilfeller, utarbeidet av til sammen 25 legespesialister.
Hver av disse vignettene ble presentert for KI-modellen og ble fulgt opp med en serie spørsmål relatert til de neste stegene i behandlingen. To eksperter evaluerte modellens svar og hadde høy grad av enighet seg imellom.
I denne testen oppnådde o1-preview-modellen et medianresultat på hele 89 prosent. Til sammenligning oppnådde referansegruppen med ekte leger et medianresultat på kun 34 prosent med konvensjonelle resurser – og 41 prosent for leger med tilgang til Open AIs andre KI-modell, GPT-4.
Perfekt i resonneringstest
I en annen test ble GPT-4s diagnostiseringsevner sammenlignet med 50 allmennleger på seks kliniske vignetter basert på reelle pasienttilfeller fra en tidligere studie. Det viktige her er at tilfellene aldri tidligere har blitt offentliggjort, noe som betyr at dataene ikke har vært med i KI-modellens treningsdata.
I denne testen oppnådde o1-preview-modellen et medianresultat på heftige 97 prosent, der leger med tilgang til konvensjonelle ressurser skåret 74 prosent.
En tredje test innebar å teste KI-modellens medisinske resonneringsevner, basert på noe som heter «NEJM Healer»-tilfeller – som er virtuelle pasientmøter utviklet for å vurdere klinisk resonnering. Her oppnådde o1-preview-modellen et perfekt resultat i 78 av til sammen 80 tilfeller, mens de menneskelige legene kun oppnådde perfekt resultat i 28 av de 80 tilfellene.
– I alle eksperimentene overgikk KI-modellen legenes referansenivå og viste fortsatt forbedring fra tidligere generasjoner av KI-basert klinisk beslutningsstøtte, skriver forskerne.
– Studien vår antyder at KI-modeller har overgått de fleste mål for klinisk resonnering, noe som understreker et presserende behov for prospektive studier.
Blandet bilde
Vi har også tidligere sett eksempler på at KI-modeller danker ut menneskelige leger, men bildet er likevel ikke helt svarthvitt. Det finnes også studier som har indikert at det å bruke tjenester som Chat GPT som din personlige lege, kan være risikabelt på grunn av høy fare for feilvurderinger av alvorlige tilfeller.
Tidligere i år kom det dessuten en studie som konkluderte med at det å spørre en stor språkmodell om symptomene du har, kan være farlig og føre til feil diagnose og til at det ikke blir oppdaget når det er nødvendig med akutt hjelp.