kunstig intelligens

Oppstartsbedrift finner hjerteproblemer med ML: Det er ikke nok å gi bedre behandling

XAI (eXplainable Artificial Intelligence) er moderne, men veldig vanskelig å få til å fungere tilfredsstillende, forteller sjefen for datavitenskap hos danske Vital Beats.

Illustrasjonsfoto.
Illustrasjonsfoto.

AI-teknologier er raskt i ferd med å gjøre sitt inntog innen helsesektoren. Her finnes det både massevis av data å utnytte, kritiske beslutninger å understøtte, samt liv og budsjetter å forbedre.

Men det er også en god mulighet for å bruke teknologien til å gi travle leger flere falske alarmer og mer informasjon å forholde seg til. Det har den danske oppstartsbedriften Vital Beats erfart.

Bedriften er i samarbeid med det danske Rigshospitalet i ferd med å utvikle flere verktøy som henter data fra for eksempel pacemakere og forutsier om en pasient vil få et hjerteinfarkt i nærmeste fremtid, for deretter å kunne varsle en lege.

Men det er ikke selve alarmen som gjør oppgaven vanskelig, forteller Head of Data Science Mikkel Hansen hos Vital Beats.

– Alle kan lage disse alarmene, hvis de bare har data. Og kanskje kunne de lage noen modeller som har bedre presisjon og bedre tilbakemeldinger, innleder han.

– Men vi blir nødt til å finne ut av hvordan den blir brukt, og når det er tilstrekkelig bra nok.

Mikkel Hansen er Head of Data Science i Vital Beats. Mikkel Hansen har en ph.d. i eksperimentell fysikk fra Roskilde Universitet. Foto: Vital Beats
Mikkel Hansen er Head of Data Science i Vital Beats. Mikkel Hansen har en ph.d. i eksperimentell fysikk fra Roskilde Universitet.

For hjertelegene på Rigshospitalets er det allerede rikelig av alarmer å forholde seg til. Klinikere har vent seg til å se forholde seg til alarmer, og de har vent seg til mange falske positive. Men hvis alle alarmene designes etter det samme helgarderingsprinsippet, ender legene opp med å bli begravd av de samme verktøyene som burde hjelpe dem.

– Det de pleier å si, er at de heller vil få en alarm for mye enn en for lite. Men i praksis er det bare rett og slett veldig travelt på klinikken, sier Mikkel Hansen:

– Ideelt sett tror vi at disse metodene i siste rekke kan gi bedre behandling. Og så kan man si at det er bra nok. Men det er det ganske enkelt ikke. For det finnes også en hverdag som skal henge sammen.

Drukner i data

Hverdagen er i økende grad preget av stadig større mengder data som står til rådighet for legene. Stadig flere pasienter utstyres med mindre hjertemålere, som har blitt vesentlig billigere, og som trolig rapporterer tilbake til sykehuset. I tillegg kommer de egentlige pacemakerne, som sender data om potensielle hjertesykdommer til legene.

– Årsaken er ikke at legene skriker etter AI og data science, bemerker Mikkel Hansen. – Men vi kan se at de drukner i data. Dermed må de må få noen verktøy som gjør det enklere for dem å navigere.

Et av prosjektene som Vital Beats har jobbet med på Rigshospitalet, går ut på å forutsi arytmi på bakgrunn av data fra pacemakere.

– Når data kommer inn til klinikken, må en lege vurdere om pasienten skal kontaktes, få nye medisiner eller noe annet, forklarer Mikkel Hansen.

– Det opplagte ved dette er at vi har data fra de siste fire-fem årene med alle de dataene som har kommet inn til Rigshospitalet, og vi kan se hva som skjedde med pasienten etter dette. Så det vi lager nå, er en risikovurdering når det kommer inn data for å avgjøre hva sannsynligheten er for at du får en arytmi innenfor de neste 30 dagene.

Med systemet implementert skal legen se på alle de samme informasjonene som han pleier, men også på risikovurderingen som utføres av en Random Forrest-modell.

I et annet prosjekt tar Vital Beats hjertemålinger og bruker clustering for å gruppere de hjerteslagene som har en form som potensielt kan tyde på hjertesykdommer.

– Formålet er å spare tid. Men utfordringen er at legen i praksis egentlig ikke ville se gjennom alle dataene, så vi gir legen mer å forholde seg til. Det er hele tiden en balansegang mellom å hjelpe legen og gi mer arbeid, sier Mikkel Hansen.

Hver gang legen må bruke tid på å utnytte beslutningsstøtte, må jobbing fjernes et annet sted, konstaterer han.

– Vi har tidligere gjort det slik at hvis det kommer inn en sending som ikke viser tegn på arytmi, og pasienten i tillegg har svart at han tar medisinen sin og har det bra, sender vi automatisk et svar tilbake fra klinikken hvor vi skriver at alt ser bra ut, sier Mikkel Hansen.

– Det er en automatisk håndtering, og egentlig ville vi helst ha det slik at leger og pasienter var i kontakt. Men det er nødt til å være et sted hvor vi fjerner arbeid for legene. Hvis vi bare skaper mer arbeid, blir vi raskt upopulære.

Det er potensial for at verktøyene på sikt vinner tid ved å føre raskere fram til diagnostisering. Men dette er vanskelig å dokumentere uten langvarige tester, bemerker Mikkel Hansen.

– Det er nok den største utfordringen innen medtech: Alt må virke utrolig godt fra starten av. Du kan ikke bare A/B-teste og gjette deg fram.

Vanskelig å lage tilfredsstillende XAI

En annen utfordring med å innføre maskinlæring (machine learning) på klinikken er tilliten til løsningen.

– AI-explainablility er moderne, men det er vanskelig å gjøre det godt nok, sier Mikkel Hansen.

Vital Beats har til å begynne med brukt rammeverket LIME til å rangere viktigheten av de parameterne som Random Forrest-modellen bruker.

– Vi hadde en diskusjon om hvorvidt det skulle med i løsningen. Vi valgte til slutt å ta det med, og alle klinikere sier at det er dette som gjør det så bra. Det gjør at de kan se at modellen ser de samme tingene som de selv ser. Og det skaper tillitt, forteller Mikkel Hansen. Men han er likevel ikke tilfreds med å gi oppgaven til LIME.

LIME fungerer grunnleggende ved å lage små variasjoner av inputen til modellen, som undersøkes for å måle hvor mye hver parameter betyr for den enkelte forutsigelsen. Svakheten ved metoden er blant annet at forklaringen bare fungerer på den lokale forutsigelsen, og ikke den globale modellen. Rammeverket har dessuten vist seg å være ustabilt, noe som betyr at forklaringer kan endre seg.

– LIME er agnostisk når det gjelder modell-type. Men det er ikke nødvendig for oss hvis vi bare bruker Random Forrest. Derfor vil vi sannsynligvis kunne finne andre teknikker som gir et mer direkte bilde av viktigheten av de forskjellige egenskapene, sier Mikkel Hansen.

– Legene vil gjerne se informasjonen, og dermed er det oppgaven min å vise dem noe vi kan stå inne for. Jeg føler ikke vi kan stå inne for LIME. Når vi må designe løsningen, må vi også redesigne forklaringene.

Store krav til funksjonsteknikk

Når leger skal presenteres for modellens viktigste egenskaper, har det også implikasjoner for hele data science-arbeidet, forteller Mikkel Hansen.

– Den måten vi har formulert parametere på, har også skapt forvirring. For eksempel har vi en egenskap som teller hjerteepisoder i den siste uken, mens to andre parametere teller episoder i dag og i går. Så uke-egenskapen vår beskriver i virkeligheten det som har skjedd for 1 til 8 dager siden, sier han:

– Dette skaper forvirring, fordi systemet angir at det har skjedd noe dagen før, men ikke den siste uken. Og dermed mister man tilliten til modellen.

– Hvis vi skal gjøre dette på en skikkelig måte, kommer det til å stille noen store krav til funksjonsteknikken vår (feature engineering). Og det vi stapper inn i modellen må alt sammen være forståelig på en helt annen måte. Vi kan ikke bare ta et dypt nettverk og fôre det med rådata. Selv om LIME ville virke med det, har du ikke noen god metode for å oversette de inputene til meningsfulle egenskaper.

Tallene forvirrer

Inntil videre har Vital Beats laget en mulighetsstudie (feasibility-studie), som antyder at det er gevinster å hente i å la maskinlæring tygge på pacemaker-data. Men det gjenstår fremdeles mye arbeid før løsningen reelt kan benyttes i produksjon, understreker Mikkel Hansen.

– Vi må være sikre på at legene forstår den informasjonen vi gir dem. Vi har satt oss ned sammen med dem, og vi kan se at noen feiltolker den verdien modellen gir som presisjon. Altså at hvis det står 58 prosent, så er det 58 prosent sannsynlighet for at det er en sann positiv. Men det er i virkeligheten et uttrykk for hvor sikker algoritmen føler seg i vurderingen. Tallet er forvirrende, konstaterer Mikkel Hansen.

Et annet problem er at Random Forrest-modellen ikke tar høyde for hvilken rekkefølge noe skjer i. Hvis en person med pacemaker har tre mindre episoder og i tillegg får hjerteflimmer, er dette annerledes enn å få hjerteflimmer etterfulgt av tre mindre episoder.

– Den ene er i ferd med å intensiveres, den andre er i ferd med å avta. Men slikt tar vi ikke høyde for akkurat nå, sier Mikkel Hansen.

– Det er mange ting man kan gjøre, og vi blir nødt til å prioritere.

Saken ble først publisert på danske Datatech, og gjøres tilgjengelig på norsk for abonnenter av Digi Ekstra gjennom vår samarbeidsavtale med Teknologiens mediehus/Ingeniøren.

Powered by Labrador CMS