kunstig intelligens
Lot Chat GPT verdivurdere ulike yrker: – Den gir mer prestisje enn mennesker
Har du lurt på hvordan kunstig intelligens anser ditt yrke? En ny studie viser at GPT-4 i stor grad forstår samfunnsnytten ved ulike yrker. Men den overvurderer visse yrker og forsterker stereotypier, sier BI-professor.
Mens interessen rundt kunstig intelligens (KI) og språkmodeller som GPT har økt, har bekymringen rundt fordomsfulle fremstillinger i KI-generert materiale gjort det samme.
Nå har en ny studie kartlagt forskjeller i hvordan mennesker og maskiner oppfatter ulike yrker, og med den fått innblikk i en del fordommer som generes av KI-verktøy som Chat GPT.
– Vi fikk flere interessant funn, forteller BI-professor Christoph Lutz ved Institutt for kommunikasjon og kultur og leder for Nordic Centre for Internet and Society, til Digi.
Han er opprinnelig fra Sveits og Tyskland, og har i en årrekke forsket internasjonalt på digitale teknologier, digitale ulikheter, personvern og de sosiale og etiske implikasjonene av nye teknologier som kunstig intelligens.
Chat GPT-studie
I fjor gjennomførte Lutz en internasjonal studie sammen med Pawel Gmyrek fra Den internasjonale arbeidsorganisasjonen (ILO) og Gemma Newlands ved University of Oxford, der de så på hvorvidt språkmodellen til Open AI, GPT-4, forstår prestisje og sosial verdi av forskjellige jobber.
De ba språkmodellen kartlegge oppfattet prestisje og oppfattet samfunnsnytte i 580 ulike yrker, basert på en skala fra 0 til 100. De sammenlignet så tallene med svarene til menneskelige respondenter i Storbritannia.
– Ett funn er at GPT-4 er mer generøs med poengene generelt og gir mer prestisje enn mennesker. På en skala fra 0 til 100 gir den alt fra 20-30 poeng mer til mange yrker. Men den har ganske god korrelasjon med de menneskelige svarene, om man ser bort i fra summen. En doktor får høy prestisje, en rørlegger settes i midtsjiktet, mens manuelt arbeid som for eksempel gatefeier, settes som et lavstatusyrke, forteller Lutz.
Han mener at språkmodellen dermed kan benyttes til visse deler arbeidslivssanalyse.
Gir mer til digitale yrker
Språkmodellen ga imidlertid mer verdi til nye yrker i den digitale økonomien enn hva menneskene gjorde. Og i den grad man kan spøke med at den er selvopptatt, ga den mye høyere score til arbeid knyttet til språkmodeller enn folk flest.
– GPT-4 ga yrker knyttet til sosiale medier, Youtube og influencere rundt 30 poeng mer enn gjennomsnittet. Den ga også mye høyere verdi til digitalmarkedsførere og yrker knyttet til chatboter. Både trenere av chatboter og kundeservice via chatbot, mente den er veldig prestisjefylte jobber. Det mente ikke menneskene, smiler Lutz.
Professoren slår fast at modellen ikke kan kalles selvsentrert, men mener skjevheten skyldes at språkmodellen er trent på store datasett fra nettsider, Wikipedia og akademiske bøker – og at de nye yrkene ikke er så godt representert i treningsgrunnlaget.
– Vi vet litt om hvilke data som går inn i disse modellene. At de gir andre svar enn mennesker for nyere yrker, er trolig på grunn av skjevhet i treningsdataene. Men vi kan ikke slå fast at det er årsaken, sier han.
Opprettholder stereotypier
Svarene GPT-4 kom med, var i tillegg mer i tråd med verdiene til hvite og kvinnelige respondenter enn til mannlige med minoritetsbakgrunn. Lutz mener dette viser at språkmodellene kan reprodusere en del fordommer.
– Andre studier viser at språkmodeller som GPT, er trent på data fra engelskspråklige land, og de forstår ikke de sosiale kontekstene i andre land like godt. Den opprettholder stereotypier, og det er i offentlig interesse at vi følger med på dette, mener han.
Professoren poengterer at utviklere må være oppmerksomme på mulige fordomsfulle treningsdata, at lovgivning må på plass og at skoler og universiteter må undervise i kritisk tenkning, slik at brukere er klar over skjevheten i svar fra språkmodeller.
– Språkmodeller kan brukes til mye, men vi må tenke på om svarene vi får er sanne og riktige. De hallusinerer også mye, legger han til.
Må utbedres
Når det gjelder IT-folk, mente både mennesker og GPT-4 at de fleste IT-roller hadde høy prestisje og samfunnsnytte. Lutz mener IT-personell blir viktig i tiden som kommer for å følge med på og moderere de nye teknologiske løsningene.
– Styrken til kunstig intelligens som Chat GPT, er at den kan lage lang tekst veldig fort, men den har ikke bevissthet eller følelser, og forstår ikke de sosiale og relasjonelle aspektene slik mennesker gjør. Vi må passe på at vi får med disse menneskelige aspektene inn i møte med den nye teknologien, sier han.
– Den største hypen rundt språkmodeller er på vei ned, men nå ser vi hvor nyttige noen av disse verktøyene er. Vi må finne veier til å utbedre dem, ikke stoppe å benytte dem. Vi trenger mennesker i flere roller for å forbedre systemene, mener han.
Ny studie om generte bilder
Teamet bak yrkesstudien er nå i gang med en lignende studie, der de ser på hvilke representasjoner som får plass i billedgeneratorer som DALL·E.
– Vi ser på hvordan billedmodellen presenterer 130 yrker. Hvordan den mener en typisk taxi-sjåfør ser ut, eller en typisk IT-person. Vi har akkurat startet, men de første resultatene er interessante, forteller han og fortsetter:
– Tjenesten viser et mangfold, både i kjønn og rase. Men den viser stort sett unge og vakre mennesker. Skjønnhetsstandarden er høy og i samsvar med vanlige skjønnhetsstandarder i Vesten, sier Lutz.
Han mener å se at modellen noen ganger gir et skjevt bilde og presenterer for mye mangfold, selv om det ikke er like skjevt som noen av fremstillingene til den stoppede bildegeneratoren i Google Gemini.
– DALL·E viste for eksempel en kvinnelig elektriker og bagasjehåndterer, selv om det er sjelden i den virkelige verdenen. Fremstillingen er ikke alltid troverdig, mener Lutz.