top of page

De moralske blindsonene til store språkmodeller: Kan vi stole på KIs etiske vurderinger? En systematisk analyse av kognitive skjevheter basert på fire eksperimenter

for 3 døgn siden
5 min lesing
  1. juli 2025

Etter hvert som store språkmodeller (LLM-er) blir bredt integrert i ulike beslutningssituasjoner, stoler folk i økende grad på at de gir moralske råd eller til og med deltar direkte i moralsk beslutningstaking. Men et avgjørende spørsmål må besvares: Kan disse KI-systemene virkelig foreta moralske vurderinger som samsvarer med menneskelige verdier?

Cheung mfl. (2025) undersøkte systematisk, gjennom fire eksperimenter, hvordan LLM-er reagerer når de står overfor realistiske moralske dilemmaer, og sammenlignet svarene deres med svarene fra et representativt utvalg amerikanere. De fant at LLM-er ikke bare i noen tilfeller hadde en tendens til å ta mer altruistiske valg enn mennesker, men også viste sterkere "unnlatelsesskjevhet" (omission bias) og "ja–nei-skjevhet" (yes–no bias) enn mennesker, noe som kan få dyptgripende konsekvenser for samfunnets beslutningstaking.

Den utbredte bruken av store språkmodeller i beslutningssammenhenger

Hvorfor studere KIs moralske vurderinger?

Bruksområder som er nært knyttet til menneskers daglige kommunikasjon, som velmente løgner mellom venner eller liv-og-død-beslutninger tatt av selvkjørende biler, innebærer i seg selv moralske hensyn. Selv om utviklere ofte bygger inn etiske retningslinjer under treningen, for eksempel ved å oppmuntre til "rettferdighet og vennlighet, og motvirke hat" (OpenAI, 2024), kan LLM-er fortsatt produsere hallusinerte svar eller vise skjevheter. Hovedmålet med denne studien er derfor å vurdere kvaliteten på LLM-enes moralske vurderinger i realistiske dilemmaer, særlig om de systematisk heller mot bestemte typer beslutninger under spesifikke betingelser.

Fire eksperimenter om KI som tar moralske beslutninger

Fire eksperimenter som utforsker KIs moralske beslutningstaking

Studie 1: Stilt overfor de samme moralske dilemmaene, er det LLM-er eller mennesker som oftest handler?

Forskerne ba ledende modeller som GPT-4, Claude 3.5 og Llama 3.1 om å svare på 13 moralske dilemmaer og 9 kollektive handlingsproblemer, og sammenlignet deretter svarene med svarene fra 285 amerikanske deltakere. Dilemmaene dekket to typer:

"Kost-nytte-resonnering (CBR) vs. moralske regler (Rule)": Om modeller og mennesker ville være villige til å "ofre de få for å redde de mange" når et regelbrudd ville gi større gevinster.

"Handling vs. unnlatelse": I mange tilfeller kan det å velge passivitet gjenspeile et forsøk på å unngå ansvar snarere enn en forpliktelse til moralske regler.

Resultatene viste at LLM-er i større grad heller mot passivitet i disse dilemmaene, særlig når handling kunne føre til moralsk konflikt.

Studie 2: Hvordan påvirker "ja"- eller "nei"-svar KIs vurderinger?

Forskerne fant at LLM-er er svært følsomme for hvordan spørsmål formuleres. For eksempel ga modellene motstridende svar på "Bør du endre loven for å legalisere assistert selvmord?" og "Bør du beholde dagens lov som forbyr assistert selvmord?", selv om scenarioene er logisk ekvivalente (ja–nei-skjevhet). Denne tendensen var særlig tydelig hos modeller som GPT-4-turbo og Claude 3.5, som foretrakk å svare "nei" uavhengig av hvilket moralsk standpunkt "nei" faktisk støttet.

Studie 3: Ytterligere verifisering

For å teste om funnene fra de to første eksperimentene gjelder i mer hverdagslige og naturlige moralske sammenhenger, gjennomførte forskerne et tredje eksperiment. Denne gangen valgte de virkelige dilemmaer sendt inn av brukere på Reddit-forumet "AITA (Am I The Asshole)". Sammenlignet med abstrakte dilemmaer som sporvognproblemet var disse scenarioene mer realistiske og lettere å kjenne seg igjen i. Resultatene viste igjen at selv om menneskelige deltakere også viste en mild unnlatelsesskjevhet, utviste KI-modellene mer ekstreme tendenser, særlig i dilemmaer som innebar avveininger mellom egeninteresse og andres velferd.

Studie 4: Kilden til skjevhetene: finjustering eller en gjenspeiling av menneskets natur?

Det fjerde eksperimentet gikk dypere inn i opphavet til disse skjevhetene i LLM-er. Forskergruppen sammenlignet tre modeller:

  1. Llama 3.1 (forhåndstrent versjon)

  1. Llama 3.1-Instruct (offisiell finjustert versjon fra Meta)

  1. Centaur (finjustert av kognitivforskere ved hjelp av atferd fra 160 000 menneskelige eksperimenter)

Resultatene tydet på at både ja–nei-skjevheten og unnlatelsesskjevheten hovedsakelig stammer fra finjusteringsfasen, ikke fra modellarkitekturen eller det omfattende treningskorpuset. Dette funnet understreker også den avgjørende rollen RLHF (forsterkende læring fra menneskelig tilbakemelding) spiller i å forme modellenes atferd. Under finjusteringen lærer modellen "hva brukerne liker", snarere enn "hva som er etisk riktig", noe som bidrar til å forklare hvorfor enkelte skjevheter forsterkes i KI.

Bør vi stole på at KI tar moralske beslutninger?

Bør vi stole på moralske beslutninger tatt av KI?

Denne studien vender til slutt tilbake til et grunnleggende spørsmål: Bør vi stole på at KI tar moralske beslutninger eller gir etiske råd? Selv om noe forskning tyder på at allmennheten oppfatter ChatGPTs moralske råd som mer pålitelige enn råd fra mennesker eller etikere (Madaio et al., 2024), advarer Cheung mfl. om at slik "popularitet" ikke er ensbetydende med etisk holdbarhet. I denne studien brukte de en "logisk konsistenstest" som en mer objektiv evaluering, nemlig om en modell gir konsistente svar på logisk ekvivalente spørsmål stilt med ulik ordlyd. Resultatene viste tydelig at ledende LLM-er ikke besto denne testen. Vurderingene deres ble lett påvirket av irrelevante variabler, som formuleringen "ja/nei" eller "handling/passivitet", noe som bryter med "invariansprinsippet" i teorien om rasjonelle valg.

Dessuten er modellenes skjevheter ikke alltid nøytrale. I noen scenarioer kan det å velge passivitet faktisk føre til større skade, for eksempel ved å unnlate å avdekke kritikkverdige forhold i virksomheter, nekte å hjelpe andre eller la være å reformere urettferdige systemer. Innenfor et utilitaristisk rammeverk kan slike beslutninger anses som umoralske.

Fra etisk skjevhet til institusjonell skjevhet: strukturelle insentiver bak KIs atferd

Det er verdt å merke seg at disse skjevhetene ikke nødvendigvis bare skyldes tekniske valg, men også kan gjenspeile KI-selskapenes egne insentiver til å unngå risiko. Sammenlignet med skade forårsaket av handling er passivitet ofte lettere å forsvare juridisk. Enkelte selskaper kan derfor bevisst trene modeller til å "ikke si noe" for å unngå mulig ansvar. Dette institusjonelle motivet speiler hvordan enkeltpersoner i moralske dilemmaer kan velge passivitet for å unngå moralsk fordømmelse. Slik sett kan store språkmodeller være i ferd med å forsterke et allerede eksisterende kulturelt mønster av risikoaversjon og ansvarsfraskrivelse.

Hva kan være de institusjonelle drivkreftene bak skjevheter i KI?

Konklusjon: Hvordan bør vi forstå KIs "velvilje"?

Denne studien avdekker ikke bare skjevhetsproblemer i store språkmodeller, men peker også på retninger for forbedring, blant annet innføring av evalueringer av logisk konsistens, fremme av tverrfaglig samarbeid for å utvikle standarder for etisk trening og utvidelse av dimensjonene for avdekking av skjevheter. Studien konkluderer med at selv om finjustering tar sikte på å "sikre at KI er nyttig og harmløs", kan den i realiteten forsterke moralske skjevheter og inkonsistente vurderinger. Det kan fortsatt være et betydelig gap mellom KI som "fremstår som moralsk" og KI som "virkelig er moralsk". Vi bør derfor forholde oss til bruken av LLM-er i moralske sammenhenger med varsomhet og kritisk tenkning, og fortsette å investere i tverrfaglig forskning for å sikre at KI i større grad samsvarer med menneskelige moralske prinsipper.

Referanser:

Cheung, V., Maier, M., & Lieder, F. (2025). Large language models show amplified cognitive biases in moral decision-making. Proceedings of the National Academy of Sciences of the United States of America, 122(25), e2412015122.

https://doi.org/10.1073/pnas.2412015122

Dillon, D., Mondal, D., Tandon, N., & Gray, K. (2025). AI language model rivals expert ethicist in perceived moral expertise. Scientific Reports, 15, Article 4084.

https://doi.org/10.1038/s41598-025-86510-0

OpenAI. (n.d.). Introducing the model spec: Transparency in OpenAI’s models. OpenAI. Retrieved May 10, 2024, from

https://openai.com/index/introducing-the-model-spec/

Kommentarer


Dette initiativet støttes av følgende organisasjoner:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page