top of page

Ekko i KI: Hvorfor store språkmodeller sliter med variasjon i handlingen

for 3 døgn siden
5 min lesing
  1. september 2025

KI-kreativitet sammenlignet med menneskelig fantasi: store språkmodeller genererer mønstre basert på treningsdata, mens menneskelig kreativitet henter næring fra unike erfaringer og følelser.

Bakgrunn: KI og kreativitet

Store språkmodeller (LLM-er) utvikler seg i bemerkelsesverdig tempo. Fra å skrive fortellinger og poesi til idémyldring er deres tilstedeværelse i kreativt arbeid ubestridelig. Men her ligger et grunnleggende spørsmål: kan disse modellene faktisk støtte kollektiv kreativitet, eller etterligner de den bare?

Tidligere studier gir et blandet bilde. På den ene siden har LLM-er vist lovende resultater innen kreativ skriving, poesi, idégenerering og til og med kreativ tenkning. På den andre siden viser forskning at kreativiteten deres henger etter menneskers, og at fortellingene deres ofte vurderes som "forutsigbart svake".

Denne spenningen strekker seg også til kollektive sammenhenger. Selv om KI kan få en enkeltperson til å føle seg mer kreativ, kan den redusere mangfoldet av ideer på tvers av grupper (Doshi & Hauser, 2024; Padmakumar & He, 2024). Lærere ser ofte dette i praksis: det første KI-genererte essayet kan virke imponerende, men ved det tiende gjentar mønstrene seg. Det som en gang virket "kreativt", ser nå formelpreget ut.

Når fortellinger begynner å gi ekko

Forfatterne av denne studien beskriver disse gjentakelsene som "ekko".

Ta Franz Kafkas novelle *Give It Up* (Gi det opp). GPT-4 ble bedt om å generere 100 fortsettelser, og ingen av dem lignet Kafkas faktiske, overraskende slutt. I stedet rådet 50 hovedpersonen til å "ta andre til venstre", 18 sa "ta andre til høyre", andre lot politimannen vise fortelleren veien, og 16 nevnte et bakeri. Disse ekkoene omfattet både ordvalg og narrativ struktur, noe som viser hvordan modellene resirkulerer på ulike nivåer.

Tidligere arbeider har allerede påpekt redusert leksikalsk variasjon i LLM-er (Mohammadi, 2024). Denne studien viser at problemet stikker dypere: ekko oppstår på handlingsnivå, der hele fortellingselementer gjentas.

Å måle egenart: Sui Generis-skåren

For å tallfeste originalitet introduserer forskerne Sui Generis-skåren (latin for "av sin egen art"). Ideen er enkel:

  1. Del en fortelling opp i segmenter.

  2. Generer flere alternative fortsettelser.

  3. Undersøk hvor ofte hvert segment går igjen på tvers av resultatene.

Segmenter som gjentas ofte, får lav skår, mens unike vendinger får høy skår. I en menneskeskrevet fortelling der folk mottok mystiske lapper med teksten "DUCK!" (and/dukk!), fikk for eksempel den avsluttende vrien, en lapp med teksten "Goose" (gås), høy skår. De forutsigbare utviklingene i midtpartiet fikk derimot lav skår.

Bak eksperimentet

Teamet testet 100 fortellinger hentet fra to datasett:

  • Writing Prompts (Reddit): menneskeskrevne fortellinger som svar på skriveoppgaver.

  • Wikipedia-sammendrag av TV-episoder: komprimerte versjoner av virkelige fortellingsbuer.

Både menneskelige og KI-genererte fortellinger ble delt inn i like lange biter. To toppmoderne modeller ble brukt: GPT-4 (OpenAI, 2024) og LLaMA-3 (Pandey et al., 2024). Dette oppsettet muliggjorde en direkte sammenligning mellom menneskelig og maskinell kreativitet.

Variasjon i fortellerkunst tydeliggjør kontrasten mellom menneskelige fortellinger, fulle av uventede vendinger, og KI-genererte fortellinger, som ofte gjentar lignende handlingsstrukturer.

Hva tallene viser

Menneskelige fortellinger fikk konsekvent høyere skår og viste mer originalitet og uforutsigbarhet enn LLM-resultatene. I tillegg var ekkoene ikke begrenset til én modell. Resultatene fra GPT-4 og LLaMA-3 overlappet betydelig, noe som avdekker et bredere mønster av homogenisering på tvers av systemer.

Tempo skilte også menneskene ut. Mens menneskelige fortellinger bygde opp spenning gradvis, hastet LLM-fortellinger ofte mot en løsning. Dette viste seg i plutselige "skårfall" etter høydepunkter, som signaliserte brå og utilfredsstillende avslutninger.

Til slutt bekreftet menneskelige vurderinger målets validitet. Vurderinger av overraskelse korrelerte moderat (ρ = 0,55) med Sui Generis-skårene, noe som viser at målet samsvarer med menneskers intuisjon om nyhet.

Hvorfor det er viktig

Standardmål for likhet som BLEU, ROUGE eller innbyggingsbaserte mål fanger ofte bare opp overfladiske overlapp (Ghosal et al., 2022; Shaib et al., 2024). Sui Generis-skåren går dypere og samsvarer bedre med menneskelige vurderinger av kreativitet.

Mønstre i skåringen ga ytterligere innsikt. LLM-fortellinger med lav skår var gjerne intetsigende eller klisjépregede. De med høy skår, enten de var skrevet av mennesker eller KI, inneholdt rikere detaljer og ukonvensjonelle handlinger. Men mennesker gjorde det fortsatt bedre enn modellene ved å bruke ikke-lineære strukturer som tilbakeblikk, noe LLM-er sjelden fikk til.

Skårene fremhevet også narrative vendepunkter: overraskelser og vendinger samlet seg der skårene toppet seg, mens forutsigbart fyllstoff fikk lave karakterer. Dette viser at målet kan fungere både som evalueringsverktøy og som en måte å kartlegge en fortellings struktur på.

Selv om metoden er beregningsmessig kostbar (rundt 910 modellkall per fortelling, omtrent 7 dollar), gjør fallende inferenspriser dette til en mindre barriere over tid. Utover evaluering kan Sui Generis også styre selve genereringen, ved å prioritere unike segmenter for å skape mer originale fortellinger, selv om det krever ekstra beregning.

Store språkmodeller (LLM-er) som GPT-4 og LLaMA produserer ofte overlappende handlingsforløp, et fenomen studien beskriver som narrative "ekko".

Begrensninger å ha i mente

To forbehold skiller seg ut. Noen datasett kan overlappe med LLM-enes treningsdata, selv om memorering ikke så ut til å drive resultatene her. Og metoden er avhengig av GPT-4 for semantisk vurdering; svakere modeller kan forvrenge skårene, så pålitelighet krever modeller med sammenlignbar språkevne.

Veien videre

Konklusjonen er klar: isolert sett kan LLM-resultater virke nyskapende, men på tvers av mange utvalg dominerer ekkoene. Menneskelige fortellinger forblir mer varierte, rikere og mindre forutsigbare.

Sui Generis-skåren fanger opp dette gapet. Den tallfester ikke bare egenart i fortellerkunst, men korrelerer også med menneskers opplevelse av overraskelse. Potensialet strekker seg utover tekst, med et rammeverk som kan tilpasses musikk, bilder eller video.

På et bredere plan reiser studien kulturelle bekymringer. Homogeniserte KI-resultater risikerer å snevre inn kreativt uttrykk og redusere mangfold. Likevel gir det samme målet også håp: et verktøy for å diagnostisere og motvirke disse mønstrene og dytte KI mot mer.

References:

Doshi, A. R., & Hauser, O. P. (2024). Generative AI enhances individual creativity but reduces the collective diversity of novel content. *Science Advances*, *10*(28), eadn5290. https://doi.org/10.1126/sciadv.adn5290

Ghosal, T., Saikh, T., Biswas, T., Ekbal, A., & Bhattacharyya, P. (2022). Novelty Detection: A Perspective from Natural Language Processing. *Computational Linguistics - Association for Computational Linguistics*, *48*(1), 77–117. https://doi.org/10.1162/coli_a_00429

Mohammadi, B. (2024). Creativity Has Left the Chat: The Price of Debiasing Language Models. *arXiv.Org*.

OpenAI, Adler, S., Agarwal, S., Ahmad, L., Almeida, D., Avila, R., Babuschkin, I., Suchir Balaji, Balcom, V., Baltescu, P., Bao, H., Berner, C., Anna-Luisa Brakman, Brundage, M., Cai, T., Campbell, R., Chan, B., Chantzis, F., Chen, S., … Zhao, S. (2024). GPT-4 Technical Report. *arXiv.Org*.

Padmakumar, V., & He, H. (2024). Does Writing with Language Models Reduce Content Diversity? *arXiv.Org*.

Pandey, A., Letman, A., Yang, A., Fan, A., Rao, A., Spataru, A., Marra, C., Wong, C., Song, D., Wyatt, D., Lakomkin, E., Radenovic, F., Synnaeve, G., Georgia Lewis Anderson, Zarov, I., Copet, J., Mahadeokar, J., van der Linde, J., Hong, J., … Rait, Z. (2024). The Llama 3 Herd of Models. *arXiv.Org*.

Shaib, C., Barrow, J., Sun, J., Siu, A. F., Wallace, B. C., & Nenkova, A. (2024). Standardizing the Measurement of Text Diversity: A Tool and a Comparative Analysis of Scores. *arXiv.Org*.

Xu, W., Jojic, N., Rao, S., Brockett, C., & Dolan, B. (2025). Echoes in ai: Quantifying lack of plot diversity in llm outputs. *Proceedings of the National Academy of Sciences*, *122*(35), e2504966122.

Kommentarer


Dette initiativet støttes av følgende organisasjoner:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page