top of page

En kritisk gjennomgang av bruken av store språkmodeller i kvalitativ forskning

for 3 døgn siden
7 min lesing
  1. oktober

KI og kvalitativ forskning

Mens generativ KI (GenAI) i raskt tempo forandrer det vitenskapelige forskningslandskapet, står kvalitative forskere overfor en teknologisk utfordring uten sidestykke: Kan dette nye verktøyet, drevet av store språkmodeller (LLM-er), virkelig løse den humanistiske oppgaven som kvalitativ dataanalyse er, en oppgave som grunnleggende hviler på fortolkningsarbeid? I en nylig publisert artikkel gir Nguyen og Welch (2025) et systematisk og skarpt svar på dette spørsmålet. De gir ikke bare en detaljert gjennomgang av de tekniske mekanismene bak generativ KI, men går også inn i en dyp filosofisk og metodologisk refleksjon over dens status som vitenskapelig instrument.

Hva er egentlig generativ KI?

Forfatterne understreker innledningsvis at generativ KI ikke er en form for generell intelligens, men snarere et sannsynlighetsbasert genereringssystem drevet av autoregressive store språkmodeller (AR-LLM-er). Disse modellene genererer tekst ord for ord ved å lære statistiske sammenhenger mellom termer i enorme tekstkorpus, og produserer svar som *fremstår* som sammenhengende og naturlige (Henighan et al., 2020; Wei et al., 2022a). Denne prosessen er imidlertid syntetisk snarere enn fortolkende. Selv om det genererte resultatet kan etterligne akademisk språks retoriske stil, innebærer det ingen reell semantisk forståelse (Nguyen & Welch, 2025).

Treningen av disse språkmodellene bygger på transformer-arkitekturen (Vaswani et al., 2017). Når systemet mottar brukerinput, enten i form av kommandoer eller råtekst, deler det inputen opp i tokens, legger den inn i et høydimensjonalt vektorrom, modellerer de kontekstuelle relasjonene og predikerer deretter fortløpende det mest sannsynlige neste ordet for å bygge opp svaret (Radford et al., 2018).

Et avgjørende poeng er at denne genereringsprosessen mangler enhver innebygd mekanisme for faktasjekk. Som Nguyen og Welch påpeker, er språkmodeller «ikke utformet for å avgjøre om svarene deres er sanne, deres output «trenger ikke å være korrekt, bare å fremstå som korrekt»» (Thornton, 2023). Den opplevde påliteligheten i disse svarene er dermed i stor grad en illusjon skapt av flyt i språket, og gjenspeiler ikke substansielt innhold.

Kriterier for å vurdere forskningsverktøyers vitenskapelige egnethet

Integrering av et hvilket som helst teknologisk verktøy i akademisk forskning, særlig innen kvalitativ analyse, kan ikke bygge utelukkende på nyhetsverdi eller effektivitet. Nguyen og Welch (2025) understreker at vitenskapelige verktøy må gjennomgå grundig validering etter fire kjernekriterier: faktisk nøyaktighet, pålitelighet, transparens og etisk forenlighet. Dessverre kommer generativ KI dårlig ut på alle fire områdene.

Når det gjelder faktisk nøyaktighet, har studier vist fenomenet «hallusinasjoner» i språkmodeller, altså tilfeller der modellen genererer fullstendig oppdiktet innhold pakket inn i overbevisende og autoritativt språk (Maynez et al., 2020; Kalai et al., 2025). Slike svar er ikke forankret i sannhet, men formet av statistiske mønstre lært fra treningsdataene.

Når det gjelder pålitelighet, er output fra språkmodeller svært ustabilt. Identisk input gir ofte vesentlig ulike svar avhengig av tidspunkt eller dialogrunde. Denne såkalte «sannsynlighetsdriften» (Achiam et al., 2023) undergraver i alvorlig grad den reproduserbarheten som ethvert vitenskapelig verktøy er avhengig av.

Når det gjelder transparens, fungerer språkmodeller som ugjennomsiktige systemer. Den komplekse arkitekturen og de ikke-offentliggjorte treningsprosessene skaper en «svart boks»-effekt som hindrer forskere i å spore hvordan svarene blir generert (Burrell, 2016; Marcus, 2024).

Endelig er de etiske bekymringene betydelige. Språkmodeller kan innlemme brukerinput i fremtidige treningsdata, noe som reiser alvorlige spørsmål knyttet til personvern, immaterielle rettigheter og informert samtykke (Lukas et al., 2023).

*Store språkmodeller og forskere som arbeider sammen i kvalitative studier*

Egner generativ KI seg til kvalitativ dataanalyse?

For å vurdere empirisk hva generativ KI kan bidra med i kvalitativ analyse, valgte Nguyen og Welch (2025) en metodologisk flerlaget og analytisk mangfoldig forskningstilnærming. I sentrum av studien stod et velkjent, omfattende kvalitativt datasett bestående av intervjuer, blogger, nyhetsartikler og tidsskriftartikler om bærbar datateknologi, fra 1980-tallet til 2010-tallet. Dette sikret både mangfold og fortrolighet med materialet, slik at forskerne kunne vurdere validiteten til resultatene fra generativ KI på en grundig måte.

Eksperimentet omfattet ulike promptingstrategier, blant annet zero-shot-, few-shot- og chain-of-thought-prompting (Wei et al., 2022b). For å styrke troverdigheten triangulerte de også funnene sine med resultater fra fem uavhengige studier av ChatGPT i kvalitativ forskning, og sammenlignet dem med KI-forsterkede funksjoner i kommersielle CAQDAS-verktøy som NVivo og QUALSOFT. Til sammen utgjorde disse kildene et solid kunnskapsgrunnlag i tre nivåer (Nguyen & Welch, 2025).

Resultatene var entydige: Selv når de analyserte de samme dataene, ga modellene for generativ KI svært inkonsistente svar fra kjøring til kjøring. Noen svar fremstod som ordrette gjengivelser av teksten, mens andre inneholdt oppdiktede sitater uten tilknytning til dataene. Selv med identiske prompter varierte svarene betydelig fra økt til økt. Denne uforutsigbarheten tvang forskerne til gjentatte ganger å starte analysen på nytt, sammenligne svar og kode dataene på nytt, noe som til slutt økte den analytiske arbeidsbyrden i stedet for å gjøre arbeidet mer effektivt.

Konklusjonen er utvetydig: dagens språkmodeller basert på transformer-arkitektur egner seg ikke til kvalitativ dataanalyse (Nguyen & Welch, 2025). Modeller som ChatGPT klarer ikke å kode kvalitative data konsistent og meningsfullt på en stabil, nøyaktig eller fullstendig måte, og de er fullstendig ute av stand til å fortolke sosial mening. Nettopp denne fortolkningen ligger likevel i kjernen av kvalitativ forskning, som en iboende menneskelig evne ingen automatisering kan gjenskape.

Fem epistemiske risikoer ved ukritisk bruk av generativ KI

Nguyen og Welch identifiserer fem alvorlige epistemiske risikoer som oppstår ved ukritisk bruk av generativ KI i kvalitativ forskning:

Kategorifeil: Å forveksle chatboter basert på språkmodeller med verktøy for kvalitativ analyse blander sammen språkets form og dets kognitive funksjon, og behandler syntetisk, mønsterbasert output som om det var reell fortolkende innsikt.

Upålitelige resultater: Resultater generert av språkmodeller er svært ustabile, inkonsistente og ikke reproduserbare; selv med raffinerte prompter oppfyller de ikke kravene til presisjon og troverdighet i kvalitativ forskning.

Antropomorfe feilslutninger: Å tillegge KI forståelse og samarbeidsevne er en feillesning av dens språklige flyt; det som ser ut som dialog, er bare gjentakelse av språklige mønstre og ikke et reelt engasjement med dataene.

Feilaktig årsaksattribusjon: Å skylde dårlige resultater på utilstrekkelig prompting flytter ansvaret bort fra modellens strukturelle begrensninger og skjuler at den ikke virkelig kan utføre fortolkende oppgaver.

Orakeleffekten: Å stole på KI-output som objektivt eller nøytralt fordi det har teknologisk opphav, tilslører mangelen på kontekst, logikk og mening, og undergraver til syvende og sist dybden og den etiske bevisstheten i kvalitativ forskning.

Den uerstattelige menneskelige kjernen i kvalitativ analyse

Et sentralt budskap som går gjennom hele Nguyen og Welchs arbeid, er at kvalitativ dataanalyse handler om fortolkning av mening, ikke om mekanisk bearbeiding. Dette fortolkningsarbeidet har flere lag: å identifisere uventede mønstre, abstrahere, teoretisere, utfordre antakelser og omforme begreper. Langt fra å være en deduktiv operasjon er dette et dypt subjektivt, erfaringsbasert og kontekstsensitivt arbeid.

Slik analyse er forankret i forskerens situerte forståelse av feltet, formet gjennom kroppslig engasjement og dialogisk samhandling i faglige fellesskap, en intersubjektiv prosess (Yanow & Schwartz-Shea, 2014). Selv blant fortolkende forskere som avviser positivistiske kriterier, finnes det en sterk etisk forpliktelse til epistemisk ansvar: å representere deltakerne på en tro måte, stille spørsmål ved egne antakelser, sikre transparens i forskningsprosedyrene, analysere systematisk og trekke logisk begrunnede konklusjoner (Nguyen & Welch, 2025).

Å overlate denne komplekse og iboende usikre prosessen til et verktøy som bygger på sannsynlighetsbasert mønstergjenkjenning snarere enn fortolkende resonnering, er å misforstå selve essensen i kvalitativ forskning.

En oppfordring til varsomhet og kollektivt ansvar i det akademiske fellesskapet

Nguyen og Welch retter en overbevisende kritikk mot den økende tendensen i det akademiske fellesskapet til ukritisk å omfavne ny teknologi. De hevder at det, før generativ KI blir et normalisert verktøy i kvalitativ forskning, er helt nødvendig å føre en grundig faglig debatt og etablere klare metodologiske og etiske standarder. For tidlig innføring uten grundig evaluering risikerer ikke bare å gi upålitelige funn, men også å rokke ved selve grunnlaget for kvalitativ forskningsmetodologi.

Med henvisning til Alvarado (2023) minner forfatterne oss om at vitenskapelig forskning består av mer enn teori og metode; den omfatter også en tredje dimensjon: verktøy. Legitimiteten til disse verktøyene kan ikke avgjøres av markedsbegeistring eller bedriftsmerkevarer alene; den må etableres gjennom kollektiv granskning i det akademiske fellesskapet. Dette understreker et felles ansvar: Hver kvalitativ forsker må forholde seg kritisk til teknologiene de bruker, og stadig spørre: «Er dette verktøyet virkelig egnet for kvalitativ forskning?» Dette er ikke bare et spørsmål om faglig skjønn, men et kjerneprinsipp i forskningsetikken.

References:

Achiam J., Adler S., Agarwal S., Ahmad L., Akkaya I., Aleman F. L., Almeida D., Altenschmidt J., Altman S., Anadkat S., Avila R., Babuschkin I., Balaji S., Balcom V., Baltescu P., Bao H., Bavarian M., Belgum J., Bello I., …, Zoph B. (2023). *GPT-4 technical report*. arXiv preprint arXiv:2303.08774. https://arxiv.org/abs/2303.08774v6.

Alvarado R. (2023). *Simulating science: Computer simulations as scientific instruments (Vol. 479)*. Springer Nature.

Burrell J. (2016). How the machine ‘thinks’: Understanding opacity in machine learning algorithms. *Big Data & Society*, 3(1), Article 2053951715622512. https://doi.org/10.1177/2053951715622512

Henighan T., Kaplan J., Katz M., Chen M., Hesse C., Jackson J., Jun H., Brown T. B., Dhariwal P., Gray S., Hallacy C., Mann B., Radford A., Ramesh A., Ryder N., Ziegler D. M., Schulman J., Amodei D., McCandlish S. (2020). *Scaling laws for autoregressive generative modeling*. arXiv preprint arXiv:2010.14701. https://arxiv.org/abs/2010.14701v2

Kalai A. T., Nachum O., Zhang E. (2025). Why language models Hallucinate. arXiv preprint arXiv:2509.04664. https://doi.org/10.48550/arXiv.2509.04664.

Lukas N., Salem A., Sim R., Tople S., Wutschitz L., Zanella-Béguelin S. (2023). Analyzing leakage of personally identifiable information in language models. IEEE Symposium on Security and Privacy (SP), 346–363. https://doi.org/10.1109/SP46215.2023.10179300

Marcus G. F. (2024). *Taming Silicon Valley: How we can ensure that AI works for us*. MIT Press.

Maynez J., Narayan S., Bohnet B., McDonald R. (2020). On faithfulness and factuality in abstractive summarization. In *Proceedings of the 58th annual meeting of the association for computational linguistics* (pp. 1906). Association for Computational Linguistics.

Radford A., Narasimhan K., Salimans T., Sutskever I. (2018). *Improving language understanding by generative pre-training*. OpenAI Technical Report. https://cdn.openai.com/research-covers/language-unsupervised/language_understanding_paper.pdf.

Thornton I. (2023). A special delivery by a fork: Where does artificial intelligence come from? *New Directions for Evaluation*, 23–32. https://doi.org/10.1002/ev.20560

Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser Ł., Polosukhin I. (2017). Attention is all you need. *Advances in Neural Information Processing Systems*, 30.

Wei J., Tay Y., Bommasani R., Raffel C., Zoph B., Borgeaud S., Yogatama D., Bosma M., Zhou D., Metzler D., Chi E. H., Hashimoto T., Vinyals O., Liang P., Dean J., Fedus W. (2022a). *Emergent abilities of large language models*. arXiv preprint arXiv:2206.07682. https://arxiv.org/abs/2206.07682v2

Wei J., Wang X., Schuurmans D., Bosma M., Ichter B., Xia F., Chi E., Le Q. V., Zhou D. (2022b). Chain-of-thought prompting elicits reasoning in large language models. *Advances in Neural Information Processing Systems*, 35, 24824–24837.

Yanow D., Schwartz-Shea P. (2014). *Interpretation and method: Empirical research methods and the interpretive turn* (2nd ed). Routledge.

Kommentarer


Dette initiativet støttes av følgende organisasjoner:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page