KI som fagfellevurderer: GPT-4 er på nivå med menneskelige eksperter i vitenskapelig tilbakemelding
september 2024 (oppdatert 8. oktober 2024)
Denne artikkelen, med tittelen «Can Large Language Models Provide Useful Feedback on Research Papers? A Large-Scale Empirical Analysis», er et samarbeid mellom et mangfoldig forskerteam med ulik faglig bakgrunn og institusjonstilhørighet. Studien ble publisert 17. juli 2024 i *NEJM AI*, bind 1, nummer 8. Artikkelen undersøker potensialet store språkmodeller (LLM-er) har for å gi nyttige tilbakemeldinger på forskningsartikler, og presenterer en storskala empirisk analyse av spørsmålet. Denne banebrytende studien utforsker potensialet til store språkmodeller, nærmere bestemt GPT-4, for å gi nyttige tilbakemeldinger på forskningsartikler. Forskerne utviklet en automatisert prosess med GPT-4 for å generere strukturerte tilbakemeldinger på vitenskapelige artikler, og gjennomførte to storskalastudier for å evaluere hvor effektiv den er.
Hovedfunn
Retrospektiv analyse:
Sammenlignet GPT-4s tilbakemeldinger med tilbakemeldinger fra menneskelige fagfellevurderere på 3 096 artikler fra tidsskriftene i *Nature*-familien og 1 709 artikler fra ICLR-konferansen.
Overlappet mellom tilbakemeldingene fra GPT-4 og menneskelige vurderere (30,85 % for *Nature*-tidsskriftene, 39,23 % for ICLR) var sammenlignbart med overlappet mellom to menneskelige vurderere (28,58 % for *Nature*-tidsskriftene, 35,25 % for ICLR).
GPT-4s tilbakemeldinger overlappet mer med menneskelige vurderere for svakere artikler (f.eks. avviste ICLR-artikler).
Prospektiv brukerstudie:
Spørreundersøkelse blant 308 forskere fra 110 amerikanske institusjoner innen KI og beregningsbiologi.
57,4 % av brukerne mente at tilbakemeldingene fra GPT-4 var nyttige eller svært nyttige.
82,4 % mente de var mer nyttige enn tilbakemeldinger fra i det minste enkelte menneskelige vurderere.
Kjennetegn ved GPT-4s tilbakemeldinger:
GPT-4 identifiserte oftere problemer som ble påpekt av flere menneskelige vurderere.
Modellen hadde en tendens til å vektlegge visse aspekter ved tilbakemeldingen mer enn mennesker (f.eks. forskningens implikasjoner).
GPT-4 genererte ikke-generiske, artikkelspesifikke tilbakemeldinger.
Begrensninger:
GPT-4 hadde tidvis vanskelig for å gi inngående kritikk av metodedesign.
Modellen hadde en tendens til å vektlegge visse aspekter ved vitenskapelig tilbakemelding mer enn andre.
Implikasjoner: Studien tyder på at selv om vurdering fra menneskelige eksperter fortsatt bør være fundamentet i den vitenskapelige prosessen, kan tilbakemeldinger generert av LLM-er være nyttige for forskere, særlig når rask eksperttilbakemelding ikke er tilgjengelig eller i tidlige faser av manuskriptarbeidet. Funnene indikerer at tilbakemeldinger fra LLM-er og mennesker kan utfylle hverandre og potensielt heve den samlede kvaliteten på vitenskapelig vurdering og tilbakemelding.





Kommentarer