top of page

Nytt rammeverk for generativ KI som genererer og evaluerer vitenskapelige hypoteser

for 6 døgn siden
3 min lesing
  1. oktober 2024

Tenk om vi kunne automatisere oppdagelsen av banebrytende vitenskapelige hypoteser og åpne nye muligheter raskere enn noen gang før. Tre forskningsgrupper har tatt et betydelig steg i den retningen og lansert maskinlæringsrammeverk som er utviklet for å generere og evaluere vitenskapelige hypoteser med bemerkelsesverdig effektivitet.

Det nye rammeverket er bygget rundt tre sentrale trinn: uttrekking, generering og evaluering av hypoteser. Først trekker systemet ut eksisterende hypoteser fra vitenskapelig litteratur og representerer dem i form av utsagnslogikk. Deretter bruker det en forbedret maskinlæringsmodell til å generere nye hypoteser basert på denne kunnskapen. Til slutt evaluerer et sett grafteoretiske mål de genererte hypotesenes nyhetsverdi og relevans.

Arbeidet er del av en bredere bølge av nye maskinlæringsrammeverk som tar sikte på å automatisere generering av vitenskapelige hypoteser. Nyere forskning har presentert flere andre rammeverk som viser potensial på dette området, og som utnytter store språkmodeller (LLM-er) som GPT-4 og Claude-2 til å fremskynde vitenskapelige oppdagelser på ulike felt, inkludert psykologi.

Et bemerkelsesverdig rammeverk, HypoGeniC, utviklet ved University of Chicago, konsentrerer seg om å generere hypoteser basert på merkede data. HypoGeniC arbeider i tre trinn:

  1. Innledende hypotesegenerering: Rammeverket analyserer et lite antall eksempler for å generere innledende hypoteser.

  2. Iterativ hypoteseoppdatering: Med inspirasjon fra flerarmede banditter bruker HypoGeniC en belønningsfunksjon til å forbedre hypotesene iterativt, med balanse mellom utforskning og utnyttelse av mulige hypoteser.

  3. Hypotesebasert inferens: Rammeverket bruker de genererte hypotesene til å gjøre prediksjoner på nye data, med en rekke inferensstrategier som utnytter den samlede kunnskapen fra flere hypoteser.

Tester av HypoGeniC på syntetiske og virkelige datasett, som avdekking av villedende anmeldelser, prediksjon av overskrifters popularitet og prediksjon av tweeters popularitet, har gitt lovende resultater. I mange tilfeller presterer HypoGeniC bedre enn referansemodeller basert på få-eksempel-læring, og det matcher eller overgår til og med tradisjonelle metoder for veiledet læring. Dette tyder på at hypotesebasert inferens er effektiv.

En annen studie, fra Tsinghua University, introduserer rammeverket LLM-basert kausal graf (LLMCG), som utnytter samspillet mellom kausale kunnskapsgrafer og LLM-er til å automatisere generering av psykologiske hypoteser:

  1. Litteratursøk: LLMCG analyserer et stort korpus av psykologiartikler for å trekke ut kausale sammenhenger og bygger en spesialisert kausal graf for psykologi.

  2. Uttrekking av kausale par: Ved hjelp av LLM-er identifiserer og trekker rammeverket ut kausale sammenhenger fra teksten i vitenskapelige artikler, med vekt på sammenhenger som er eksplisitt uttrykt i forskningsfunnene.

  3. Hypotesegenerering med lenkeprediksjon: LLMCG bruker algoritmer for lenkeprediksjon til å identifisere mulige kausale sammenhenger i den konstruerte kausale grafen. Disse brukes deretter til å generere nye hypoteser.

Evalueringen av LLMCG sammenlignet rammeverkets hypoteser om velvære med hypoteser generert av ph.d.-studenter og av LLM-er alene. Resultatene viser at LLMCG genererer hypoteser med nyhetsverdi på nivå med hypotesene fra menneskelige eksperter (ph.d.-studenter), og betydelig mer nyskapende enn hypoteser generert av LLM-er alene. Koblingen til kausale grafer gjør at rammeverket kan generere hypoteser forankret i eksisterende psykologisk kunnskap, samtidig som det utforsker mulige nye forbindelser mellom begreper.

Selv om disse rammeverkene har ulike konkrete tilnærminger, deler de et felles mål: å automatisere den ofte tidkrevende og arbeidskrevende prosessen med å generere vitenskapelige hypoteser. Ved å kombinere LLM-er med kausale kunnskapsgrafer, strukturerte representasjoner og sofistikerte evalueringsmål styrker de i betydelig grad evnen til å bidra til vitenskapelig framgang.

Rammeverket fra University of Washington understreker, sammen med disse andre initiativene, det store potensialet maskinlæring har for å revolusjonere hypotesegenerering. I innledende tester på ulike datasett har rammeverket fra University of Washington generert hypoteser som både er nyskapende og relevante for pågående forskning. Slike egenskaper viser hvordan maskinlæring kan forandre hypotesegenerering og fremskynde innovasjon.

Implikasjonene av dette arbeidet er store. Ved å automatisere hypotesegenerering kan forskere øke antallet spørsmål de kan teste betydelig, noe som i siste instans kan gi raskere innovasjon og flere oppdagelser. Gevinsten ved slike framskritt går ut over økt effektivitet: de gir også løfte om å avdekke nye veier og perspektiver som ellers kunne ha blitt oversett.

Teamet ved University of Washington arbeider aktivt med å forbedre rammeverket og utvide bruken til andre felt, som medisin og ingeniørfag. Målet er å gjøre verktøyet tilgjengelig for forskere overalt, slik at de kan utforske frontene i sine fagfelt med større fart og kreativitet. Se presentasjonen av forskningen deres nedenfor.

Dette arbeidet gir et spennende glimt inn i framtidens vitenskapelige forskning, der intelligente algoritmer kan gi inspirasjon og lede veien mot nye oppdagelser.

Kommentarer


Dette initiativet støttes av følgende organisasjoner:

  • Twitter
  • LinkedIn
  • YouTube
logo_edited.png
bottom of page