Kan LLM-er stille som menneskelige forsøkspersoner?
Oppdatert: for 13 timer siden

Image: "Empty seats" by ProjectManhattan (CC BY-SA 3.0) via Wikimedia Commons, recoloured.
3. august
Velkommen til ukens oversikt over hvordan kunstig intelligens omformer forskningen, hentet fra Nature, Science, PNAS og ledende forretningstidsskrifter.
LLM-er som syntetiske forsøkspersoner: billige piloter, eller en snarvei for langt?
Den mest konsekvensrike metodedebatten i samfunnsvitenskapene akkurat nå, er hvorvidt en språkmodell kan stille i stedet for en menneskelig deltaker. I Strategic Management Journal presenterer Matteo Tranchero, Cecil-Francis Brenninkmeijer, Arul Murugan og Abhishek Nagaraj et av de mest konkrete svarene så langt for strategiforskning: et rammeverk for å designe og gjennomføre simulerte eksperimenter med [LLM-drevne agenter som syntetiske forsøkspersoner](https://doi.org/10.1002/smj.70112). Anvendt på det klassisk eksplorering–utnyttelse-dilemmaet rapporterer de at LLM-baserte eksperimenter gjenskaper mønstre observert blant menneskelige deltakere – nøyaktig det resultatet som gjør tilnærmingen både fristende og farlig.
Forfatterne posisjonerer metoden som et verktøy for [rask, billig prototyping av eksperimenter med mennesker og for å generere nye hypoteser](https://doi.org/10.1002/smj.70112) – ikke som en erstatning for humane data. Den rammen betyr noe. En syntetisk pilot som koster noen få dollar og kjører over natten, kan drepe et dårlig design før du bruker ekte penger på et panel, eller utforske et parameterrom ingen IRB-godkjent studie ville ha råd til. Men å gjengi et kjent atferdsmønster er en svak test: en modell trent på tiår med publisert samfunnsvitenskap bør kunne finne igjen funn som finnes i treningsdataene dens. Å treffe lærebokresultatet er minimumskravet, ikke validering – det interessante spørsmålet er om agentene får de *nye* tilfellene riktige, og nettopp der har du ingen menneskelig benchmark å sjekke mot.
**Hvorfor det betyr noe:** Hvis du gjennomfører eksperimenter – i markedsføring, ledelse, IS eller psykologi – er dette nå et reelt designvalg, ikke en kuriositet. Det forsvarlige er oppstrøms: pilot test stimuliene dine, beskjær betingelsene, generer hypoteser, og samle deretter menneskedata for alt du har tenkt å hevde. Det uforsvarlige er nedstrøms: å rapportere agentatferd som bevis om mennesker. Fagfellevurdererne skjerper allerede dette skillet, og en artikkel som visker det ut, blir tatt. Les rammeverket, lån prototyping-arbeidsflyten, og behold menneskene i de bekreftende studiene.
Mer fra denne uken
PNAS spør om forskningen forblir en menneskelig virksomhet
Michael Hochberg og Peter H. Thrall bruker et PNAS-perspektiv til å stille spørsmålet nakent: KI vil omorganisere vitenskapen, og det er et åpent spørsmål om forskningen forblir en menneskelig virksomhet. Den er et nyttig følgebrev til det empiriske arbeidet om KI-adopsjon, fordi den flytter rammen fra individuell produktivitet til strukturen i selve forskningsvirksomheten – hvem setter spørsmålene, hvem får æren, og hva blir den menneskelige rollen?
[Les originalen i PNAS, 29. juli →](https://doi.org/10.1073/pnas.2610088123)
Overvåkningskameraer blir en «offline clickstream»
Fysiske forhandlere har aldri hatt den sanntids atferdsinnsikten som klikkstrømdata gir e-handel. I Information Systems Research bygger Rubing Li, Wen Wang, Kaiquan Xu og Anindya Ghose et videoanalyserammeverk som gjør vanlige overvåkningsopptak fra butikken om til en strukturert atferdsregistrering – med person-gjenidentifisering, trajektorrekonstruksjon, poseestimering og visjon-språkmodeller for å forutsi kjøp i butikk. For konsumentforskere er det både en rik ny datakilde og et levende personvernspørsmål som bør tenkes igjennom før dataene lander i laboratoriet ditt.
[Les originalen i Information Systems Research, 29. juli →](https://doi.org/10.1287/isre.2023.0432)
Medisinsk KI har et måleproblem
I Nature argumenterer Arjun K. Manrai for at feltet som evaluerer medisinsk KI, måler feil ting. Kritikken gjelder langt utover medisinen: Enhver disiplin som tar i bruk ledertavle-preget benchmarks, arver kløften mellom å skåre godt på et kuratert testsett og å være nyttig i det uordnede miljøet verktøyet er ment å tjene. Verdt å lese hvis du designer evalueringer av KI-verktøy i ditt eget felt.
[Les originalen i Nature, 28. juli →](https://doi.org/10.1038/d41586-026-02125-z)
KI-generert voksent innhold og forbrytelser i det fysiske liv
Siddharth Bhattacharya, Yun Young Hur og Gal Oestreicher-Singer rapporterer i MIT Sloan Management Review at en analyse av detaljerte kriminalitetsdata fra Japans nasjonale politietat fant statistisk signifikante økninger i voldtekt i perioder med topp-engasjement i materiale merket som KI-generert og kun for voksne. Forfatterne rammer dette inn som en truende omdømme- og juridisk risiko for selskaper som tilbyr slike verktøy og arenaer. Som ved ethvert observasjonelt design om sensitive utfall, fortjener identifikasjonen et grundig lesing – men spørsmålet det reiser om generativ KIs nedstrøms sosiale effekter, kan næringslivsforskere ikke la ligge.
[Les originalen i MIT Sloan Management Review, 29. juli →](https://doi.org/10.63383/wiap5820)
En KI-«raygun» endrer størrelse på proteiner
Nature omtaler Raygun, et KI-system som kan krympe eller forstørre proteiner – en evne utviklerne sier åpner døren til enklere proteinredigering. Det minner oss om at mens samfunnsvitenskapene debatterer syntetiske forsøkspersoner, produserer generative modeller i biovitenskapene design som blir testet på en laboratoriebenk, ikke diskutert på et seminar.
[Les originalen i Nature, 29. juli →](https://doi.org/10.1038/d41586-026-02335-5)
Tolkbare behandlingsregler, lært fra observasjonsdata
Nathanael Jo, Sina Aghaei, Andrés Gómez og Phebe Vayanos presenterer en blandet-heltalls-optimaliseringsmetode i Management Science for å lære optimale preskriptive trær – tolkbare behandlingstilordningspolicyer i binær-treform – fra observasjonsdata i stedet for randomiserte. For fagfelt der et tiltak må forklares for en regulator, en lege eller en leder, er en tolkbar policy av moderat dybde ofte verdt mer enn en marginalt bedre svart boks.
[Les originalen i Management Science, 30. juli →](https://doi.org/10.1287/mnsc.2021.02813)
Dette var ukens innhold. Videresend gjerne artikkelen til en kollega som står foran en pilotstudie – og utforsk KI-verktøy for egen forskning på gaiforresearch.com.
KI-forskningsnytt





Kommentarer