WebGPT: studien som lärde AI:n citera — och varför källorna ser ut som de gör
Citering byggdes in i generativa svar från första dagen. WebGPT (OpenAI, preprint 2021) tvingades samla referenser medan den bläddrade — just för att svarens fakta skulle gå att kontrollera. Svaren föredrogs av människor 56 % av tiden framför mänskliga demonstratörer, och 69 % av tiden framför Reddit:s högst röstade svar. Källistan under ett AI-svar är alltså inget tillägg: den är kärndesignen.
För er som jobbar med GEO är studien ursprungsberättelsen: varför AI-svar har källor över huvud taget, och vad det var för egenskaper som belönades när svaren rangserades av människor. Mekaniken i hur motorerna väljer källor idag finns i Hur väljer AI-motorerna vilka företag de citerar? — här går vi till källan.
Att datumet är 2021 gör studien mer intressant, inte mindre: citeringskravet fanns på plats innan generativ sökning blev en produktkategori. Det som idag ser ut som branschstandard var alltså ett medvetet designval — och designval går att förstå och utnyttja.
Varför har AI-svar källor över huvud taget?
För att skaparna designade för mänsklig kontroll. OpenAI:s motivering står som ett krav i studien: ”To make human evaluation of factual accuracy easier, models must collect references while browsing in support of their answers.” Modellen måste alltså samla referenser medan den bläddrar, så att bedömarna kunde granska svarens påståenden utan att själv göra ”en svår och subjektiv researchprocess”. Referenserna var dessutom utdragna textpassager från webbsidorna — inte fria URL:er eller en startsida.
Poängen har inte åldrats en dag: en källhänvisning har funktionen att låta någon annan verifiera påståendet. Det är samma logik som gör att en motor helst vill citera en passage som faktiskt innehåller påståendet — inte en sida som kanske rörar ämnet. Hur bra dagens system är på det mäter Princeton-benchmarken ALCE.
Detaljen att referenserna var extraherade passager förtjänar att stanna kvar: OpenAI kunde ha designat en modell som bara länkar till sidor. De valde i stället att svaret skulle bära med sig själva beläggen — textbitarna svaret byggde på. En länk säger ”kolla själv”; en passage säger ”här är grunden”. Det är skillnaden mellan en källförteckning och ett citat, och den skillnaden är fortfarande det som avgör om ert innehåll går att bygga ett svar på.
Hur tränades WebGPT att skriva välunderbyggda svar?
Demonstrera
Behavior cloning: GPT-3 finjusterades på ca 6 000 mänskliga demonstrationer av bläddrande frågesvar i en textbaserad webbläsarmiljö — ca 92 % av dem från Reddit-forumat ELI5.
Rangseriera
En belöningsmodell tränades på mänskliga jämförelser: ca 16 000 användes av ca 21 500 insamlade, nästan alla ELI5-frågor. Människor röstade fram vilket svar de föredrog.
Belöna det bästa
Rejection sampling: modellen skrev flera svar (best-of-4/16/64) och belöningsmodellen valde det mest människoliknande trovärdiga.
En detalj som ofta missförstås: den bästa modellen tränades inte med reinforcement learning. RL (PPO) testades, men OpenAI skriver att man exkluderade det ”for simplicity, since it did not provide significant benefit when combined with rejection sampling”. I direkta jämförelser föredrogs rejection sampling 68 % av tiden framför enbart behavior cloning, medan RL klarade bara 58 % i samma jämförelse. Bästa modellen blev alltså behavior cloning plus rejection sampling.
Pipelinen var dessutom stängd mot fusk: Reddit och Quora var bortfiltrerade ur webbläsaren, så modellen inte kunde hitta färdiga svar på just ELI5-frågorna. Träningsdata och utvärdering kom från samma typ av frågor — långformatsförklaringar — vilket är en av anledningarna att resultaten ska läsas som ”så går det att bygga”, inte som en generalisering om alla slags frågor.
Hur bra blev svaren?
Ur värderingen av människor, i huvudresultatet och i TruthfulQA:
| Jämförelse | Resultat |
|---|---|
| Mot mänskliga demonstratörer | WebGPT:s svar föredrogs 56 % av tidenNakano m.fl. (OpenAI), abstract |
| Mot Reddit:s högst röstade svar | WebGPT:s svar föredrogs 69 % av tidenNakano m.fl. (OpenAI), abstract |
| TruthfulQA, sanna svar | 75 % av tidenNakano m.fl., fulltext |
| TruthfulQA, sanna och informativa | 54 % — bättre än GPT-3-basmodellen, under mänsklig nivåNakano m.fl., fulltext |
Villkoren spelar roll när siffrorna ska tolkas: frågorna kom från ELI5 (långformats-frågor från Reddit), inte kommersiella sökfrågor, och studien är en preprint från 2021. De visar principen — att det gick att träna ett system vars svar med referenser föredrogs framför både tränade demonstratörer och Reddit:s bästa — inte dagens produkters nivå. Lägg märke till glappet i TruthfulQA-raderna också: att vara sann och att vara sann och informativ är två olika nivåer, och modellen klarade den första betydligt bättre än den andra. Även det är en designlektion — faktagranskning och användbarhet kan behöva optimeras var för sig.
Vad betyder ”belönad trovärdighet” för er webbplats?
Modellen optimerades mot det människor föredrar — och det människor föredrar är svar vars påståenden har synligt, kontrollerbart stöd. För er sajt följer en konkret konsekvens: konsekvens mellan påstående och källa. Ett citat kan återge en passage. Om påståendet står i ett stycke och stödet (siffran, definitionen, jämförelsen) står tre skärmar längre ner, är det inte en passage — det är två halvsanningar med mellanrum.
Därför är den praktiska regeln att låta påstående och stöd bo i samma stycke, så att ett enda citat räcker. Det är exakt den egenskap ALCE mäter som citation recall — hur ofta svaret helt stöds av de citerade passagerna. Och det är samma tröskel som avgör om ert innehåll är citerbart i motorernas källval.
Trovärdighet i det här sammanhanget är alltså till stor del ett formuleringsproblem, inte ett ryktproblem. Två företag kan ha exakt samma fakta; den som skriver dem som återgivbara påståenden — med siffra, definition och omfång i samma stycke — ger modellen något att citera. Den som låter sanningen vila i formuleringar som ”vi är en ledande partner” har inget som går att återge, hur sant det än är.
Säger studien något om dagens ChatGPT?
Inte direkt — och det är värt att vara exakt. WebGPT är en forskningspreprint från 2021, byggd på ELI5-frågor, och ingen påstådd arkitektur för dagens produkter. Två detaljer visar dock hur medvetet ramen var: Reddit och Quora var filtrerade bort ur webbläsaren, så modellen inte kunde fuska genom att kopiera gamla svar — och svarens referenser var extraherade passager, inte fri länkning.
Generaliseringen som håller är riktningen: källhänvisningar var designmålet för att göra svar verifierbara, och den logiken återfinns i dagens retrieval-baserade system där svaret byggs på hämtade dokument (RAG förklaras här). För er del innebär det samma konkurrens som då: den som är lättast att stödja med en trovärdig passage har bäst chans att hamna i svaret.
Vanliga frågor
Varför finns det alltid källor under ett AI-svar?
För att källorna var en designövning från början: WebGPT (OpenAI 2021) tvingades samla referenser medan den bläddrade, så att människor kunde kontrollera svarens fakta utan egen research. Svar med referenser var också det som människor föredrog — 56 % av tiden framför tränade demonstratörer.
Tränades WebGPT med reinforcement learning?
Nej — det är en vanlig missuppfattning. RL (PPO) testades, men den bästa modellen kombinerade behavior cloning med rejection sampling mot en belöningsmodell. I jämförelser föredrogs rejection sampling 68 % av tiden framför enbart behavior cloning, medan RL bara klarade 58 % — därför exkluderades RL.
Gör det här att min sajt blir citerad oftare?
Studien förklarar varför citat finns, inte vilka som blir citerade — och inget resultat ger någon placeringsoffert. Men den pekar ut vad som belönats hela tiden: påståenden som går att kontrollera mot en passage. Se till att påstående och stöd ligger tillsammans på sidan, och mät sedan om ni faktiskt syns i svaren.
Vill du veta var er webbplats står i dag?
Beställ den fria granskningsrapporten — ni får synlighetspoängen, luckorna och de tre första åtgärderna.
Starta med fri granskning