Varför AI-svaren ändras: instabiliteten — och varför en enskild mätning ljuger
AI-svar ändras av två skäl, på två tidshorisonter. Mellan körningar: samma fråga ger i praktiken aldrig samma lista två gånger — mindre än 1 körning av 100 ger samma varumärkeslista i ChatGPT och Google AI. Över tid: 40–60 % av de domäner som citeras i AI-svar är helt utbytta en månad senare, för identiska frågor. En enskild mätning är därför ett stickprov, inte ett svar.
Det här inlägget går igenom de tre oberoende studier som mätt instabiliteten — Profound, SparkToro och SE Ranking — och vad de betyder för hur ett svenskt företag rimligen kan mäta AI-synlighet. Det viktiga är inte att instabiliteten finns, utan att veta vilken siffra som beskriver vilken sorts instabilitet: talen förskjuts nämligen kraftigt beroende på om du jämför två körningar direkt efter varandra eller två månader isär.
Varför ser jag olika svar varje gång jag frågar AI?
För att källurvalet inte låses vid frågeformuleringen. SparkToro lät tillsammans med Gumshoe.ai 600 volontärer ställa 12 frågor 60–100 gånger vardera — 2 961 körningar totalt, november–december 2025, med vanliga standardinställningar. Resultatet: i ChatGPT och Google AI var sannolikheten att två svar innehåller samma lista med rekommenderade varumärken mindre än 1 på 100, och för att se två listor i samma ordning krävs i snitt omkring 1 på 1 000 körningar (SparkToro 2026-01-28). Svaren varierade även i längd — från 2–3 rekommendationer till 10 eller fler.
SE Ranking fick samma mönster i Google AI Mode: 10 000 nyckelord kördes tre gånger samtidigt, samma dag (20 juni 2025, USA, utloggade konton). Överlappningen mellan de tre sviterna var bara 9,2 % för exakta URL:er och 14,7 % för domäner — ett enskilt svar innehöll i snitt 12,6 URL:er (SE Ranking 2025-08-29). Om tre körningar samma dag delar färskvarors nivå av gemensamma källor är begreppet "min position i svaret" redan problematiskt.
Hur mycket byts källorna ut mellan månaderna?
Här gäller det att läsa siffran exakt: Profound Research mätte månatlig domän-drift — hur stor andel av de domäner som citerades i svaren i juli som saknades i svaren för samma frågor i juni. Svaret: ungefär 40–60 % av de citerade domänerna är helt utbytta en månad senare, även för identiska frågor. Talet avser alltså drift månad-för-månad, inte skillnaden mellan två körningar strax efter varandra (Profound Research 2025-07-17). Metoden byggde på omkring 80 000 prompts per plattform.
Per plattform (juni → juli 2025):
| Plattform | Domäner utbytta på en månad |
|---|---|
| Google AI Overviews | 59,3 %Profound Research 2025-07-17 · AI Search Volatility |
| ChatGPT | 54,1 %Profound Research 2025-07-17 · AI Search Volatility |
| Copilot | 53,4 %Profound Research 2025-07-17 · AI Search Volatility |
| Perplexity | 40,5 %Profound Research 2025-07-17 · AI Search Volatility |
På längre sikt växer driften ytterligare: jämför man januaris citerade domäner med julis blir talet 70–90 % för samma plattformar. För ert företag betyder det att en konkurrent som var borta från svaret i juni kan vara med i juli — och tvärtom — utan att ni gjort något alls. Att konkurrenter passerar er i svaren har alltså inte alltid en orsak i era åtgärder; ibland är det bara driften. Vi tar upp felsökningen i Varför citerar ChatGPT konkurrenten — men inte er?
Är instabiliteten en bugg — eller en funktion?
Profound formulerar det så: citation drift är ingen bugg utan en inneboende egenskap i systemet. Motorerna samplar, regenererar och väger källor om vid varje svar, och det är samma mekanism som gör att svaren kan förbättras och uppdateras över huvud taget. En helt stabil AI-motor vore en motor som slutat läsa in nytt.
Samtidigt visar samma studier att det finns ordning i rörelsen — på rätt nivå. I SparkToros hörlursexperiment (142 promptvarianter, 994 svar) dök toppvarumärkena Bose, Sony, Sennheiser och Apple upp i 55–77 % av svaren: individuella listor är kaotiska, men frekvensen över hundratals körningar är påfallande stabil (SparkToro 2026-01-28). Ett varumärke som syns i tre av fyra svar syns — även om ordningen varierar från svar till svar. Det är den egenskapen ett vettigt mått måste utnyttja.
Hur mäter man AI-synlighet när svaret aldrig är detsamma?
Med frekvens över många körningar, och med metoden öppet redovisad. SparkToros slutsats är att varje verktyg som säljer en "position i AI" mäter nonsens — men att synlighetsfrekvens över dussintals till hundratals prompts, körda flera gånger, är ett rimligt mått. Deras exempel: en aktör som förekom i 69 av 71 svar har 97 % synlighet, vilket är en stabil och jämförbar siffra. Regeln för alla som redovisar AI-synlighet blir därför enkel: ange alltid körantal och period — "citerad i 40 % av 60 körningar, vecka 36" är ett mått; "vi ligger etta i ChatGPT" är det inte. Samma regel gäller när du jämför leverantörer av synlighetsrapporter: den som inte redovisar metod har inte presenterat ett mått, utan ett citat.
Fäst promptsetet
Definiera de frågor dina köpare faktiskt ställer, och ändra inte på dem mellan mätningarna — annars jämför du äpplen med päron.
Kör flera gånger, redovisa antal och period
Flera körningar per prompt, över dussintals prompts. Utan körantal och tidsperiod är siffran omöjlig att tolka — eller att lita på.
Följ frekvensen över tid
Trenden — citerad i X % av körningarna denna månad mot förra — är det enda som skiljer verklig förändring från månadsdrift.
Hur måtten ser ut i praktiken beskriver vi i Så mäter du AI-synlighet, och varför källorna i svaren varierar — mekaniken bakom urvalet — står i Hur väljer AI-motorerna vilka företag de citerar?
Vad betyder instabiliteten för din löpande bevakning?
Att en engångs-audit ger falsk trygghet. Med 40–60 % månatlig domän-drift kan den rapport du köpte i våras beskriva en spelplan som inte längre finns; Profounds egen rekommendation är sampling dagligen eller veckovis och trendanalys, aldrig enskilda datapunkter. Löpande bevakning är därför inte en lyx — den är det enda sättet att skilja riktig rörelse från brus.
Det är också därför en trovärdig synlighetsrapport alltid talar om hur den mäter: hur många prompts, hur många körningar, vilken period. Ett svar på frågan "syns vi i AI?" utan körantal och period är — enligt studierna ovan bokstavligen — ett gissningssvar. Grunden för att mäta på rätt sätt återfinns i Varför källorna ska gå att verifiera, och definitionen av hela disciplinen i Vad är GEO?
Vanliga frågor
Stämmer det att 60 % av källorna byts mellan två körningar?
Nej — det är en vanlig feltolkning. Profounds 40–60 % gäller månatlig domän-drift: jämförelse av samma frågor en månad isär, inte två körningar efter varandra. Kör-mot-kör-instabiliteten kommer från SparkToro (mindre än 1 av 100 körningar ger samma varumärkeslista) och SE Ranking (9,2 % URL-överlap mellan tre körningar i Google AI Mode samma dag). Två tidshorisonter, två olika siffror.
Hur många körningar krävs för en tillförlitlig AI-mätning?
SparkToros slutsats är att synlighetsfrekvens över dussintals till hundratals prompts, där varje prompt körs flera gånger, är ett rimligt mått — medan enstaka körningar är slumptal. Det centrala är inte exakt siffra utan transparens: en mätning ska alltid redovisa körantal och period, annars går den inte att jämföra eller verifiera.
Kan ett företag vara med i AI-svaret en månad och borta nästa?
Ja. Profound mätte att 40–60 % av de citerade domänerna byts ut mellan juni och juli 2025 för identiska frågor (Google AI Overviews 59,3 %, ChatGPT 54,1 %). Samtidigt kan etablerade varumärken vara stabila i frekvens — SparkToro såg toppvarumärken i 55–77 % av svaren. Rörelsen är stor på domännivå, men frekvensen över många körningar är det mått som säger något.
Vill du veta var er webbplats står i dag?
Beställ den fria granskningsrapporten — ni får synlighetspoängen, luckorna och de tre första åtgärderna.
Starta med fri granskning