Robots.txt-guiden: styr crawlingen utan att blocka fel
Robots.txt säger vilka crawlers som får hämta vad på din sajt — men den är inget verktyg för att hålla sidor borta från Google. En sida som är disallow:ad kan fortfarande indexeras om andra sajter länkar till den. Filen styr åtkomst, inte indexering.
Svar-först: robots.txt är en liten textfil i rotkatalogen som "tells search engine crawlers which URLs the crawler can access on your site", som Google formulerar det (Google Search Central). Filen består av regelgrupper: en user-agent-rad som namnger crawlern, därefter allow- och disallow-rader för sökvägar, samt sitemap-direktivet som pekar ut din webbplatskarta.
För e-handel och tjänsteföretag är filen dubbel viktig nu: den styr både sökmotorernas och AI-botarnas åtkomst — och ett enda feltecken kan stänga ute hela sajten. Här är syntaxen, botarna och misstagen.
Hur ser en robots.txt ut?
I specifikationen definieras tre delar: user-agent "identifies which crawler the rules apply to", allow är "a URL path that may be crawled" och disallow är "a URL path that may not be crawled" (Google, specifikationen). I praktiken byggs filen i tre steg:
Stäng privata ytor
User-agent: *
Disallow: /kundportal/
Stjärnan gäller alla crawlers. Blockera bara ytor som inte ska hittas — interna system, sökresultatsidor, testmiljöer.
Öppna undantag
Disallow: /produkter/
Allow: /produkter/sommar/
Allow öppnar en sökväg inom ett disallow:at område. Används sparsamt — varje undantag är en sak att hålla reda på.
Peka ut sitemap
Sitemap: https://dinbutik.se/sitemap.xml
Fullständig adress. Placeras utanför regelgrupperna. Hjälper crawlers att hitta alla sidor du vill ska hittas.
Och en hård gräns från samma specifikation: "Rules other than allow, disallow, and user-agent are ignored by the robots.txt parser" — allt annat du skriver in läses alltså inte av Google.
Blockerar robots.txt en sida från Google?
Nej, och det är den vanligaste missuppfattningen om filen. Google skriver rakt ut att robots.txt "is not a mechanism for keeping a web page out of Google" och att "a page that's disallowed in robots.txt can still be indexed if linked to from other sites" — sidan kan då visas i sökresultaten, i värsta fall med en annan sajs ankringstext, utan att Google någonsin hämtat innehållet (Google Search Central).
Vill du hålla en sida borta från sökresultaten är det tre åtgärder som gäller, enligt Google: lösenordsskydd, noindex-meta eller noindex-header, eller att helt enkelt radera sidan. Robots.txt är alltså fel verktyg för jobbet — det är rätt verktyg för att spara crawl-budget och hålla ointressanta ytor utanför.
Stödjer Google crawl-delay?
Nej. Direktivet används på andra motorer för att begära en paus mellan hämtningar, men hos Google har det ingen effekt: "other fields such as crawl-delay aren't supported", står det i specifikationen (Google Search Central). Rader med crawl-delay ignoreras helt av Googles parser.
Om syftet är att skydda en överbelastad server hjälper alltså robots.txt inte mot Googlebot — takten får styras på servernivå. Räkna inte med att en crawl-delay-rad gör något — och låt dig inte tro att den gör det: många sajter tror de har ett skydd de inte har.
Vilka AI-botar ska du känna till?
AI-eran har delat crawlerna i två syften: botar som hämtar till sök — där du vill synas — och botar som hämtar till modellträning, där du kan vilja välja. Läget vid skrivandet:
| Bot | Hämtar till | Blockerar du den … |
|---|---|---|
| Googlebot | Googles sökindex — förutsättningen även för AI Overviews och AI Mode, där en sida måste vara indexerad för att visasGoogle Search Central | … försvinner du från Google |
| Google-Extended | AI-träning och grounding i Googles system utanför Search — styrs separat från GooglebotGoogle Search Central | … påverkar inte din synlighet i Search |
| GPTBot | OpenAI:s träning av modellernaYoast | … påverkar inte ChatGPT Search direkt |
| OAI-SearchBot | ChatGPT Search — "focuses on search tasks. It links to and displays websites in search results"Yoast | … syns du inte i ChatGPT:s söksvar |
Bing-indexet är dessutom en viktig leveransväg till ChatGPT Search — "Bing is currently a major driving force", skriver Yoast, samtidigt som ChatGPT också använder egna crawlers och partnerindex. Bilden "ChatGPT är bara Bing" är förenklad; grunderna för flera motorer samtidigt är det som betalar sig.
Ska jag blockera AI-botarna?
Det beror på vilken bot — och det är två olika beslut. Sökbotarna (Googlebot, OAI-SearchBot) släpper du in om du vill vara ett svar: att bli en källa i AI-svar är kärnan i GEO, och vill du vara källor i ChatGPT:s sökfunktion krävs att OAI-SearchBot får hämta, medan AI Overviews förutsätter indexering i Google. Här är blockering en affärsfråga med självklart svar för de flesta som vill sälja något.
Träningsbotarna (GPTBot, Google-Extended) är ett strategiskt val utan rätt svar: att låta träningen använda ditt innehåll är en avvägning mellan räckvidd och kontroll, och rimliga argument finns åt båda håll. Poängen är att beslutet ska vara medvetet. Den vanligaste situationen vi ser är inte en principförklaring utan en olycka — en wildcard-regel, en säkerhetsprodukt eller en gammal staging-fil som blockerar allt, och ingen som märker det. Gå igenom checklistan för AI-crawlers och säkra att blockeringen, om du har någon, är din egen.
Vad är IndexNow — och behöver du det?
IndexNow är ett ping-protokoll som låter dig meddela sökmotorer direkt när en URL lagts till, uppdaterats eller tagits bort — "a simple ping so that search engines know that a URL and its content has been added, updated, or deleted". Upptäckt via crawlning "can take days to weeks"; pingen når motorerna direkt (IndexNow.org).
Deltagande motorer är Microsoft Bing, Naver, Seznam.cz, Yandex och Yep — en inlämning delas automatiskt med alla. Google deltar inte. Tekniken kräver en nyckelfil i rotkatalogen som bevisar att du äger sajten. För de flesta svenska sajter är IndexNow ingen prioritet i sig, men om ditt CMS stödjer det är det ett billigt sätt att påskynda indexeringen av nytt innehåll i Bing — som i sin tur matar flera AI-svar.
Vilka misstag förstör vanligast robots.txt?
- Disallow: / på hela sajten. Den klassikern: en staging-fil driftsätts rakt av, och ingen crawler släpps in på något. Om trafiken sjunker till noll över en natt, börja här.
- Motstridiga regler. Allow- och disallow-rader som överlappar, eller regler placerade i fel user-agent-grupp. Testa de viktiga URL:erna före varje driftsättning i stället för att läsa filen i efterhand.
- Blockering som indexeringsskydd. Vill du ha bort en sida från sökresultaten är disallow fel verktyg — sidan kan indexeras ändå, nu utan innehåll. Använd noindex, lösenord eller radera.
- Obemärkt AI-blockering. En säkerhetsplugin eller brandvägg som skrivit bot-regler du aldrig godkänt. Granska filen mot checklistan så vet du vad den egentligen säger.
Tre rader kod styr hela din crawlbarhet — värd att läsa en gång i kvartalet. Hur ändringarna slår igenom följer du i Search Console, där du kan bekräfta att Google hittar och crawlar sajten.
Vanliga frågor
Hur testar jag att min robots.txt fungerar?
Kontrollera först att filen svarar på dinbutik.se/robots.txt och läs regelgrupperna mot det du vill uppnå. Sedan bekräftar du i Search Console att Google hittar och crawlar sajten — och efter ändringar kan du begära omindexering av uppdaterat innehåll. Viktigast är URL:nivån: testa att de sidor du vill ha indexeras inte träffas av någon disallow-regel.
Blockerar GPTBot mig från ChatGPT:s söksvar?
Nej, det är två olika crawlers. GPTBot hämtar till modellträning, medan OAI-SearchBot är sökcrawlern som hittar och visar webbplatser i ChatGPT Search. Vill du synas i söksvaren behöver OAI-SearchBot vara tillåten; GPTBot kan du blockera utan att det påverkar sökfunktionen direkt. Kör du däremot en wildcard-blockering av alla OpenAI-crawlers har du blockat båda — ofta utan att mena det.
Behöver jag en llms.txt-fil utöver robots.txt?
Filen är harmlös men ingen beprövad åtgärd. I en studie av nästan 300 000 domäner hade 10,13 procent en llms.txt-fil — och statistiken fann ingen effekt på hur ofta domänen citeras av AI-modeller; att ta bort variabeln ur regressionsmodellen förbättrade till och med dess träffsäkerhet (SE Ranking, november 2025). Robots.txt, sitemap och citerbart innehåll är det som dokumenterat spelar roll.
Vill du veta var er webbplats står i dag?
Beställ den fria granskningsrapporten — ni får synlighetspoängen, luckorna och de tre första åtgärderna.
Starta med fri granskning