
Robots.txt är en offentlig textfil som talar om för kompatibla sökrobotar vilka URL-sökvägar de får hämta på en webbplats. Filen styr crawlning, inte generell indexering, och den är inte ett skydd för känsligt innehåll.
Rätt använd kan robots.txt minska onödig crawlertrafik i stora eller tekniskt komplexa webbplatser. Fel använd kan den blockera viktiga sidor, resurser eller hela webbplatsen. Därför ska reglerna vara få, tydliga och testade mot verkliga URL:er.
Robots.txt bygger på Robots Exclusion Protocol, ett etablerat protokoll för instruktioner till crawlers. Filen innehåller regler som exempelvis kan be en robot att inte hämta URL:er under en viss katalog.
En kompatibel crawler hämtar och använder normalt robots.txt-regler för ursprunget när den planerar crawlning. Reglerna kan dock vara cachelagrade. Robots.txt är frivilliga instruktioner och stoppar inte obehöriga besökare, skript eller illvilliga aktörer från att öppna en URL direkt.
I teknisk SEO ser vi robots.txt som en liten fil med stor riskradie. Den ska utgå från ett verifierat URL-lager och vara en del av ordinarie releaseprocess, särskilt vid plattformsbyte, domänflytt eller större förändringar av webbplatsen.
Crawlning betyder att en robot hämtar och läser en URL. Indexering handlar om huruvida sökmotorn kan lägga till innehållet i sitt sökindex. En blockering i robots.txt hindrar inte säkert en URL från att visas i sökresultat.
En blockerad URL kan i vissa fall ändå bli känd genom länkar eller andra signaler. Sökmotorn kan då visa URL:en med begränsad information eftersom sidan inte har kunnat läsas. När målet är att avindexera en vanlig sida behöver sökmotorn normalt kunna hämta en noindex-instruktion först.
Nej. Om inga regler begränsar en crawler är crawlning normalt tillåten. En mindre webbplats utan särskilda crawlproblem behöver ofta inga avancerade regler. En tom fil kan räcka, och en saknad fil fungerar också om servern returnerar korrekt 404-status.
Filen blir mer relevant när webbplatsen har stora mängder lågprioriterade eller oändliga URL-varianter. Det kan handla om vissa interna sökresultat, funktionella åtgärds-URL:er, proxyvägar eller parameterkombinationer. Även då behöver varje regel bedömas utifrån affärsnytta, internlänkning, rendering och önskat utfall.
Robots.txt är inte en direkt rankingfaktor. Mer blockering ger inte automatiskt bättre SEO. För små webbplatser kan en onödigt komplex fil skapa större risk än nytta.
Filen ska heta exakt robots.txt och ligga i roten för det ursprung som den ska styra, till exempel https://www.exempel.se/robots.txt. En fil i en underkatalog, som /filer/robots.txt, fungerar inte som webbplatsens robots.txt.
Reglerna gäller bara för den specifika kombinationen av protokoll, värdnamn och port där filen finns. https://exempel.se/robots.txt gäller alltså inte automatiskt för http://exempel.se/, https://www.exempel.se/ eller shop.exempel.se. Varje relevant subdomän och miljö behöver kontrolleras separat.
Använd vanlig UTF-8-kodad text. Undvik att skapa filen i ett ordbehandlingsprogram, eftersom osynlig formatering eller fel tecken kan göra reglerna opålitliga. Håll också filen kort. Google bearbetar högst 500 KiB av innehållet.
En regelgrupp börjar med User-agent, som anger vilken crawler reglerna gäller för. Därefter följer en eller flera Allow- eller Disallow-rader. Kommentarer börjar med tecknet # och påverkar inte reglernas funktion.
User-agent: * är en generell grupp för alla crawlers som inte har en mer specifik grupp. En tom Disallow-rad blockerar ingenting. Däremot blockerar Disallow: / hela det aktuella ursprunget och ska aldrig ligga kvar av misstag på en publik webbplats.
Regeln Disallow: /intern-sokning/ omfattar URL:er som börjar med den sökvägen, till exempel /intern-sokning/?q=skor. Den påverkar inte /sokning/ om det är en annan sökväg.
I exemplet med /konto/ är katalogen blockerad, men den mer specifika Allow-regeln öppnar den angivna PDF-filen. Undantag ska användas sparsamt och alltid testas mot den crawler som är viktig för er.
Sitemap-direktivet är valfritt och ska innehålla en fullständig URL till webbplatskartan. Flera Sitemap-rader kan användas. Raden anger var en webbplatskarta finns, men den garanterar inte crawlning eller indexering.
Kommentarer hjälper teamet att förstå varför en regel finns. Dokumentera gärna syfte, ansvarig och datum vid känsliga förändringar. Låt dock inte kommentarer ersätta versionshantering och tydliga releaseanteckningar.
När flera Allow- och Disallow-regler kan matcha samma URL väljer Google den mest specifika matchningen. I praktiken innebär det den längsta relevanta sökvägen. Om en Allow- och Disallow-regel är lika specifika använder Google den minst restriktiva regeln.
Fältnamn som User-agent och Disallow behandlas utan hänsyn till stora och små bokstäver av Google. URL-sökvägar är däremot skiftlägeskänsliga. /Dokument/fil.pdf och /dokument/fil.pdf kan därför vara olika URL:er.
Google stödjer jokertecknet * för mönster och $ för att markera slutet av URL:en. Exempelvis kan Disallow: /*?sort= blockera URL:er med parametern sort, medan Disallow: /*.pdf$ gäller URL:er som slutar med .pdf. Avancerade mönster kan tolkas olika av olika crawlers. Testa dem därför mot representativa URL:er.
En särskild grupp kan riktas mot exempelvis Googlebot eller Bingbot. Specifika regler ska bara användas när det finns ett tydligt behov och när effekten är testad. Google stöder User-agent, Allow, Disallow och Sitemap. Direktivet crawl-delay stöds inte av Google, även om Bing dokumenterar stöd för crawleranpassad crawl-delay.
Det går även att lägga regler för AI-crawlers i robots.txt. Crawlernamn och operatörernas policyer förändras dock över tid. Kontrollera alltid den aktuella dokumentationen innan ni inför eller ändrar sådana regler.
Robots.txt passar bäst för stabila URL-grupper som inte behöver crawlas och som annars riskerar att skapa onödig belastning eller brus. För större e-handels-, B2B- och omnichannelwebbplatser kan detta omfatta delar av interna sökresultat, tekniska funktioner eller stora URL-lager som inte är avsedda för sökrobotar.
Vi rekommenderar inte generella blocklistor för ett visst CMS eller en specifik e-handelsplattform. Samma sökväg kan ha olika funktion på olika webbplatser. Först kartlägger vi URL:erna, sedan bedömer vi vilka resurser och sidor som ska vara åtkomliga för crawlers.
Viktiga CSS-, JavaScript- och bildresurser bör normalt förbli crawlbara om de behövs för att sökmotorn ska kunna rendera och förstå sidans innehåll. Att blockera resurser slentrianmässigt kan ge en ofullständig bild av sidan.
Många problem beror inte på syntaxen, utan på att rätt fil inte når rätt crawler vid rätt tidpunkt. Kontrollera därför både filens innehåll och serverns faktiska svar.
Testa alltid den publicerade filen, inte bara en lokal kopia eller en inställning i CMS:et. Börja med att öppna /robots.txt i en webbläsare och kontrollera att URL:en, innehållet och serverns svar är rätt.
Använd sedan robots.txt-rapporten i Google Search Console. Där går det att se Googles senast hämtade version, hämtningsstatus samt upptäckta fel och varningar. Vid viktiga rättningar kan ni begära att Google hämtar filen på nytt.
För en specifik URL använder ni URL-granskningens live-test i Search Console. Det visar om Google kan hämta URL:en just nu och hjälper er skilja på en robots.txt-blockering och andra tekniska problem. Bing Webmaster Tools har motsvarande robots.txt-tester för Bingbot och andra Bing-agenter.
En robots.txt-fil ska versionshanteras och granskas före och efter en release. Särskilt i migreringar är det vanligt att ett avsiktligt stagingblock blir kvar i produktion eller att reglerna publiceras på fel värd.
För större förändringar samordnar vi SEO, utveckling och drift. Det minskar risken att en korrekt formulerad regel ändå får fel effekt i den faktiska miljön. Läs gärna mer om hur vi arbetar med Teknisk SEO för crawlning, indexering och prestanda.
En enkel fil kräver sällan ett stort projekt. Men professionell granskning är värdefull när webbplatsen har många URL-varianter, flera subdomäner, komplex filtrering, omfattande JavaScript eller särskilda säkerhetslager.
Hos oss på TribuSoft kan vi granska befintliga regler, testa kritiska URL-grupper och kontrollera hur CDN, WAF och driftmiljö svarar mot sökrobotar. Vi arbetar också med URL-validering och SEO-säkrad driftsättning inför webbplats-, plattforms- och domänförändringar.
Filen ska heta exakt robots.txt och ligga i roten för det ursprung den styr, exempelvis https://www.exempel.se/robots.txt. En fil i en underkatalog gäller inte som robots.txt för hela webbplatsen.
Inte säkert. Robots.txt styr crawlning. En blockerad URL kan i vissa fall ändå visas i sökresultatet om sökmotorn känner till den via länkar eller andra signaler. För en vanlig publik sida som ska bort från index behöver sökmotorn normalt kunna läsa en noindex-instruktion.
Det blockerar kompatibla crawlers från att hämta alla URL:er på det aktuella ursprunget. Regeln kan vara avsiktlig i en stängd testmiljö, men är en allvarlig risk om den råkar ligga kvar på en publik webbplats.
Nej. Filen är offentlig och innehåller bara instruktioner som kompatibla crawlers förväntas följa. Skydda känsligt innehåll med autentisering, behörighetsstyrning eller andra verkliga åtkomstkontroller.
Det beror på när respektive crawler hämtar filen igen. Google cachelagrar normalt filen i upp till 24 timmar, men serverfel och hämtningsproblem kan fördröja effekten. Kontrollera status i Search Console efter publicering.
Vanligtvis inte om resurserna behövs för att sökmotorn ska kunna rendera och förstå sidan. Testa alltid effekten innan ni blockerar resurser.
En felaktig regel kan få stor påverkan på en webbplats, särskilt vid lansering, migrering eller större tekniska förändringar. Vi hjälper er att granska regler, testa kritiska URL:er och säkra publiceringen tillsammans med utveckling och drift.
Få en kostnadsfri offert eller inled en dialog om företagets tillväxt.