AI-crawler
En AI-crawler är en robot som hämtar webbsidor åt ett AI-system, antingen för att träna modeller eller för att hämta innehåll till svar i realtid. Blockeras den i robots.txt kan innehållet varken läras in eller citeras av de system som hämtar sina källor live.
Även: AI-bot, AI-agent.
De stora AI-crawlarna har namn och går att styra var för sig. GPTBot och OAI-SearchBot hämtar åt OpenAI, ClaudeBot åt Anthropic och PerplexityBot åt Perplexity. Google-Extended styr om Googles AI-modeller får använda ditt innehåll utanför själva söket. Alla anmäler sig med namn och uppger att de följer robots.txt, även om oberoende granskningar har ifrågasatt efterlevnaden hos enskilda aktörer. Det gör robots-filen till platsen där ett företag i praktiken uttrycker sin AI-policy.
Skillnaden mellan tränings- och hämtningscrawlers är värd att förstå innan man blockerar något. En träningscrawler samlar text till framtida modellversioner, och effekten av att blockera den syns först långt senare. En hämtningscrawler arbetar i svarsögonblicket: blockeras den försvinner möjligheten att bli hämtad och citerad i just det svaret. Den som blockerar allt av princip stänger alltså också dörren till synlighet i AI-svar.
En egenskap skiljer AI-crawlers från Googlebot i praktiken: flera av dem renderar inte JavaScript. Innehåll som bara finns efter att skript körts kan vara fullt synligt i Google och samtidigt tomt för en AI-crawler. Det går att se själv i crawl-simulatorn, som visar samma sida genom båda robotarnas ögon.
Relaterade begrepp
- kravs for: citering