Blog SEO · GEO & AI

Boți AI (GPTBot, ClaudeBot, PerplexityBot): cum îi permiți sau îi blochezi în robots.txt

Pe scurt

  • Boții AI au roluri diferite: antrenare (GPTBot, ClaudeBot), căutare (OAI-SearchBot, Claude-SearchBot, PerplexityBot) și cereri declanșate de utilizator (ChatGPT-User, Claude-User).
  • Poți bloca antrenarea și permite căutarea, dacă scrii reguli separate pe fiecare user agent în robots.txt.
  • Robots.txt este o cerere respectată voluntar, nu o protecție: unii boți declanșați de utilizator pot ignora regulile, iar conținutul sensibil cere autentificare.
  • Google-Extended este un token de control pentru Gemini, nu un crawler separat, și nu afectează Google Search sau AI Overviews.

Boții AI sunt programe care accesează site-uri pentru produse bazate pe modele de limbaj, iar în robots.txt îi controlezi după numele lor (user agent): GPTBot și ClaudeBot pentru antrenare, OAI-SearchBot, Claude-SearchBot și PerplexityBot pentru căutare, ChatGPT-User, Claude-User și Perplexity-User pentru cereri declanșate de un utilizator. Cheia este să nu tratezi toți boții AI la fel: poți refuza antrenarea și totuși să rămâi eligibil pentru căutare.

Ghidul explică ce face fiecare bot, cum scrii regulile pentru trei scenarii frecvente, ce limite are robots.txt și cum verifici ce se întâmplă. Pentru contextul strategic, citește mai întâi ghidul GEO; serviciul nostru este descris la optimizare GEO.

De ce nu toți boții AI sunt la fel?

Cele trei categorii au efecte diferite asupra afacerii tale:

  • Boți de antrenare colectează conținut pentru a dezvolta modele. Blocarea lor spune: „nu folosiți paginile mele pentru antrenarea viitoare”. Nu te scoate dintr-un motor de căutare.
  • Boți de căutare construiesc indexuri pentru funcții de căutare ale produselor AI. Blocarea lor poate reduce șansele de a fi afișat sau citat în acele produse.
  • Boți declanșați de utilizator accesează o pagină pentru că un om a cerut asta (de exemplu, a pus un link într-un chat). Documentațiile OpenAI și Perplexity spun că, fiind acțiuni ale utilizatorului, regulile robots.txt pot să nu se aplice; Anthropic spune că Claude-User le respectă.

Dacă amesteci categoriile, faci greșeli costisitoare: blochezi totul „din prudență” și dispari din răspunsuri, sau permiți totul fără să știi că ai ales să fii folosit la antrenare.

Ce boți există și ce fac: tabel de referință

Informațiile de mai jos provin din documentațiile publice ale furnizorilor la momentul scrierii. Numele și regulile se pot schimba; verifică paginile oficiale înainte să implementezi.

FurnizorAgentRolSe aplică robots.txt?
OpenAIGPTBotAntrenarea modelelor generativeDa
OpenAIOAI-SearchBotAfișare în funcțiile de căutare ChatGPTDa (efect în ~24 de ore)
OpenAIChatGPT-UserVizite declanșate de utilizatori, inclusiv GPT-uri personalizateDocumentația spune că regulile pot să nu se aplice
AnthropicClaudeBotColectarea de conținut pentru modeleDa, se blochează prin robots.txt
AnthropicClaude-SearchBotÎmbunătățirea rezultatelor de căutareDa
AnthropicClaude-UserCereri ale utilizatorilor Claude care cer acces webDa, conform paginii de suport
PerplexityPerplexityBotIndexare pentru rezultatele Perplexity; nu antrenează modele, spune documentațiaDa
PerplexityPerplexity-UserCereri declanșate de utilizatorÎn general ignoră robots.txt
GoogleGooglebotIndexarea pentru Search, inclusiv AI OverviewsDa
GoogleGoogle-ExtendedToken pentru Gemini (antrenare, grounding)Token în robots.txt, nu un crawler separat

OpenAI mai are OAI-AdsBot, care verifică paginile trimise ca reclame și nu respectă robots.txt. Documentația notează și că GPTBot și OAI-SearchBot pot partaja rezultate de crawl dacă ambii sunt permiși, ca să evite dublarea.

Un punct des greșit înțeles: Google-Extended nu este un crawler. Nu va apărea în loguri. Este un token pe care îl scrii în robots.txt pentru a spune dacă conținutul crawlat de Google poate fi folosit pentru antrenarea modelelor Gemini și pentru grounding în produsele respective. Conform documentației Google, nu influențează includerea în Search și nu este semnal de clasare. Nici nu controlează AI Overviews; pentru acelea folosești controalele de snippet, explicate în ghidul AI Overviews.

Scenariul 1: permiți căutarea AI, refuzi antrenarea

Este un punct de pornire potrivit pentru multe firme care vor vizibilitate fără să-și ofere conținutul la antrenare:

User-agent: GPTBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

Fiecare grup se aplică doar agentului numit. Dacă vrei să excluzi și cererile declanșate de utilizatori acolo unde sunt respectate (de exemplu Claude-User), le adaugi explicit, știind că vei reduce posibilitatea ca un utilizator să-ți citeze pagina printr-un asistent.

Scenariul 2: blochezi toți boții AI

User-agent: GPTBot
Disallow: /

User-agent: OAI-SearchBot
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Disallow: /

User-agent: PerplexityBot
Disallow: /

User-agent: Google-Extended
Disallow: /

Rezultatul: ieși din produsele de căutare ale acestor furnizori, în măsura în care respectă regulile. Nu afectezi Google Search (Googlebot nu e blocat). Grupurile de mai sus nu acoperă agenții declanșați de utilizator (ChatGPT-User, Claude-User, Perplexity-User); unii dintre ei pot ignora robots.txt oricum. Alege acest scenariu doar dacă ai un motiv de business clar.

Scenariul 3: blochezi doar o zonă a site-ului

User-agent: GPTBot
Disallow: /membri/
Disallow: /cursuri-platite/

User-agent: ClaudeBot
Disallow: /membri/
Disallow: /cursuri-platite/

Util când ai conținut premium sau secțiuni care nu trebuie folosite. Atenție: dacă acele pagini sunt cu adevărat private, robots.txt nu este suficient; vezi secțiunea despre limite.

Cum aplici regulile, pas cu pas

  1. Hotărăște politica. Pentru fiecare categorie (antrenare, căutare, utilizator), alege permis sau blocat.
  2. Scrie fișierul. Poți porni de la generatorul de robots.txt și adaugi grupurile de mai sus.
  3. Păstrează regulile pentru Googlebot separate. Nu amesteca grupuri; fiecare bot respectă grupul cel mai specific care i se potrivește.
  4. Publică la rădăcină (/robots.txt), cu cod 200 și text simplu.
  5. Testează. Deschide fișierul în browser și verifică sintaxa.
  6. Verifică firewallul și CDN-ul. Unele servicii blochează implicit boți necunoscuți; dacă vrei să fii citit, trebuie să-i lași.
  7. Urmărește logurile 2–4 săptămâni și compară cu intervalele IP oficiale.

Verificarea în practică

User agentul se poate falsifica. Furnizorii publică intervale IP pentru boții lor (OpenAI pentru fiecare agent, Anthropic printr-o listă oficială, Perplexity pentru PerplexityBot și Perplexity-User). Procedura minimă:

  1. Extrage din loguri cererile cu user agent care conține „GPTBot”, „OAI-SearchBot”, „ClaudeBot”, „PerplexityBot” etc.
  2. Compară adresele IP cu listele oficiale.
  3. Marchează separat cererile „false” (nume corect, IP greșit): nu le trata ca boți reali.
  4. Pentru a testa regulile din firewall, poți face o cerere de probă cu un user agent simulat și vezi ce răspuns primești.

Anthropic notează un detaliu util: blocarea pe baza IP-urilor poate împiedica botul să citească robots.txt, deci nu funcționează ca metodă de refuz „politicos”. Dacă folosești firewall, nu bloca IP-urile oficiale ale boților pe care vrei să-i refuzi prin robots.txt, ca regulile să poată fi citite. Anthropic menționează și suportul pentru directiva nestandardizată Crawl-delay, utilă la încărcare mare. Reține că Google nu o suportă, deci nu o folosi ca să încetinești Googlebot.

Ce politică se potrivește cărui tip de afacere?

Nu există o rețetă universală. Tabelul de mai jos este un punct de pornire logic, nu o regulă; ajustează-l după obiectivele tale și după sfatul unui jurist unde e cazul.

Tip de afacereAntrenareCăutare AICereri ale utilizatorilorMotiv
Firmă de servicii localePermis sau blocat, la alegerePermisPermisVrei să fii recomandat când cineva caută un furnizor
Magazin onlineLa alegerePermisPermisDescrierile de produs sunt publice și vrei vizibilitate
Editor de știri sau conținut plătitBlocatDe evaluatDe evaluatConținutul este activul principal; contează licențierea
Platformă cu cursuri sau zonă de membriBlocat pe zonele plătitePermis pe paginile publicePermis pe paginile publiceProtejezi ce vinzi, expui ce atrage clienți
Site intern sau în dezvoltareBlocatBlocatBlocatProtejează cu autentificare, nu doar cu robots.txt

Dacă ești o firmă străină cu public în România, nu uita că motoarele AI pot servi răspunsuri în română pe baza paginilor în orice limbă. Politica de acces se aplică unitar pe domeniu, nu pe limbă, dacă nu separi explicit directoarele.

Un exemplu de verificare în loguri

Să presupunem că, după publicarea regulilor din primul scenariu, în logul serverului vezi două categorii de cereri. Prima: user agent care conține „OAI-SearchBot”, cu IP din intervalul publicat de OpenAI pentru acel agent. Este un vizitator legitim și permis; nu faci nimic. A doua: user agent „GPTBot”, dar cu o adresă care nu apare în lista OpenAI. Ori listele s-au schimbat de la ultima ta descărcare, ori cineva folosește numele fals. În ambele cazuri, descarcă din nou lista oficială; dacă adresa tot lipsește, tratează cererea ca neverificată și, la nevoie, limitează-o prin firewall.

Pentru fiecare agent, urmărește și ce accesează: dacă un bot de căutare cere masiv pagini nesemnificative (filtre, parametri), problema poate fi în arhitectura site-ului, nu în bot. Ghidul despre pagini neindexate te ajută să recunoști astfel de capcane de crawl.

Limitele robots.txt

  • Este voluntar. RFC 9309 descrie protocolul ca pe o cerere pe care crawlerele cuminți o respectă, nu ca pe un mecanism de securitate. Nimic nu oprește un bot rău intenționat.
  • Cererile declanșate de utilizator pot ignora regulile; documentațiile OpenAI și Perplexity o spun explicit pentru ChatGPT-User, respectiv Perplexity-User.
  • Nu șterge ce a fost deja colectat. O regulă nouă se aplică de la acel moment, nu retroactiv.
  • Nu ascunde conținutul. Un URL blocat poate apărea totuși în alte locuri dacă e linkuit. Pentru conținut sensibil folosește autentificare sau noindex acolo unde se aplică.
  • Aspectele juridice ale folosirii conținutului la antrenare (drepturi de autor, licențe) sunt separate de robots.txt; discută cu un jurist, nu cu un fișier text.

Greșeli frecvente

  • Un singur grup User-agent: * pentru tot. Regulile generale nu fac distincția antrenare/căutare.
  • Blocarea Google-Extended în speranța de a ieși din AI Overviews. Nu funcționează.
  • Blocarea Googlebot din greșeală printr-un Disallow: / pus în grupul greșit. Verifică după fiecare modificare.
  • Scrierea greșită a numelor (de exemplu „ChatGPT” în loc de „ChatGPT-User” sau „GPTBot”). Folosește exact numele din documentație.
  • Uitarea CDN-ului. Fișierul e corect, dar firewall-ul respinge boții pe care vrei să-i primești.
  • Lipsa revizuirii. Furnizorii adaugă și redenumesc agenți; planifică o verificare trimestrială.

Când NU se aplică sau nu ajută

  • Dacă problema ta este plagiatul sau scrapingul agresiv, robots.txt nu este soluția; ai nevoie de limitare a ratei, WAF și monitorizare.
  • Dacă vrei să împiedici o persoană să folosească un asistent AI pe pagina ta, regulile pentru boți nu garantează nimic.
  • Dacă nu ai un motiv real să blochezi, a permite boții de căutare este, în general, decizia care păstrează oportunitatea de vizibilitate.
  • Dacă te interesează vizibilitatea în Google, boții AI ai altor furnizori nu contează; contează indexarea clasică.

Cum se leagă de restul strategiei

Accesul boților este doar primul filtru. Fișierul llms.txt nu înlocuiește regulile de acces și nu are efecte dovedite. După ce decizi politica, măsoară ce se întâmplă: vezi cum măsori vizibilitatea în ChatGPT și în căutarea AI. Dacă bănuiești probleme mai largi de accesibilitate, un audit SEO tehnic le scoate la iveală.

Concluzie: decide pe categorii, verifică în loguri

Politica sănătoasă pentru mulți este: refuză antrenarea dacă așa vrei, permite căutarea dacă vrei vizibilitate, nu te baza pe robots.txt pentru ce e confidențial. Pași următori: alege scenariul, generează fișierul, verifică firewallul, urmărește logurile o lună. Dacă vrei să revizuim împreună configurarea, vezi pagina de optimizare GEO.

Surse și lectură suplimentară

Întrebări frecvente

Întrebări frecvente

Dacă blochez GPTBot, dispar din ChatGPT?

Nu neapărat. Conform OpenAI, GPTBot privește antrenarea modelelor, iar OAI-SearchBot privește afișarea în funcțiile de căutare ale ChatGPT. Sunt reguli independente. Dacă blochezi doar GPTBot și lași OAI-SearchBot permis, conținutul tău poate fi eligibil pentru căutare, dar nu pentru antrenare.

Cât durează până se aplică o modificare în robots.txt?

Pentru OpenAI, documentația indică aproximativ 24 de ore pentru rezultatele de căutare. La ceilalți furnizori nu există garanții de timp, deci presupune o întârziere. Verifică logurile serverului în zilele următoare, ca să vezi dacă boții respectă noile reguli.

Pot bloca doar o parte din site pentru boții AI?

Da. Robots.txt permite reguli pe directoare, de exemplu Disallow: /clienti/ sub un anumit user agent. Funcționează la nivel de cale, nu de paragraf. Pentru fragmente din pagină nu ai un control echivalent în robots.txt; folosește alte soluții sau scoate conținutul.

Cum știu că un vizitator este chiar un bot OpenAI sau Anthropic?

User agentul poate fi falsificat. Compară adresa IP cu intervalele publicate de furnizor: OpenAI, Anthropic și Perplexity oferă liste oficiale. Dacă user agentul spune GPTBot, dar IP-ul nu e în listă, nu ai de-a face cu botul real.

Merită să blochez toți boții AI?

Depinde de afacere. Dacă vrei să fii recomandat în răspunsuri, blocarea boților de căutare te scoate din acele produse. Dacă ai conținut plătit sau de licențiat, blocarea antrenării și o protecție reală prin autentificare pot fi justificate. Decide separat pe tipuri de bot.

Serviciul asociat

GEO — optimizare pentru AI

Vezi serviciul →

Hai să creștem traficul organic al site-ului tău

Trimite-ne adresa site-ului și îți răspundem cu o analiză inițială gratuită și o strategie concretă de optimizare SEO — fără obligații.