Google AI Overviews: cum ajungi sursă citată în răspunsurile AI
AI Overviews și AI Mode: ce cere Google ca pagina ta să fie link de suport, ce controale ai, cum măsori în Search Console și ce nu poți garanta.
Pe scurt
Boții AI sunt programe care accesează site-uri pentru produse bazate pe modele de limbaj, iar în robots.txt îi controlezi după numele lor (user agent): GPTBot și ClaudeBot pentru antrenare, OAI-SearchBot, Claude-SearchBot și PerplexityBot pentru căutare, ChatGPT-User, Claude-User și Perplexity-User pentru cereri declanșate de un utilizator. Cheia este să nu tratezi toți boții AI la fel: poți refuza antrenarea și totuși să rămâi eligibil pentru căutare.
Ghidul explică ce face fiecare bot, cum scrii regulile pentru trei scenarii frecvente, ce limite are robots.txt și cum verifici ce se întâmplă. Pentru contextul strategic, citește mai întâi ghidul GEO; serviciul nostru este descris la optimizare GEO.
Cele trei categorii au efecte diferite asupra afacerii tale:
Dacă amesteci categoriile, faci greșeli costisitoare: blochezi totul „din prudență” și dispari din răspunsuri, sau permiți totul fără să știi că ai ales să fii folosit la antrenare.
Informațiile de mai jos provin din documentațiile publice ale furnizorilor la momentul scrierii. Numele și regulile se pot schimba; verifică paginile oficiale înainte să implementezi.
| Furnizor | Agent | Rol | Se aplică robots.txt? |
|---|---|---|---|
| OpenAI | GPTBot | Antrenarea modelelor generative | Da |
| OpenAI | OAI-SearchBot | Afișare în funcțiile de căutare ChatGPT | Da (efect în ~24 de ore) |
| OpenAI | ChatGPT-User | Vizite declanșate de utilizatori, inclusiv GPT-uri personalizate | Documentația spune că regulile pot să nu se aplice |
| Anthropic | ClaudeBot | Colectarea de conținut pentru modele | Da, se blochează prin robots.txt |
| Anthropic | Claude-SearchBot | Îmbunătățirea rezultatelor de căutare | Da |
| Anthropic | Claude-User | Cereri ale utilizatorilor Claude care cer acces web | Da, conform paginii de suport |
| Perplexity | PerplexityBot | Indexare pentru rezultatele Perplexity; nu antrenează modele, spune documentația | Da |
| Perplexity | Perplexity-User | Cereri declanșate de utilizator | În general ignoră robots.txt |
| Googlebot | Indexarea pentru Search, inclusiv AI Overviews | Da | |
| Google-Extended | Token pentru Gemini (antrenare, grounding) | Token în robots.txt, nu un crawler separat |
OpenAI mai are OAI-AdsBot, care verifică paginile trimise ca reclame și nu respectă robots.txt. Documentația notează și că GPTBot și OAI-SearchBot pot partaja rezultate de crawl dacă ambii sunt permiși, ca să evite dublarea.
Un punct des greșit înțeles: Google-Extended nu este un crawler. Nu va apărea în loguri. Este un token pe care îl scrii în robots.txt pentru a spune dacă conținutul crawlat de Google poate fi folosit pentru antrenarea modelelor Gemini și pentru grounding în produsele respective. Conform documentației Google, nu influențează includerea în Search și nu este semnal de clasare. Nici nu controlează AI Overviews; pentru acelea folosești controalele de snippet, explicate în ghidul AI Overviews.
Este un punct de pornire potrivit pentru multe firme care vor vizibilitate fără să-și ofere conținutul la antrenare:
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /Fiecare grup se aplică doar agentului numit. Dacă vrei să excluzi și cererile declanșate de utilizatori acolo unde sunt respectate (de exemplu Claude-User), le adaugi explicit, știind că vei reduce posibilitatea ca un utilizator să-ți citeze pagina printr-un asistent.
User-agent: GPTBot
Disallow: /
User-agent: OAI-SearchBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Disallow: /
User-agent: PerplexityBot
Disallow: /
User-agent: Google-Extended
Disallow: /Rezultatul: ieși din produsele de căutare ale acestor furnizori, în măsura în care respectă regulile. Nu afectezi Google Search (Googlebot nu e blocat). Grupurile de mai sus nu acoperă agenții declanșați de utilizator (ChatGPT-User, Claude-User, Perplexity-User); unii dintre ei pot ignora robots.txt oricum. Alege acest scenariu doar dacă ai un motiv de business clar.
User-agent: GPTBot
Disallow: /membri/
Disallow: /cursuri-platite/
User-agent: ClaudeBot
Disallow: /membri/
Disallow: /cursuri-platite/Util când ai conținut premium sau secțiuni care nu trebuie folosite. Atenție: dacă acele pagini sunt cu adevărat private, robots.txt nu este suficient; vezi secțiunea despre limite.
/robots.txt), cu cod 200 și text simplu.User agentul se poate falsifica. Furnizorii publică intervale IP pentru boții lor (OpenAI pentru fiecare agent, Anthropic printr-o listă oficială, Perplexity pentru PerplexityBot și Perplexity-User). Procedura minimă:
Anthropic notează un detaliu util: blocarea pe baza IP-urilor poate împiedica botul să citească robots.txt, deci nu funcționează ca metodă de refuz „politicos”. Dacă folosești firewall, nu bloca IP-urile oficiale ale boților pe care vrei să-i refuzi prin robots.txt, ca regulile să poată fi citite. Anthropic menționează și suportul pentru directiva nestandardizată Crawl-delay, utilă la încărcare mare. Reține că Google nu o suportă, deci nu o folosi ca să încetinești Googlebot.
Nu există o rețetă universală. Tabelul de mai jos este un punct de pornire logic, nu o regulă; ajustează-l după obiectivele tale și după sfatul unui jurist unde e cazul.
| Tip de afacere | Antrenare | Căutare AI | Cereri ale utilizatorilor | Motiv |
|---|---|---|---|---|
| Firmă de servicii locale | Permis sau blocat, la alegere | Permis | Permis | Vrei să fii recomandat când cineva caută un furnizor |
| Magazin online | La alegere | Permis | Permis | Descrierile de produs sunt publice și vrei vizibilitate |
| Editor de știri sau conținut plătit | Blocat | De evaluat | De evaluat | Conținutul este activul principal; contează licențierea |
| Platformă cu cursuri sau zonă de membri | Blocat pe zonele plătite | Permis pe paginile publice | Permis pe paginile publice | Protejezi ce vinzi, expui ce atrage clienți |
| Site intern sau în dezvoltare | Blocat | Blocat | Blocat | Protejează cu autentificare, nu doar cu robots.txt |
Dacă ești o firmă străină cu public în România, nu uita că motoarele AI pot servi răspunsuri în română pe baza paginilor în orice limbă. Politica de acces se aplică unitar pe domeniu, nu pe limbă, dacă nu separi explicit directoarele.
Să presupunem că, după publicarea regulilor din primul scenariu, în logul serverului vezi două categorii de cereri. Prima: user agent care conține „OAI-SearchBot”, cu IP din intervalul publicat de OpenAI pentru acel agent. Este un vizitator legitim și permis; nu faci nimic. A doua: user agent „GPTBot”, dar cu o adresă care nu apare în lista OpenAI. Ori listele s-au schimbat de la ultima ta descărcare, ori cineva folosește numele fals. În ambele cazuri, descarcă din nou lista oficială; dacă adresa tot lipsește, tratează cererea ca neverificată și, la nevoie, limitează-o prin firewall.
Pentru fiecare agent, urmărește și ce accesează: dacă un bot de căutare cere masiv pagini nesemnificative (filtre, parametri), problema poate fi în arhitectura site-ului, nu în bot. Ghidul despre pagini neindexate te ajută să recunoști astfel de capcane de crawl.
noindex acolo unde se aplică.User-agent: * pentru tot. Regulile generale nu fac distincția antrenare/căutare.Disallow: / pus în grupul greșit. Verifică după fiecare modificare.Accesul boților este doar primul filtru. Fișierul llms.txt nu înlocuiește regulile de acces și nu are efecte dovedite. După ce decizi politica, măsoară ce se întâmplă: vezi cum măsori vizibilitatea în ChatGPT și în căutarea AI. Dacă bănuiești probleme mai largi de accesibilitate, un audit SEO tehnic le scoate la iveală.
Politica sănătoasă pentru mulți este: refuză antrenarea dacă așa vrei, permite căutarea dacă vrei vizibilitate, nu te baza pe robots.txt pentru ce e confidențial. Pași următori: alege scenariul, generează fișierul, verifică firewallul, urmărește logurile o lună. Dacă vrei să revizuim împreună configurarea, vezi pagina de optimizare GEO.
Întrebări frecvente
Nu neapărat. Conform OpenAI, GPTBot privește antrenarea modelelor, iar OAI-SearchBot privește afișarea în funcțiile de căutare ale ChatGPT. Sunt reguli independente. Dacă blochezi doar GPTBot și lași OAI-SearchBot permis, conținutul tău poate fi eligibil pentru căutare, dar nu pentru antrenare.
Pentru OpenAI, documentația indică aproximativ 24 de ore pentru rezultatele de căutare. La ceilalți furnizori nu există garanții de timp, deci presupune o întârziere. Verifică logurile serverului în zilele următoare, ca să vezi dacă boții respectă noile reguli.
Da. Robots.txt permite reguli pe directoare, de exemplu Disallow: /clienti/ sub un anumit user agent. Funcționează la nivel de cale, nu de paragraf. Pentru fragmente din pagină nu ai un control echivalent în robots.txt; folosește alte soluții sau scoate conținutul.
User agentul poate fi falsificat. Compară adresa IP cu intervalele publicate de furnizor: OpenAI, Anthropic și Perplexity oferă liste oficiale. Dacă user agentul spune GPTBot, dar IP-ul nu e în listă, nu ai de-a face cu botul real.
Depinde de afacere. Dacă vrei să fii recomandat în răspunsuri, blocarea boților de căutare te scoate din acele produse. Dacă ai conținut plătit sau de licențiat, blocarea antrenării și o protecție reală prin autentificare pot fi justificate. Decide separat pe tipuri de bot.
Serviciul asociat
Citește și
AI Overviews și AI Mode: ce cere Google ca pagina ta să fie link de suport, ce controale ai, cum măsori în Search Console și ce nu poți garanta.
llms.txt explicat fără hype: format, exemplu complet, ce spune Google, ce se știe despre efect și când merită sau nu să-l publici pe site-ul tău.
GEO (optimizare pentru motoare AI) explicat onest: ce funcționează, ce spune Google, ce e mit și un plan de 30 de zile pentru a fi citat în răspunsuri AI.
Trimite-ne adresa site-ului și îți răspundem cu o analiză inițială gratuită și o strategie concretă de optimizare SEO — fără obligații.