Unealtă SEO gratuită · Tehnic · GEO
Generator robots.txt & llms.txt pentru Google și boții AI
Alegi platforma, decizi ce crawlere AI au acces — doar pentru căutare și citare sau și pentru antrenare — și primești fișierul gata de urcat. Plus un generator llms.txt și un tester care aplică regulile ca Google.
Presetarea înlocuiește regulile de mai jos cu cele uzuale pentru platformă; apoi le poți modifica.
Rezumatul pe care un asistent AI îl citește primul.
Ce este llms.txt: o propunere din 2024 (llmstxt.org), nu un standard. Nu există confirmări publice că marile motoare AI îl folosesc sistematic; e o investiție mică, utilă mai ales pentru asistenții care citesc documentația unui site.
Deschide adresa site.ro/robots.txt, copiază tot conținutul și lipește-l aici. Testerul nu descarcă nimic de pe internet.
Cum decide testerul (RFC 9309 și documentația Google): alege grupul cu user-agentul cel mai specific (fără diferență între majuscule și minuscule) și combină grupurile cu același nume; dacă nu există, folosește *. Apoi câștigă regula cu calea cea mai lungă; la egalitate, Allow. Fără reguli potrivite, accesul e permis.
Ce face robots.txt — și ce nu face
Robots.txt este un fișier text din rădăcina domeniului prin care le spui crawlerelor ce zone ale site-ului pot accesa. Îl citesc Googlebot, Bingbot și, tot mai des, boții companiilor de inteligență artificială (care îl pot respecta sau nu). Folosit corect, ajută la economisirea resurselor de crawling pentru paginile care contează și ține departe paginile fără valoare: coș, cont de client, căutare internă, parametri de filtrare.
Ce nu face: nu ascunde pagini din Google (o pagină blocată poate apărea în rezultate, fără descriere, dacă are linkuri spre ea) și nu protejează date private — fișierul e public și poate fi citit de oricine. Pentru excluderea din index folosești noindex, iar pentru confidențialitate, autentificare. Detaliem diferența în serviciul de SEO tehnic.
Antrenare sau căutare: ce boți AI să permiți
Companiile de AI folosesc boți diferiți pentru scopuri diferite. Boții de antrenare (GPTBot, ClaudeBot, CCBot) colectează pagini pentru modelele viitoare: nu aduc trafic, dar conținutul tău poate influența ce „știe” un model. Boții de căutare (OAI-SearchBot, Claude-SearchBot, PerplexityBot) caută în timp real când cineva pune o întrebare și pot cita site-ul ca sursă, cu link. Agenții declanșați de utilizatori (ChatGPT-User, Claude-User, Perplexity-User) deschid o pagină anume, la cerere.
Pentru majoritatea firmelor care vor clienți din motoarele AI, o variantă rezonabilă este să permită cel puțin boții de căutare. Blocarea antrenării e o decizie de business legitimă — de exemplu pentru publicații sau conținut cu drepturi — dar trebuie luată conștient. Despre cum ajungi să fii citat, citește ghidul GEO: cum apari în răspunsurile AI și serviciul de optimizare GEO.
Cum decide Google ce regulă se aplică
- Un singur grup se aplică: cel cu user-agentul cel mai specific. Dacă există un grup pentru Googlebot, regulile de la
*sunt ignorate complet pentru Googlebot. - Câștigă potrivirea cea mai lungă:
Allow: /wp-admin/admin-ajax.phpare prioritate față deDisallow: /wp-admin/, pentru că este mai specifică. La lungimi egale, câștigă Allow. - Caractere speciale:
*înseamnă orice,$fixează sfârșitul adresei.Disallow: /*.pdf$blochează PDF-urile, dar nu și/ghid.pdf?v=2. - Căile țin cont de majuscule:
/Admin/și/admin/sunt reguli diferite.
Greșeli frecvente
Disallow: /uitat după lansare — site-ul de test a fost blocat, iar fișierul a ajuns așa în producție.- CSS și JavaScript blocate (de exemplu
/wp-content/), ceea ce împiedică Google să randeze corect paginile. - Directiva
Noindexîn robots.txt — Google nu o mai respectă din 2019. - Filtrele de magazin lăsate libere: mii de combinații de parametri consumă bugetul de crawling. Vezi SEO pentru magazine online.
Unde intră llms.txt
Fișierul llms.txt nu înlocuiește robots.txt. Robots.txt spune ce pot accesa crawlerele; llms.txt oferă, în Markdown, un rezumat al site-ului și lista paginilor esențiale. Este o propunere (llmstxt.org), nu un standard, așa că tratează-l ca pe un plus care costă puțin. Scrie descrierea ca pe un răspuns direct — cine ești, ce oferi, unde — și pune linkuri doar spre pagini care merită citite.
După ce urci fișierul, testează URL-urile importante cu testerul de mai sus și completează imaginea cu date structurate și cu un scor GEO al site-ului.
Întrebări frecvente
Întrebări frecvente despre robots.txt, boți AI și llms.txt
Dacă blochez GPTBot, mai pot apărea în ChatGPT?
Da, în principiu. Conform documentației OpenAI, GPTBot colectează pagini pentru antrenarea modelelor, iar căutarea din ChatGPT folosește OAI-SearchBot. Dacă vrei să fii citat ca sursă, lasă permis OAI-SearchBot (și, după caz, ChatGPT-User) și poți bloca separat GPTBot; verifică documentația OpenAI, deoarece regulile pentru agenții declanșați de utilizatori se pot schimba. La Anthropic logica e aceeași: ClaudeBot pentru antrenare, Claude-SearchBot pentru căutare.
Blocarea Google-Extended îmi afectează pozițiile în Google?
Nu. Google-Extended nu este un crawler separat, ci un token prin care decizi dacă paginile pot fi folosite pentru modelele Gemini. Google precizează că nu influențează includerea sau clasarea în Google Search; paginile sunt accesate în continuare de Googlebot.
Robots.txt ascunde o pagină din Google?
Nu neapărat. Robots.txt controlează accesarea, nu indexarea: o pagină blocată poate apărea totuși în rezultate, fără descriere, dacă există linkuri spre ea. Ca să scoți o pagină din index, folosește meta robots noindex și lasă pagina accesibilă, ca crawlerul să poată citi eticheta. Detalii la SEO tehnic.
Ce este llms.txt și chiar contează?
llms.txt este o propunere din 2024 (llmstxt.org): un fișier Markdown la rădăcina site-ului care rezumă ce face site-ul și care sunt paginile esențiale. Nu este un standard și nu există confirmări publice că marile motoare AI îl folosesc sistematic. Se face în câteva minute, deci e o investiție mică, dar nu înlocuiește conținutul bun și accesul crawlerelor. Vezi optimizarea GEO.
Unde urc fișierele și cum verific că funcționează?
Ambele stau în rădăcina domeniului: exemplu.ro/robots.txt și exemplu.ro/llms.txt; fiecare subdomeniu are propriul robots.txt. După urcare, verifică raportul robots.txt din Google Search Console și testează URL-urile importante cu testerul de mai sus. Un audit SEO verifică și ce pagini importante sunt blocate din greșeală.
Laboratorul SEO
Alte unelte gratuite
Test viteză & Core Web Vitals
Măsoară LCP, INP, CLS și scorurile Lighthouse ale oricărui site, cu date reale de la Google.
Deschide unealta →Generator Schema JSON-LD
Date structurate gata de lipit: organizație, afacere locală, FAQ, articol, produs, breadcrumb.
Deschide unealta →Scor GEO: pregătit pentru AI?
Un diagnostic în 2 minute: cât de pregătit e site-ul tău să fie citat de ChatGPT, Perplexity și Google AI.
Deschide unealta →Nu ești sigur ce boți să lași să intre?
Îți analizăm site-ul și stabilim împreună strategia de acces pentru Google și motoarele AI — ce se indexează, ce se citează și ce rămâne privat.
[email protected] · 0771 430 955