Unealtă SEO gratuită · Tehnic · GEO

Generator robots.txt & llms.txt pentru Google și boții AI

Alegi platforma, decizi ce crawlere AI au acces — doar pentru căutare și citare sau și pentru antrenare — și primești fișierul gata de urcat. Plus un generator llms.txt și un tester care aplică regulile ca Google.

16 boți AI explicațiRFC 9309 tester după regulile Google3 în 1 robots · llms · tester
Control crawlere · robots.txt & llms.txt Rulează local, în browser
Platforma site-ului

Presetarea înlocuiește regulile de mai jos cu cele uzuale pentru platformă; apoi le poți modifica.

Reguli pentru toți roboții User-agent: *

* înlocuiește orice șir de caractere, $ marchează sfârșitul adresei. Exemplu: /*.pdf$ blochează toate fișierele PDF. Căile țin cont de majuscule.

secunde · ignorat de Google; unele crawlere, precum Bingbot, îl respectă
Crawlere și boți AI

Antrenare înseamnă că paginile pot ajunge în datele cu care se construiesc modelele — nu aduce vizite. Căutare & citare sunt boții care caută în timp real și pot afișa site-ul ca sursă, cu link. Pentru vizibilitate în ChatGPT, Claude sau Perplexity, lasă permiși cel puțin boții de căutare.

Notă onestă: numele boților sunt cele publicate de companii. Robots.txt este o convenție respectată de crawlerele oneste, nu o barieră tehnică — pentru conținut privat folosește autentificare. Unele companii precizează că agenții declanșați de un utilizator pot să nu aplice robots.txt.

robots.txt generat

            
Verificări

    Ce face robots.txt — și ce nu face

    Robots.txt este un fișier text din rădăcina domeniului prin care le spui crawlerelor ce zone ale site-ului pot accesa. Îl citesc Googlebot, Bingbot și, tot mai des, boții companiilor de inteligență artificială (care îl pot respecta sau nu). Folosit corect, ajută la economisirea resurselor de crawling pentru paginile care contează și ține departe paginile fără valoare: coș, cont de client, căutare internă, parametri de filtrare.

    Ce nu face: nu ascunde pagini din Google (o pagină blocată poate apărea în rezultate, fără descriere, dacă are linkuri spre ea) și nu protejează date private — fișierul e public și poate fi citit de oricine. Pentru excluderea din index folosești noindex, iar pentru confidențialitate, autentificare. Detaliem diferența în serviciul de SEO tehnic.

    Antrenare sau căutare: ce boți AI să permiți

    Companiile de AI folosesc boți diferiți pentru scopuri diferite. Boții de antrenare (GPTBot, ClaudeBot, CCBot) colectează pagini pentru modelele viitoare: nu aduc trafic, dar conținutul tău poate influența ce „știe” un model. Boții de căutare (OAI-SearchBot, Claude-SearchBot, PerplexityBot) caută în timp real când cineva pune o întrebare și pot cita site-ul ca sursă, cu link. Agenții declanșați de utilizatori (ChatGPT-User, Claude-User, Perplexity-User) deschid o pagină anume, la cerere.

    Pentru majoritatea firmelor care vor clienți din motoarele AI, o variantă rezonabilă este să permită cel puțin boții de căutare. Blocarea antrenării e o decizie de business legitimă — de exemplu pentru publicații sau conținut cu drepturi — dar trebuie luată conștient. Despre cum ajungi să fii citat, citește ghidul GEO: cum apari în răspunsurile AI și serviciul de optimizare GEO.

    Cum decide Google ce regulă se aplică

    • Un singur grup se aplică: cel cu user-agentul cel mai specific. Dacă există un grup pentru Googlebot, regulile de la * sunt ignorate complet pentru Googlebot.
    • Câștigă potrivirea cea mai lungă: Allow: /wp-admin/admin-ajax.php are prioritate față de Disallow: /wp-admin/, pentru că este mai specifică. La lungimi egale, câștigă Allow.
    • Caractere speciale: * înseamnă orice, $ fixează sfârșitul adresei. Disallow: /*.pdf$ blochează PDF-urile, dar nu și /ghid.pdf?v=2.
    • Căile țin cont de majuscule: /Admin/ și /admin/ sunt reguli diferite.

    Greșeli frecvente

    • Disallow: / uitat după lansare — site-ul de test a fost blocat, iar fișierul a ajuns așa în producție.
    • CSS și JavaScript blocate (de exemplu /wp-content/), ceea ce împiedică Google să randeze corect paginile.
    • Directiva Noindex în robots.txt — Google nu o mai respectă din 2019.
    • Filtrele de magazin lăsate libere: mii de combinații de parametri consumă bugetul de crawling. Vezi SEO pentru magazine online.

    Unde intră llms.txt

    Fișierul llms.txt nu înlocuiește robots.txt. Robots.txt spune ce pot accesa crawlerele; llms.txt oferă, în Markdown, un rezumat al site-ului și lista paginilor esențiale. Este o propunere (llmstxt.org), nu un standard, așa că tratează-l ca pe un plus care costă puțin. Scrie descrierea ca pe un răspuns direct — cine ești, ce oferi, unde — și pune linkuri doar spre pagini care merită citite.

    După ce urci fișierul, testează URL-urile importante cu testerul de mai sus și completează imaginea cu date structurate și cu un scor GEO al site-ului.

    Întrebări frecvente

    Întrebări frecvente despre robots.txt, boți AI și llms.txt

    Dacă blochez GPTBot, mai pot apărea în ChatGPT?

    Da, în principiu. Conform documentației OpenAI, GPTBot colectează pagini pentru antrenarea modelelor, iar căutarea din ChatGPT folosește OAI-SearchBot. Dacă vrei să fii citat ca sursă, lasă permis OAI-SearchBot (și, după caz, ChatGPT-User) și poți bloca separat GPTBot; verifică documentația OpenAI, deoarece regulile pentru agenții declanșați de utilizatori se pot schimba. La Anthropic logica e aceeași: ClaudeBot pentru antrenare, Claude-SearchBot pentru căutare.

    Blocarea Google-Extended îmi afectează pozițiile în Google?

    Nu. Google-Extended nu este un crawler separat, ci un token prin care decizi dacă paginile pot fi folosite pentru modelele Gemini. Google precizează că nu influențează includerea sau clasarea în Google Search; paginile sunt accesate în continuare de Googlebot.

    Robots.txt ascunde o pagină din Google?

    Nu neapărat. Robots.txt controlează accesarea, nu indexarea: o pagină blocată poate apărea totuși în rezultate, fără descriere, dacă există linkuri spre ea. Ca să scoți o pagină din index, folosește meta robots noindex și lasă pagina accesibilă, ca crawlerul să poată citi eticheta. Detalii la SEO tehnic.

    Ce este llms.txt și chiar contează?

    llms.txt este o propunere din 2024 (llmstxt.org): un fișier Markdown la rădăcina site-ului care rezumă ce face site-ul și care sunt paginile esențiale. Nu este un standard și nu există confirmări publice că marile motoare AI îl folosesc sistematic. Se face în câteva minute, deci e o investiție mică, dar nu înlocuiește conținutul bun și accesul crawlerelor. Vezi optimizarea GEO.

    Unde urc fișierele și cum verific că funcționează?

    Ambele stau în rădăcina domeniului: exemplu.ro/robots.txt și exemplu.ro/llms.txt; fiecare subdomeniu are propriul robots.txt. După urcare, verifică raportul robots.txt din Google Search Console și testează URL-urile importante cu testerul de mai sus. Un audit SEO verifică și ce pagini importante sunt blocate din greșeală.

    Nu ești sigur ce boți să lași să intre?

    Îți analizăm site-ul și stabilim împreună strategia de acces pentru Google și motoarele AI — ce se indexează, ce se citează și ce rămâne privat.