Canonical și conținut duplicat: când și cum folosești rel=canonical
Canonical URL explicat: cum tratează Google conținutul duplicat, când folosești rel=canonical, cod, cazuri din magazine și erori de evitat.
Pe scurt
Paginile neindexate sunt adrese pe care Google le cunoaște, dar nu le-a adăugat în indexul de căutare, așa că nu pot apărea în rezultate. Nu sunt întotdeauna o problemă: unele sunt excluse intenționat. Contează doar cele care ar trebui să fie vizibile și lipsesc. Raportul din Google Search Console îți arată motivul pentru fiecare, iar mai jos le parcurgem pe cele frecvente, cu soluții.
În Search Console, deschide Indexarea paginilor (în engleză, Page indexing). Raportul împarte adresele în două grupe: indexate și neindexate. La cele neindexate, Google afișează un motiv pentru fiecare grup de adrese, cu lista de exemple.
Trei lucruri de ținut minte:
Dacă nu ai lucrat încă cu instrumentul, ghidul Google Search Console pentru începători explică rapoartele de bază. Problemele tehnice de acest tip fac parte din SEO-ul tehnic; urmează pașii de mai jos.
Denumirile exacte din interfață pot diferi ușor ca traducere, dar sensul este cel din documentația Google.
| Status (în engleză) | Ce înseamnă | Cauză frecventă | Ce faci |
|---|---|---|---|
| Crawled – currently not indexed | Google a accesat pagina, dar nu a indexat-o | Conținut slab sau redundant, puține semnale | Îmbunătățești pagina, o legi intern, apoi aștepți |
| Discovered – currently not indexed | Google știe adresa, dar nu a accesat-o încă | Site nou, semnale slabe, serverul lent | Linkuri interne, sitemap, verifici viteza serverului |
| Excluded by ‘noindex’ tag | Pagina cere explicit să nu fie indexată | Etichetă noindex pusă intenționat sau din greșeală | Scoți noindex dacă pagina trebuie indexată |
| Blocked by robots.txt | Crawlarea e interzisă | Regulă Disallow prea largă | Corectezi robots.txt |
| Alternate page with proper canonical tag | Pagina indică altă adresă drept canonică | Variante de pagină, parametri | De obicei nimic: e corect |
| Duplicate without user-selected canonical | Duplicat, fără canonical declarat | Același conținut pe mai multe adrese | Declari canonicalul dorit |
| Duplicate, Google chose different canonical than user | Google a ales alt canonical decât cel declarat | Conținutul nu e suficient de similar sau semnalele se contrazic | Verifici semnalele contradictorii |
| Soft 404 | Pagina pare goală sau de eroare, dar returnează 200 | Pagini fără conținut, cu mesaj de eroare | Returnezi 404 sau completezi conținutul |
| Not found (404) | Adresa nu există | Link rupt, pagină ștearsă | Redirecționezi dacă există echivalent |
| Page with redirect | Adresa redirecționează în altă parte | Redirect intenționat | De obicei nimic: e corect |
| Server error (5xx) | Serverul a dat eroare | Supraîncărcare, configurare | Repari serverul |
| Redirect error | Redirect în buclă sau prea lung | Lanț de redirecturi | Corectezi lanțul |
Citește prima coloană ca pe un diagnostic, nu ca pe o vină. Mai jos detaliem grupurile care provoacă cele mai multe întrebări.
Sunt statusurile cel mai des întâlnite și cel mai des înțelese greșit.
Descoperită – neindexată momentan înseamnă că Google a aflat de pagină (din sitemap sau de la un link), dar încă nu a crawlat-o. Documentația spune că de obicei crawlarea este amânată ca să nu supraîncarce site-ul. Pe un site mic și nou, e adesea o chestiune de timp. Ce poți face: leagă pagina de pagini deja indexate, adaugă-o într-un sitemap curat și verifică dacă serverul răspunde rapid.
Accesată – neindexată momentan este mai neplăcut: Google a vizitat pagina și a decis, cel puțin deocamdată, să n-o păstreze. Documentația notează că pagina poate fi indexată ulterior, fără să o retrimiți. De regulă, motivul ține de pagină, nu de tehnică:
Soluția este îmbunătățirea paginii: răspuns direct, informații proprii, exemple, structură clară, linkuri interne din pagini puternice. Principiile sunt în articolul despre linkuri interne și arhitectura site-ului. Dacă ai multe pagini asemănătoare, consolidează-le într-una mai bună.
Eticheta <meta name="robots" content="noindex"> sau antetul X-Robots-Tag: noindex exclud pagina. Apare des după lansări, când rămâne configurarea de test. Verifică sursa paginii, nu doar ce arată pluginul SEO.
Un Disallow prea larg interzice crawlarea. Atenție la diferență: robots.txt împiedică crawlarea, nu garantează excluderea din index. Dacă vrei ca o pagină să nu apară în rezultate, folosește noindex și lasă pagina crawlabilă, altfel Google nu poate citi eticheta. Pentru un fișier corect, poți folosi generatorul de robots.txt.
Dacă o pagină declară drept canonică altă adresă, Google o tratează ca alternativă și nu o indexează. Corect pentru variante cu parametri; greșit când canonicalul a fost copiat din alt șablon. Explicația completă este în articolul despre canonical.
Adresele care returnează 404 nu se indexează (și nici nu trebuie). Problema apare când linkurile interne sau sitemapul trimit către ele. Erorile 5xx indică probleme de server; dacă sunt repetate, Google crawlează mai rar. Curăță linkurile rupte și, unde ai echivalent, folosește un redirect 301; detalii în ghidul despre redirecturi.
Pagini care arată a „nimic găsit” sau sunt aproape goale, dar întorc 200. Fie le faci să returneze 404, fie le dai conținut real. Se întâmplă des la categorii goale și la pagini de căutare internă.
„Pagină cu redirecționare” este normală pentru adresele vechi. Problemele sunt lanțurile și buclele („Redirect error”): fiecare adresă veche ar trebui să ducă direct către destinația finală.
Dacă textul apare abia după randare, Google poate vedea o pagină goală. Vezi articolul despre JavaScript SEO.
Pe un site cu sute sau mii de adrese, nu le poți repara pe toate deodată și nici nu trebuie. Ordonează-le după impactul asupra afacerii:
Să zicem că raportul arată 120 de adrese în „Accesată – neindexată momentan”. Deschizi lista și vezi că 90 sunt pagini de etichete (tag-uri) cu două articole fiecare, 20 sunt articole vechi, foarte scurte, iar 10 sunt servicii importante. Nu trimiți toate 120 la indexare. Decizia rațională: servicii mai întâi (le îmbunătățești și le legi din pagina principală), articolele vechi le unești sau le extinzi, iar paginile de etichete le pui pe noindex dacă nu au valoare proprie. Rezultatul nu este un raport cu zero adrese neindexate, ci un site în care ce contează este indexat și ce nu contează este exclus intenționat.
Acest tip de decizie se ia mai ușor dacă ai definit ce vrei să măsori; vezi articolul despre KPI SEO.
Un raport „curat” nu înseamnă toate adresele indexate. Sunt normale, între altele:
noindex puse de tine (pagini de mulțumire, coș, cont, rezultate de căutare internă);Pe un magazin online, filtrele și parametrii generează adesea mii de adrese excluse corect. Ce trebuie urmărit este ca paginile de categorie, produs și articol importante să fie indexate. Reține doar că problemele de buget de crawlare apar în special pe site-uri foarte mari.
Google spune explicit că nu garantează indexarea tuturor paginilor. Chiar și un site tehnic impecabil poate avea pagini pe care Google nu le consideră suficient de utile. De asemenea:
Pagina neindexată este un simptom, iar motivul se află în raport. Procedează astfel:
Dacă ai sute de adrese în situații neclare sau pagini importante care nu intră în Google, auditul de SEO tehnic identifică și prioritizează cauzele. Mai multe ghiduri găsești pe blog.
Întrebări frecvente
Pentru o pagină nouă, câteva zile până la câteva săptămâni sunt normale, mai ales pe un site tânăr. Dacă după două–trei săptămâni pagina importantă tot nu e indexată, verifică motivul în inspecția URL-ului. Nu cere indexarea de zeci de ori: nu accelerează procesul.
Doar pentru pagini importante sau recent modificate, după ce ai verificat că nu au probleme tehnice. Cererea nu garantează indexarea; ea doar pune adresa în coada de crawlare. Pentru un site întreg, mai eficient este un sitemap corect și linkuri interne către paginile noi.
Uneori da, dar nu e un scop în sine. Pagini subțiri, duplicate sau fără utilitate pot fi unite, îmbunătățite sau scoase cu 404 ori 410. Dar paginile excluse intenționat, cum ar fi filtrele sau variantele cu canonical, nu trebuie șterse doar ca raportul să arate mai curat.
Pot veni din parametri de URL, din filtre, din pagini de căutare internă, din variante cu și fără slash final sau din adrese vechi. Google le descoperă prin linkuri sau sitemap. Dacă nu au valoare, controlează-le cu canonical, noindex sau prin eliminarea linkurilor care duc spre ele.
Google a indexat adresa deși fișierul robots.txt o blochează la crawlare, de obicei pentru că a descoperit-o prin linkuri externe sau interne. Dacă vrei să o scoți din rezultate, folosește noindex și permite crawlarea, ca Google să poată citi eticheta. Robots.txt singur nu împiedică indexarea.
Serviciul asociat
Citește și
Canonical URL explicat: cum tratează Google conținutul duplicat, când folosești rel=canonical, cod, cazuri din magazine și erori de evitat.
Redirect 301 sau 302? Diferența, cum le tratează Google, cod pentru Apache și nginx, harta de redirecturi și greșelile care costă trafic.
Date structurate schema.org în JSON-LD: ce tipuri merită, exemple de cod pentru firmă, articol și produs, cum validezi și ce a retras Google în 2026.
Trimite-ne adresa site-ului și îți răspundem cu o analiză inițială gratuită și o strategie concretă de optimizare SEO — fără obligații.