Diferències entre noindex, noarchive i disallow: quan fer servir cadascun

La diferència principal entre noindex vs disallow és senzilla: noindex serveix per evitar que una pàgina aparegui a Google, mentre que disallow serveix per impedir que els bots la rastregin. noarchive, en canvi, no elimina la pàgina de l’índex: només evita que Google mostri una còpia en memòria cau.

Si el teu objectiu és reduir o controlar la teva presència als cercadors, aquesta guia encaixa dins d’una estratègia més àmplia sobre com deixar d’aparèixer a Google. Aquí ens centrarem en l’ús tècnic de cada directiva.

Resum ràpid

  • Segons Google Search Central, noindex impedeix que una pàgina aparegui als resultats si Google pot rastrejar-la.
  • Google aclareix que una URL bloquejada per robots.txt pot continuar apareixent als resultats si altres llocs l’enllacen.
  • noarchive no desindexa: només evita que Google mostri una còpia emmagatzemada en memòria cau de la pàgina.

Noindex vs disallow: quina és la diferència real

Google Search Central explica que noindex bloqueja la indexació, mentre que robots.txt controla el rastreig; per això, comparar noindex vs disallow és comparar indexació davant de rastreig.

noindex diu a Google: “pots rastrejar aquesta pàgina, però no la mostris als resultats”. disallow li diu: “no rastregis aquesta URL o carpeta”. Són instruccions diferents i no s’haurien d’utilitzar com si fossin equivalents.

La confusió apareix perquè totes dues s’utilitzen per controlar la visibilitat. Però només una està pensada per treure una pàgina de l’índex: noindex.

Citation Capsule: Segons Google Search Central, una pàgina bloquejada per robots.txt pot continuar apareixent a Google si rep enllaços externs. Per impedir que una URL s’indexi, Google recomana utilitzar noindex, no una regla Disallow.

Què és noindex i quan utilitzar-lo

Google defineix noindex com una regla que es pot aplicar mitjançant una metaetiqueta HTML o una capçalera HTTP per impedir que una pàgina aparegui als resultats de cerca.

Utilitza’l quan la pàgina pot existir, però no ha de posicionar. És típic en pàgines d’agraïment, landings duplicades, resultats interns, filtres, pàgines de prova, contingut de baixa qualitat o URLs que no aporten valor SEO.

Exemple en HTML:

<meta name="robots" content="noindex">

Exemple només per a Googlebot:

<meta name="googlebot" content="noindex">

Per a PDFs o altres fitxers no HTML, pots utilitzar una capçalera HTTP:

X-Robots-Tag: noindex

La regla pràctica és clara: si vols que Google vegi la pàgina per entendre que no l’ha d’indexar, utilitza noindex i permet el rastreig. Bloquejar l’accés abans que Google llegeixi l’etiqueta pot retardar el resultat.

Què és disallow i quan utilitzar-lo

Google Search Central indica que Disallow a robots.txt serveix per indicar als rastrejadors quines rutes no han de sol·licitar dins d’un lloc web.

Utilitza’l per gestionar el rastreig, no per desindexar. És útil quan vols evitar que Googlebot consumeixi recursos en zones poc útils, com paràmetres infinits, resultats de cerca interna, facetes innecessàries, carpetes tècniques o fitxers sense valor per al SEO.

Exemple bàsic:

User-agent: *
Disallow: /cerca-interna/

Aquest codi demana a tots els bots que no rastregin la carpeta /cerca-interna/. Però això no garanteix que aquestes URLs desapareguin de Google si ja estaven indexades o si reben enllaços.

Citation Capsule: Google adverteix que una URL bloquejada per robots.txt pot continuar apareixent als resultats si Google la descobreix per enllaços externs. En aquest cas, pot mostrar-se la URL sense contingut rastrejat.

En auditories tècniques, molts webs bloquegen filtres amb Disallow esperant que desapareguin de l’índex. El resultat acostuma a ser pitjor: Google no pot rastrejar la pàgina, però la URL pot continuar detectada.

Què és noarchive i quan utilitzar-lo

Google documenta noarchive com una directiva de robots que evita que es mostri una còpia en memòria cau de la pàgina als resultats de cerca.

noarchive no impedeix el rastreig. Tampoc impedeix la indexació. Només afecta com es mostra la pàgina a Google, especialment la disponibilitat de versions emmagatzemades.

Exemple:

<meta name="robots" content="noarchive">

També es pot combinar amb altres directives:

<meta name="robots" content="noindex, noarchive">

Utilitza’l quan el contingut canvia amb freqüència, té preus sensibles, informació legal actualitzable, dades temporals o qualsevol contingut del qual no vols que es pugui consultar una versió antiga des de la memòria cau.

No l’utilitzis esperant eliminar la URL. Si la pàgina està indexada, podrà continuar apareixent a Google. Simplement no s’hauria de mostrar una còpia arxivada.

Quan combinar noindex, noarchive i disallow

Google permet combinar directives de robots com noindex i noarchive, però Disallow pertany a robots.txt i actua abans del rastreig.

La combinació correcta depèn de l’objectiu. Si vols desindexar una pàgina, no la bloquegis amb Disallow abans que Google llegeixi el noindex. Si vols estalviar crawl budget en una zona irrellevant, utilitza Disallow.

Objectiu Directiva recomanada Motiu
Treure una pàgina de Google noindex Impedeix que aparegui als resultats.
Evitar el rastreig d’una carpeta Disallow Redueix l’accés dels bots a rutes concretes.
Evitar la còpia en memòria cau noarchive No elimina la URL, només la còpia emmagatzemada.
Treure una pàgina i evitar-ne la memòria cau noindex, noarchive Evita la indexació i la còpia arxivada.
Contingut privat Contrasenya o restricció d’accés Les directives SEO no substitueixen la seguretat.

A SEO Fiable oferim auditories de posicionament web que són molt útils per detectar tota mena de problemes tècnics al teu web i millorar així el teu posicionament SEO.

Errors freqüents en comparar noindex vs disallow

Google aclareix que per veure una etiqueta noindex primer ha de rastrejar la pàgina; per això, bloquejar la URL a robots.txt pot impedir que detecti la instrucció.

Aquests són els errors més habituals:

  • Utilitzar Disallow per desindexar: pot bloquejar el rastreig, però no garanteix l’eliminació de l’índex.
  • Bloquejar una URL amb noindex: Google potser no podrà llegir la metaetiqueta.
  • Utilitzar noarchive com si fos noindex: la pàgina pot continuar posicionant.
  • Aplicar noindex en pàgines importants: pot eliminar trànsit orgànic valuós.
  • No revisar plantilles: una etiqueta mal posada pot afectar centenars d’URLs.

Checklist recomanat abans d’aplicar directives: revisa si la URL rep trànsit orgànic, si té backlinks, si és al sitemap, si té enllaços interns i si existeix una alternativa millor per redirigir.

Citation Capsule: La comparació noindex vs disallow s’ha de resoldre per intenció: noindex controla si una URL apareix als resultats; Disallow controla si els bots poden rastrejar-la; noarchive només limita la còpia en memòria cau.

Com comprovar si la directiva està funcionant

Google recomana utilitzar l’eina d’inspecció d’URLs de Search Console per comprovar si una pàgina es pot rastrejar, si està indexada i quins senyals ha detectat Google.

Després d’aplicar una directiva, revisa:

  1. Inspecció d’URL: confirma si Google pot rastrejar la pàgina.
  2. HTML renderitzat: comprova que la metaetiqueta apareix al <head>.
  3. robots.txt Tester: valida si la ruta està bloquejada.
  4. Informe d’indexació: revisa si apareix com a exclosa per noindex.
  5. Sitemap XML: elimina URLs no indexables del sitemap.

Un detall important: no esperis canvis instantanis. Google necessita tornar a rastrejar la pàgina per detectar noindex o noarchive. Amb Disallow, l’efecte sobre el rastreig pot ser més ràpid, però la indexació pot trigar més a reflectir-se.

Preguntes freqüents sobre noindex, noarchive i disallow

Què és millor: noindex o disallow?

Depèn de l’objectiu. Segons Google, noindex serveix per impedir que una pàgina aparegui als resultats, mentre que Disallow bloqueja el rastreig. Si vols desindexar, utilitza noindex. Si vols estalviar rastreig, utilitza Disallow.

Puc utilitzar noindex i disallow junts?

No acostuma a ser recomanable si vols que Google detecti el noindex. Google necessita rastrejar la pàgina per llegir aquesta etiqueta. Si la bloqueges amb Disallow, pot no veure-la.

Noarchive elimina una pàgina de Google?

No. noarchive només evita que es mostri una còpia en memòria cau de la pàgina. La URL pot continuar indexada i aparèixer als resultats si no té també una directiva noindex.

Disallow protegeix contingut privat?

No. robots.txt és una instrucció de rastreig, no una mesura de seguretat. Per a contingut privat, utilitza autenticació, contrasenya, permisos de servidor o bloqueig real d’accés.

Quan utilitzar X-Robots-Tag?

Utilitza’l quan vulguis aplicar directives com noindex o noarchive a fitxers no HTML, com PDFs, imatges o documents servits des de capçaleres HTTP.

El que has de recordar per diferenciar noindex vs disallow

La diferència entre noindex vs disallow es resumeix en una frase: noindex controla l’aparició a Google; Disallow controla el rastreig. noarchive juga en una altra lliga: només afecta la còpia en memòria cau.

Si vols treure una pàgina dels resultats, utilitza noindex. Si vols evitar que Googlebot rastregi zones sense valor, utilitza Disallow. Si vols evitar versions emmagatzemades, utilitza noarchive.

Abans de tocar directives, revisa trànsit, enllaços, sitemap i objectiu de negoci. Una línia mal posada pot treure de l’índex una pàgina clau.