FeedMender

FeedMender/Errores/robots.txt

Rechazos frecuentes

robots.txt está bloqueando tus anuncios

Este es el rechazo más desconcertante que existe. La página posiciona perfectamente en la Búsqueda de Google, así que estás seguro de que no hay nada bloqueado, y aun así todos los anuncios de Shopping que apuntan a ella se rechazan. La causa es una línea que la mayoría de la gente nunca ha tenido motivo para leer con atención.

Qué exige Google

Tres rastreadores distintos, todos con permiso

Google llega a tu tienda con más de un rastreador, y Shopping depende de tres de ellos:

  • Googlebot, que lee tus páginas de destino.
  • Googlebot-image, que descarga las imágenes de tus productos.
  • AdsBot-Google, que revisa la página de destino detrás de un anuncio.

Para que un producto se anuncie, los tres tienen que tener permiso en robots.txt para llegar a las partes relevantes de tu sitio. De la Búsqueda y de Shopping se ocupan bots distintos, y ser bienvenido para uno no dice nada sobre el otro.

Por qué resulta tan desconcertante

AdsBot-Google ignora el grupo comodín

La mayoría de los archivos robots.txt llevan un grupo comodín, User-agent: *, que significa "estas reglas se aplican a todos los rastreadores". Esa intuición es lo que hace este fallo tan difícil de detectar, porque AdsBot-Google es una excepción deliberada: no obedece el grupo comodín en absoluto. Solo sigue las reglas escritas para él por su nombre.

Así que un archivo como este parece inofensivo y no lo es:

User-agent: *
Disallow: /checkout/
Disallow: /cart/

Los rastreadores de la Búsqueda leen el grupo comodín, evitan /checkout/ e indexan el resto del sitio con normalidad, y por eso la página posiciona. AdsBot-Google ignora ese grupo por completo. Si no hay un grupo llamado AdsBot-Google que permita las páginas de destino, o peor aún, hay un Disallow: / suelto bajo su nombre, todos los anuncios de Shopping que apuntan a esas páginas se rechazan, mientras la Búsqueda sigue como si no pasara nada.

Cómo arreglarlo a mano

Nombra al bot y dale permiso

  • Abre https://yourdomain/robots.txt en un navegador y léelo entero, incluido cualquier grupo escrito específicamente para AdsBot-Google.
  • Si AdsBot tiene prohibidas tus páginas de destino, añade un grupo que las permita, recordando que no va a heredar nada del grupo comodín:
    User-agent: AdsBot-Google
    Allow: /
  • Confirma que Googlebot puede llegar a tus páginas de destino y que Googlebot-image puede llegar a las rutas de tus imágenes, para que tampoco queden bloqueadas ni la Búsqueda ni la revisión de imágenes.
  • Vigila cualquier plugin de seguridad, regla de CDN o cortafuegos que bloquee agentes de usuario desconocidos, porque puede frenar a AdsBot incluso cuando robots.txt es correcto.

Cuáles de nuestras comprobaciones se aplican

Las comprobaciones de robots que FeedMender ejecuta

El análisis hace una petición por dominio y prueba los tres agentes de usuario por separado, porque la clave es precisamente que no se comportan igual. Es una muestra, no una cobertura exhaustiva: como máximo tres dominios, y como máximo cinco rutas de página de destino por dominio, por HTTPS. Una tienda que sirve desde un solo dominio, que son casi todas, queda cubierta por completo.

  • robots_blocks_adsbot_googlelink, bloquea
  • robots_blocks_googlebotlink, bloquea
  • robots_blocks_googlebot_imagelink, bloquea

Son una sola familia de código, ensamblada por rastreador, de modo que la misma comprobación lee cada agente de usuario por turno. Aparece en la lista de comprobaciones como *robots_blocks_ dentro de las familias por atributo.

El camino más rápido

Deja que el análisis lo lea por ti

Como este fallo se esconde detrás de una página que posiciona, merece la pena que algo compruebe de forma explícita las reglas de robots para los tres rastreadores. El análisis gratuito lee tu robots.txt e informa por separado sobre Googlebot, Googlebot-image y AdsBot-Google.