FeedMender

FeedMender/Errori/robots.txt

Rifiuti frequenti

robots.txt sta bloccando i tuoi annunci

È la mancata approvazione più disorientante che esista. La pagina si posiziona benissimo nella Ricerca Google, quindi sei certo che nulla sia bloccato, eppure ogni annuncio Shopping che la riguarda viene rifiutato. La causa è una riga che la maggior parte delle persone non ha mai avuto motivo di leggere con attenzione.

Cosa richiede Google

Tre crawler diversi, tutti autorizzati

Google raggiunge il tuo negozio con più di un crawler, e Shopping dipende da tre di essi:

  • Googlebot, che legge le tue pagine di destinazione.
  • Googlebot-image, che recupera le immagini dei tuoi prodotti.
  • AdsBot-Google, che controlla la pagina di destinazione dietro un annuncio.

Perché un prodotto venga pubblicizzato, tutti e tre devono poter raggiungere le parti rilevanti del tuo sito secondo il robots.txt. Ricerca e Shopping sono serviti da bot diversi, ed essere i benvenuti per uno non dice nulla sull'altro.

Perché è così disorientante

AdsBot-Google ignora il gruppo con carattere jolly

La maggior parte dei file robots.txt contiene un gruppo con carattere jolly, User-agent: *, che significa "queste regole valgono per ogni crawler". È proprio questa intuizione a rendere il difetto così difficile da individuare, perché AdsBot-Google è un'eccezione deliberata: non obbedisce affatto al gruppo con carattere jolly. Segue solo le regole scritte per lui per nome.

Così un file come questo sembra innocuo e non lo è:

User-agent: *
Disallow: /checkout/
Disallow: /cart/

I crawler della Ricerca leggono il gruppo con carattere jolly, evitano /checkout/ e indicizzano normalmente il resto del sito, ed è per questo che la pagina si posiziona. AdsBot-Google ignora del tutto quel gruppo. Se non c'è un gruppo denominato AdsBot-Google che autorizza le pagine di destinazione, o peggio, se sotto il suo nome c'è un Disallow: / lasciato lì per sbaglio, ogni annuncio Shopping che punta a quelle pagine viene rifiutato, mentre la Ricerca prosegue come se nulla fosse.

Come risolverlo a mano

Nomina il bot e autorizzalo

  • Apri https://yourdomain/robots.txt in un browser e leggilo per intero, compreso qualsiasi gruppo scritto specificamente per AdsBot-Google.
  • Se AdsBot è escluso dalle tue pagine di destinazione, aggiungi un gruppo che le autorizza, ricordando che non erediterà nulla dal gruppo con carattere jolly:
    User-agent: AdsBot-Google
    Allow: /
  • Verifica che Googlebot possa raggiungere le tue pagine di destinazione e che Googlebot-image possa raggiungere i percorsi delle tue immagini, così non risultano bloccate né la Ricerca né la revisione delle immagini.
  • Fai attenzione a plugin di sicurezza, regole CDN o firewall che bloccano gli user agent sconosciuti: possono fermare AdsBot anche quando il robots.txt è corretto.

Quali dei nostri controlli si applicano

I controlli robots che FeedMender esegue

L'analisi effettua una richiesta per dominio e testa i tre user agent separatamente, perché il punto è proprio che non si comportano allo stesso modo. È un campione, non una copertura esaustiva: al massimo tre domini e al massimo cinque percorsi di pagine di destinazione per dominio, via HTTPS. Un negozio servito da un solo dominio, cioè quasi tutti, è coperto per intero.

  • robots_blocks_adsbot_googlelink, blocca
  • robots_blocks_googlebotlink, blocca
  • robots_blocks_googlebot_imagelink, blocca

Si tratta di un'unica famiglia di codice, assemblata per crawler, quindi lo stesso controllo legge ogni user agent a turno. Compare nell'elenco dei controlli come *robots_blocks_ sotto le famiglie per attributo.

La via più rapida

Lascia che l'analisi lo legga per te

Poiché questo difetto si nasconde dietro una pagina che si posiziona, vale la pena far verificare esplicitamente le regole robots per tutti e tre i crawler. L'analisi gratuita legge il tuo robots.txt e riporta separatamente Googlebot, Googlebot-image e AdsBot-Google.