FeedMender/Errori/robots.txt
Rifiuti frequenti
robots.txt sta bloccando i tuoi annunci
È la mancata approvazione più disorientante che esista. La pagina si posiziona benissimo nella Ricerca Google, quindi sei certo che nulla sia bloccato, eppure ogni annuncio Shopping che la riguarda viene rifiutato. La causa è una riga che la maggior parte delle persone non ha mai avuto motivo di leggere con attenzione.
Cosa richiede Google
Tre crawler diversi, tutti autorizzati
Google raggiunge il tuo negozio con più di un crawler, e Shopping dipende da tre di essi:
Googlebot, che legge le tue pagine di destinazione.Googlebot-image, che recupera le immagini dei tuoi prodotti.AdsBot-Google, che controlla la pagina di destinazione dietro un annuncio.
Perché un prodotto venga pubblicizzato, tutti e tre devono poter raggiungere le parti rilevanti del
tuo sito secondo il robots.txt. Ricerca e Shopping sono serviti da bot diversi, ed
essere i benvenuti per uno non dice nulla sull'altro.
Perché è così disorientante
AdsBot-Google ignora il gruppo con carattere jolly
La maggior parte dei file robots.txt contiene un gruppo con carattere jolly,
User-agent: *, che significa "queste regole valgono per ogni crawler". È proprio questa
intuizione a rendere il difetto così difficile da individuare, perché AdsBot-Google
è un'eccezione deliberata: non obbedisce affatto al gruppo con carattere jolly. Segue solo le regole
scritte per lui per nome.
Così un file come questo sembra innocuo e non lo è:
User-agent: * Disallow: /checkout/ Disallow: /cart/
I crawler della Ricerca leggono il gruppo con carattere jolly, evitano /checkout/ e
indicizzano normalmente il resto del sito, ed è per questo che la pagina si posiziona.
AdsBot-Google ignora del tutto quel gruppo. Se non c'è un gruppo denominato
AdsBot-Google che autorizza le pagine di destinazione, o peggio, se sotto il suo nome
c'è un Disallow: / lasciato lì per sbaglio, ogni annuncio Shopping che punta a quelle
pagine viene rifiutato, mentre la Ricerca prosegue come se nulla fosse.
Come risolverlo a mano
Nomina il bot e autorizzalo
- Apri
https://yourdomain/robots.txtin un browser e leggilo per intero, compreso qualsiasi gruppo scritto specificamente perAdsBot-Google. - Se AdsBot è escluso dalle tue pagine di destinazione, aggiungi un gruppo che le autorizza,
ricordando che non erediterà nulla dal gruppo con carattere jolly:
User-agent: AdsBot-Google Allow: /
- Verifica che
Googlebotpossa raggiungere le tue pagine di destinazione e cheGooglebot-imagepossa raggiungere i percorsi delle tue immagini, così non risultano bloccate né la Ricerca né la revisione delle immagini. - Fai attenzione a plugin di sicurezza, regole CDN o firewall che bloccano gli user agent sconosciuti: possono fermare AdsBot anche quando il robots.txt è corretto.
Quali dei nostri controlli si applicano
I controlli robots che FeedMender esegue
L'analisi effettua una richiesta per dominio e testa i tre user agent separatamente, perché il punto è proprio che non si comportano allo stesso modo. È un campione, non una copertura esaustiva: al massimo tre domini e al massimo cinque percorsi di pagine di destinazione per dominio, via HTTPS. Un negozio servito da un solo dominio, cioè quasi tutti, è coperto per intero.
robots_blocks_adsbot_googlelink, bloccarobots_blocks_googlebotlink, bloccarobots_blocks_googlebot_imagelink, blocca
Si tratta di un'unica famiglia di codice, assemblata per crawler, quindi lo stesso controllo legge
ogni user agent a turno. Compare nell'elenco dei controlli come
*robots_blocks_ sotto le famiglie per attributo.
La via più rapida
Lascia che l'analisi lo legga per te
Poiché questo difetto si nasconde dietro una pagina che si posiziona, vale la pena far verificare
esplicitamente le regole robots per tutti e tre i crawler. L'analisi
gratuita legge il tuo robots.txt e riporta separatamente
Googlebot, Googlebot-image e AdsBot-Google.