Il robots.txt è un file di testo semplice collocato nella directory radice (root) del server web che ospita il tuo sito, accessibile pubblicamente all’indirizzo del dominio seguito dal suffisso /robots.txt. Rappresenta il protocollo standard (Robots Exclusion Protocol) attraverso cui chi gestisce un portale internet fornisce istruzioni dirette ai software automatici di scansione della rete, noti come bot, spider o crawler, tra cui Googlebot.
Il ruolo primario di questo documento è regolare e canalizzare l’attività di scansione dei motori di ricerca per salvaguardare le risorse del server e ottimizzare il cosiddetto crawl budget (il tempo e il numero massimo di pagine che un bot decide di scansionare su un sito). Quando un crawler scopre il tuo dominio, consulta immediatamente il file robots.txt per verificare se vi siano cartelle, file di sistema o percorsi privati contrassegnati dal divieto di accesso prima di procedere con l’esplorazione dei contenuti pubblici.
Su un sito basato su WordPress, il robots.txt viene normalmente gestito in modo virtuale e dinamico tramite i principali plugin di ottimizzazione SEO. Una configurazione standard e sicura prevede tipicamente di vietare la scansione dell’area di gestione interna del CMS attraverso l’istruzione “Disallow: /wp-admin/”, consentendo contemporaneamente l’accesso al file di elaborazione delle chiamate asincrone con “Allow: /wp-admin/admin-ajax.php”. Inoltre, sul fondo del file viene generalmente specificato il percorso della sitemap XML, per agevolare l’individuazione di tutti gli articoli e le pagine importanti del blog.
L’equivoco più diffuso e rischioso consiste nel credere che il comando disallow nel robots.txt impedisca a una pagina di essere indicizzata nei risultati di ricerca: in realtà blocca solo la scansione, e se la pagina riceve collegamenti esterni Google può comunque mostrarne l’URL nei risultati senza averne letto il contenuto. Per escludere con certezza una pagina dall’indice occorre invece applicare la direttiva noindex. Un errore gravissimo è pubblicare sbadatamente una regola come “Disallow: /”, che vieta l’accesso all’intero sito, facendolo sparire completamente dai motori di ricerca nel giro di pochi giorni.
Disporre di un file robots.txt ben configurato è una misura basilare per qualsiasi progetto web. Mantiene in ordine il dialogo con i motori di ricerca, protegge le risorse del tuo server da scansioni superflue e garantisce che i crawler dedichino tutta la loro attenzione alle pagine strategiche destinate ad attrarre pubblico e conversioni.
Fonte: it.wikipedia.org