Qué es el archivo robots.txt

En esta guía vamos a detallar los pasos para crear y utilizar de la mejor manera el archivo “robots.txt” ubicado en la raíz de una página web. El archivo robots.txt es la puerta de acceso para que los robots automatizados de los principales buscadores (principalmente el robot de Google) ingresen al sitio web o blog y comprueben el crecimiento de la información de la página web.

Crear y personalizar el archivo robots.txt
Crear y personalizar el archivo robots.txt

Si te preocupa que un robot ingrese a tu sitio web y tenga acceso libre a tu información, a continuación vamos a crear el archivo “robots.txt”, que básicamente controlará al robot de los buscadores indicándole dónde puede ingresar libremente y dónde tendrá prohibido el acceso.

Cómo crear el archivo robots.txt

Lo primero que tenemos que hacer es abrir un documento de texto desde el ordenador, nombrarlo “robots.txt” y, una vez que insertemos el código adecuado (dependiendo de las necesidades del sitio), subirlo a la raíz de la página web vía FTP.

Bloquear una carpeta del sitio web

Si queremos bloquear una carpeta del sitio web, para que el robot de los buscadores no tenga acceso a la misma, le insertaremos este código al archivo “robots.txt”:

User-agent: *
Disallow: / confidencial.html
Disallow: / nombredelacerpeta /

Bloquear todo el sitio web

En cambio, si lo que buscamos es que el sitio web esté totalmente bloqueado y el robot no pueda ingresar a ninguna carpeta, contenido o archivo, copiamos el siguiente código:

User-agent: *
Disallow: /

Evitar que la página sea indexada

Y si lo que buscamos es tener una página web que no sea indexada por los buscadores web, insertamos el siguiente código:

User-agent: *
Disallow: / asunto-confidencial.html

Permitir el acceso selectivo

Pero si lo que buscamos es restringir a los buscadores algún acceso, pero que tengan acceso a los artículos, imágenes, el contacto y otras carpetas, insertamos el siguiente código:

User-agent: *
Allow: / articulo-web.html
Allow: / carpeta / contato.html
Allow: / imagenes /
Disallow: /

Configuración para CMS

Y si lo que tenemos es un CMS (Joomla, WordPress, Drupal, etc.), tenemos que copiar este código:

User-agent: *
Disallow: /administrator/
Disallow: /cache/
Disallow: /cli/
Disallow: /components/
Disallow: /images/
Disallow: /includes/
Disallow: /installation/
Disallow: /language/
Disallow: /libraries/
Disallow: /logs/
Disallow: /media/
Disallow: /modules/
Disallow: /plugins/
Disallow: /templates/
Disallow: /tmp/

Consejos finales

Con estos ejemplos podrás crear o personalizar el archivo robots.txt de una página web. Este archivo es importante tenerlo bien configurado si queremos que la página web tenga un buen posicionamiento web y llegar a los primeros puestos de los principales buscadores web.

Para ampliar la información, se pueden dirigir al sitio web oficial de robots.txt.

Sitio Oficial: