Robots.txt: ¿Qué es, para qué sirve y cómo crearlo?

Fecha Publicación:       07 de Febrero de 2021
Fecha Modificación:       14 de Febrero de 2021

Robots,txt es un archivo que subimos a la raíz de nuestro servidor web (lo alojamos en http://www.tudominio.com/robots.txt).

Puedes crear archivos robots.txt con prácticamente cualquier editor de texto; solo tienes que comprobar que el editor pueda crear archivos de texto UTF‑8 estándar. No utilices procesadores de texto, ya que suelen guardar los archivos en formatos propios y pueden añadir caracteres inesperados, como comillas curvas, que pueden causar problemas a los rastreadores.

Una página bloqueada mediante robots.txt puede indexarse si se vincula desde otros sitios

Como verificar el archivo Robots.txt

Para comprobar que el archivo de robots lo hemos configurado correctamente, deberemos acceder al comprobador de robots.txt, donde podremos verificar que se están cumpliendo las reglas que hemos especificado.

→  Ir a Probar tu archivo robots.txt con el Probador de robots.txt de Google

→  Ir a Probador de robots.txt Validator and Testing Tool  de technicalseo.com

 → Ir a ¿Para qué se usa robots.txt?

Tu página puede aparecer en los resultados de la búsqueda incluso si está bloqueada por un archivo robots.txt. Sin embargo, no tendrá descripción y se verá de la siguiente manera. Se excluirán los archivos de imagen, video, PDF y otros que no sean HTML. Si ves este resultado de la búsqueda para tu página y quieres corregirlo, quita la entrada robots.txt que bloquea la página. Para ocultar completamente la página de la búsqueda, usa otro método.

En la documentación se ve ejemplos de robots.txt como :

 → Ir a Documentación Oficial crear un archivo robots.txt

  • Bloquear el rastreo de un directorio y de su contenido
  • Bloquear el rastreo de todo el sitio web
  • Permitir que acceda un solo rastreador
  • Bloquear el rastreo de una única página web
  • Bloquear una imagen concreta para que no aparezca en Google Imágenes
  • Bloquear las URL que terminen de una forma concreta (ejemplo Disallow: /*.xls$)
  • etc.

Bloquear carpeta con robots.txt

User-Agent: *
Disallow: /pruebas/
Disallow: /puertasycreaciones/
Disallow: /webadmin/

En este ejemplo permitimos que todos los agentes puedan escanear mi web  , ademas estamos denegando escanear las carpetas  pruebas ,  puertasycreaciones , webadmin

Agregando un Sitemap en nuestro archivo robots.txt

Sitemap: https://www.tudominio.com/sitemap.xml
User-Agent: *
Disallow: /pruebas/
Disallow: /puertasycreaciones/
Disallow: /webadmin/

NOTA: La directiva que contiene la ubicación del sitemap XML se puede colocar en cualquier parte del robots.txt Es independiente de la línea de agente de usuario, por lo que no importa dónde se coloque.

Bloquear el acceso a todas las direcciones URL que usen el signo de interrogación (?)

Disallow: /*?

Google y el archivo  robots.txt

 

Articulo : 1352 - Veces Leidas
Compartir Articulo:
×

¡Apóyame suscribiéndote a mi canal!

Tutoriales sobre Diseño Web