Hace tiempo que no comentamos muchas cosas de posicionamiento web por aquí. Así que a fin de que no se afirme el día de hoy he sacado de bocetos una serie de apuntes sobre uno de los básicos del SEO del que la mayoría de gente desconoce detalles muy importantes: El archivo robots.txt, uno de los básicos de la indexación posicionamiento en buscadores. Robots.txt es un fichero destinado a indicar a los motores de búsqueda que URLs está en su derecho a visitar y de cuales debería abstenerse. El funcionamiento es simple: antes de visitar una URL del site un robot debería mirar en este archivo para determinar si debe ir ahí a recoger información o bien si por contra el dueño del site prefiere que no entre. En definitiva son solo indicaciones que cualquier robot puede saltarse si quiere, mas a las que el robot de google hace bastante caso (que tampoco al cien por cien ).
El archivo robots.txt es uno de esos temas técnicos del que todo posicionamiento web debe saber lo suficiente como para manipularlo con éxito. Por este motivo exactamente el mismo Google en su soporte nos señala como podemos crear el nuestro:.
Se nos da información muy directa y fácil de asimilar. La redacción de estos archivos es muy sencilla si bien cualquier fallo, por mínimo que sea, podría provocar que las arañas no entraran en las páginas que queremos. En el mejor de los casos eso provocará que sigan visitando URLs en las que no querríamos que perdiesen el tiempo en el peor será todo lo contrario: no indexarán contenidos que en realidad si que deseamos que aparezcan en el buscador. Es el tipíco aspecto importante que de fácil que es la gente no se toma lo suficientemente en serio, y ahí esta el problema: la documentación de Google está bien si bien no cubre todas las pecularidades sobre como se marcha a interpretar dicho fichero y si nos quedamos solo ahí podemos cometer fallos que lamentaremos en el futuro.
Así pues, os dejo diez conceptos sobre estos archivos que hay que tomar en consideración y asimilar. Desde lo más básico hasta consejos que solo en webs complejas o con mucho detalle de optimización del crawl budget podremos aplicar.
Back to top1) Previo: El formato general del robots.txt
Un Robots.txt es fácil...
1. Empezamos declarando en una línea el usuario-agent (nombre del sistema que está navegando o bien rastreando el site) al que deseamos afectar y tras esta indicaremos los accesos permitidos y prohibidos.
- En muchas ocasiones declararemos un accceso a todos (usuario-agent:*) y en ocsaiones nos referiremos a algun robot o crawler particularmente (user-agent:googlebot).
Sigue leyendo









