Presupuesto de rastreo: por qué no es tu problema

Por Fabien Hernoux 7 min de lectura

El presupuesto de rastreo es un concepto real, y para la inmensa mayoría de los sitios es una distracción. Si tiene unos cientos o unos miles de páginas, los motores no racionan sus visitas en su casa, y ninguna optimización hará que su contenido se indexe más deprisa.

El término merece sobre todo entenderse para reconocer las situaciones en que se aplica de verdad, y dejar de preocuparse por todas las demás.

Lo que quiere decir

Un robot no puede visitar todas las URL de la web tan a menudo como querría: así que decide qué atención concede a cada sitio. Dos cosas la determinan: lo que piensa del interés de volver a su casa, y lo que su servidor encaja sin penar.

Fíjese en que ninguna de las dos es una cuota que se recargue. Un sitio que publica regularmente cosas útiles se rastrea más porque vale la pena, no porque haya ganado puntos. Es una consecuencia, no una palanca, y es ese contrasentido el que produce la mayoría de las optimizaciones inútiles.

¿Le concierne? La tabla que lo zanja

Su sitio Concernido Lo que hay que hacer
Menos de 1 000 páginas No Nada, de verdad nada
1 000 a 10 000 páginas estables No Publicar, enlazar correctamente
Tienda con filtros combinables Cerrar el espacio infinito
Catálogo de más de 100 000 páginas Seleccionar lo que merece rastrearse
Calendario o buscador expuestos Bloquear, no optimizar
Servidor lento, más de dos segundos Corregir el tiempo de respuesta

Las dos primeras líneas cubren la práctica totalidad de los sitios que se hacen la pregunta. Si está en ellas, la mejor decisión es cerrar este artículo e ir a escribir una página útil.

A quién concierne realmente

Los sitios con espacio de URL ilimitado. Una tienda donde cada combinación de filtros es una dirección distinta. Un calendario que genera de buena gana el año 2147. Una página de búsqueda que convierte cualquier consulta en una URL rastreable. Esos sitios no tienen diez mil páginas, tienen una infinidad, y eso es el verdadero problema: no es un presupuesto insuficiente, es un gasto sin fondo.

Los catálogos muy grandes: cientos de miles de páginas reales, donde la larga cola se disputa de verdad la atención. A esa escala, la pregunta ya no es técnica sino editorial: qué páginas merecen existir.

Los sitios que responden lentamente. Si su servidor tarda dos segundos por página, un robot levanta el pie para no perjudicarle. Aquí el arreglo no es un ajuste de posicionamiento: es el tiempo de respuesta, y beneficia también a sus visitantes, lo que lo convierte en el único trabajo de esta lista que rinde dos veces.

Lo que se toma erróneamente por un problema de presupuesto

Un montón de 404. Parece un desperdicio y no lo es. Un robot aprende que una URL ha desaparecido y deja de pedirla. Corrija aquellos hacia los que algo sigue apuntando, no los demás, y sobre todo no elimine páginas para «aligerar» nada.

Páginas no indexadas. Casi siempre un juicio de calidad o de duplicación, no de presupuesto. La página ha sido vista y no ha sido retenida: es otra conversación, y se resuelve mejorando la página, no ajustando un robot.

Un arranque lento tras una migración. Las nuevas URL se descubren progresivamente. Es normal y sin relación con un racionamiento: la lista de comprobación de migración cubre lo que ayuda de verdad, a saber, redirecciones limpias y un sitemap al día.

Cadenas de redirecciones. Cuestan efectivamente peticiones, pero el problema que plantean está en otra parte: acaban cortadas, y pierden visitantes mucho antes de costar el menor rastreo. La regla del salto único se justifica sin invocar el presupuesto de rastreo.

Si realmente le concierne

El trabajo consiste en suprimir direcciones, no en añadir directivas.

Deje de generar combinaciones de URL que nadie debería ver: es un ajuste de plantilla, no un archivo de configuración. Use robots.txt para los espacios infinitos, calendarios y buscadores internos en cabeza. Devuelva códigos de estado correctos, para que un robot sepa qué olvidar. Mantenga un sitemap limitado a las páginas que quiere hacer visitar de verdad, y retire de él todo lo que devuelva un error.

Una palabra sobre noindex y robots.txt, que se confunden sin parar: el primero pide no indexar una página que será visitada de todos modos, el segundo pide no visitarla en absoluto. Para un espacio infinito hace falta el segundo, y es también el que vuelve la página definitivamente invisible, así que hay que manejarlo con precaución.

Antes de poner una regla en robots.txt, pruébela: una directiva demasiado amplia cierra un pan entero del sitio sin anunciar nada. Comprobar lo que un robot tiene derecho a visitar cuesta diez segundos y evita el error más caro de esta página.

De dónde viene la inquietud, y por qué dura

El asunto tiene una historia, y conocerla ayuda a desprenderse de ella. La expresión viene de documentaciones destinadas a sitios muy grandes, donde describía un problema real de asignación de recursos. Luego fue retomada en guías generalistas que retiraron la condición de tamaño, y solo quedó una inquietud sin umbral.

Dura por dos razones. Primero porque es agradable: ofrece una explicación técnica a una falta de resultados, lo que es más cómodo que la conclusión editorial. Después porque es inverificable para la mayoría de la gente, a falta de acceso a los registros del servidor. Una creencia que no se puede probar no muere.

La prueba que lo zanja cabe en una pregunta: ¿está indexada una página que publiqué la semana pasada? Si sí, su sitio se rastrea tanto como necesita, y el asunto queda cerrado. Si la respuesta es no, compruebe primero si la página está enlazada desde alguna parte antes de pensar en un presupuesto: una página a la que no lleva ningún camino no está racionada, es inencontrable.

Lo que ayuda de verdad a ser rastreado

Tres cosas, ninguna de las cuales lleva el nombre de presupuesto.

Enlaces internos hacia sus páginas profundas. Una página que ningún enlace alcanza desde su portada en tres clics es una página que los robots encuentran tarde y revisitan raramente. Es la palanca más eficaz, y es también la única que sirve a sus lectores.

Un sitemap limpio. Al día, sin URL en error, sin páginas bloqueadas, con fechas de modificación honestas. Un sitemap que miente sobre las fechas deja rápidamente de tomarse en serio.

Un sitio que responde deprisa. Eso no es cuestión de posicionamiento, es cuestión de alojamiento, y beneficia en primer lugar a la gente que le lee. Los enlaces muertos y las redirecciones en cascada contribuyen también, lo que es una razón más para tratarlos sin invocar jamás el presupuesto de rastreo.

Cómo medir, en vez de adivinar

Los registros de su servidor son el único lugar donde esta pregunta se zanja honestamente. Dicen qué URL se han pedido, por qué robot, cuántas veces, y con qué código de respuesta.

Bastan tres cifras, tomadas antes y luego un mes después:

  • El número de URL distintas rastreadas. Si es muy superior al número de sus páginas reales, tiene un espacio infinito en alguna parte.
  • La proporción de respuestas en error. Una proporción elevada indica un problema de estructura, no de presupuesto.
  • La proporción de peticiones sobre páginas sin interés. Es la única medida que justifica una intervención.

Sin esas tres cifras, toda optimización del presupuesto de rastreo es una creencia. Con ellas, la pregunta se resuelve generalmente en una tarde, y la mayoría de las veces la conclusión es que no había nada que hacer.

Queda un trabajo que sí merece su tiempo y que nada tiene que ver con los robots: los enlaces que salen de su casa hacia páginas muertas en otra parte. Esos no figuran en ningún informe de rastreo, y son sus lectores quienes los encuentran primero.

En Expansel Enlaces rotos Expansel recorre tu sitio página a página, prueba cada enlace y te devuelve la lista de lo que está roto, con el sitio exacto donde corregirlo.

Preguntas frecuentes

¿A partir de cuántas páginas importa el presupuesto de rastreo?

No hay umbral oficial, pero el tema apunta a sitios muy grandes: cientos de miles de URL, o un sitio que genera direcciones sin límite. Unos miles de páginas no es eso.

¿Los errores 404 desperdician presupuesto de rastreo?

Apenas. Un rastreador aprende rápido que una URL ha desaparecido y deja de pedirla. Los 404 merecen arreglo cuando algo sigue apuntando a ellos, no por coste de rastreo.

¿Qué consume realmente presupuesto de rastreo?

Sobre todo los espacios de URL infinitos: combinaciones de filtros, calendarios sin fin, parámetros de sesión, versiones imprimibles de cada página. El volumen de contenido real rara vez es la causa.

No vuelvas a perder un backlink

Añade tus sitios y enlaces y deja que Expansel los vigile por ti.

Empezar gratis