Volver a las guías

Robots.txt y acceso de rastreo: cómo asegurarse de que los rastreadores llegan a su sitio

Los rastreadores tienen que descargar una página antes de posicionarla. Cómo robots.txt, la protección contra bots y los soft 404 bloquean el acceso aunque el sitio parezca sano.

Antes de evaluar una página, un buscador tiene que descargarla. El acceso de rastreo es esa primera solicitud, y depende de que coincidan 3 cosas: robots.txt permite la ruta, el servidor devuelve HTML real y ninguna capa de protección intercepta la solicitud por el camino. La protección contra bots es la fuente de bloqueos accidentales que más crece. Una regla de firewall ajustada contra scrapers atrapa con frecuencia a Googlebot, Bingbot y a los rastreadores de IA. El sitio funciona perfectamente en un navegador mientras el rastreador recibe una página de desafío, un 403 o una pantalla intermedia en JavaScript. Como la respuesta es técnicamente correcta, la monitorización de disponibilidad sigue en verde. Los soft 404 provocan el problema inverso: el servidor devuelve un 200 junto con una página que dice que el contenido no existe, así que el buscador guarda un error como si fuera contenido y la página real deja de rastrearse. El propio robots.txt merece atención. Un Disallow general olvidado de un entorno de staging retira un dominio entero de la búsqueda. El archivo se consulta constantemente y se guarda en caché poco tiempo, de modo que un error se propaga en horas y una corrección, igual de rápido. Compruebe el acceso como lo haría un rastreador externo, sin cookies, sin caché caliente y sin sesión iniciada, porque esa es la solicitud que hacen realmente los buscadores.

El diagnóstico de pago de SEOReport revisa este tema en las páginas de su propio sitio, muestra la evidencia de cada hallazgo y ordena las correcciones por prioridad. Ver planes y precios.

Obtenga el diagnóstico completo de su sitio

Un informe basado en evidencia y un plan de acción priorizado, con un plan de créditos mensuales.