Robots.txt y acceso de rastreo: Asegurarse de que los rastreadores puedan llegar a ti
Los rastreadores tienen que obtener una página antes de poder clasificarla. Cómo las reglas robots.txt, la protección contra bots y los soft 404 bloquean el acceso mientras el sitio parece saludable.
Antes de que un motor de búsqueda pueda evaluar una página, tiene que obtenerla. El acceso de rastreo es esa primera solicitud, y depende de que 3 cosas estén de acuerdo: robots.txt permite la ruta, el servidor devuelve el HTML real y ninguna capa de protección intercepta la solicitud en el camino. La protección contra bots es la fuente de bloqueo accidental que más crece. Una regla de firewall afinada contra scrapers captura regularmente a Googlebot, Bingbot y los rastreadores de IA junto con ellos. El sitio es perfectamente utilizable en un navegador mientras el rastreador recibe una página de desafío, un 403 o un intersticial JavaScript. Debido a que la respuesta es técnicamente exitosa, la monitorización de disponibilidad sigue verde. Los soft 404 causan el problema de imagen espejo: el servidor devuelve 200 junto con una página que dice que el contenido falta, por lo que los motores de búsqueda almacenan un estado de error como contenido y la página real deja de ser rastreada. Robots.txt en sí merece cuidado. Un Disallow único a nivel de sitio sobrante de un entorno de staging elimina todo un dominio de la búsqueda. El archivo se recupera constantemente y se almacena en caché brevemente, por lo que un error se propaga en horas y una corrección se propaga tan rápido. Estas comprobaciones recuperan tu sitio de la manera en que un rastreador externo lo haría, sin cookies, sin caché cálido y sin huella digital del navegador. Lo que ven es lo que ven los motores de búsqueda.
Robots.txt no encontrado
Por qué importa
Los motores de búsqueda necesitan poder acceder a las páginas que desea que aparezcan en los resultados.
Cómo lo revisamos
El archivo robots.txt se obtuvo y analizó.
Cómo arreglarlo
Cree un archivo robots.txt en la raíz de su dominio. Por qué importa: robots.txt es el primer archivo que solicitan los rastreadores; sin él, no tienen orientación sobre qué secciones evitar, y algunos rastreadores tratan la ausencia como una señal de un sitio sin mantenimiento.
Robots.txt bloquea todos los bots
Cómo lo revisamos
Las reglas de robots.txt se verificaron en busca de directivas de bloqueo generales 'Disallow: /'.
Cómo arreglarlo
Elimine la regla 'Disallow: /' de robots.txt que bloquea todos los user-agents.
Se detectó protección agresiva contra bots
Cómo lo revisamos
Se revisaron las respuestas de marca HTTP y el contenido renderizado por el navegador en busca de firmas de denegación de acceso y desafío explícitas.
Cómo arreglarlo
Configure el WAF o la capa de seguridad de hosting para que los rastreadores de búsqueda verificados y los agentes de auditoría aprobados explícitamente puedan recuperar el HTML público, robots.txt, archivos sitemap y llms.txt sin un CAPTCHA. Preserve los límites de tasa y controles de abuso, y verifique el resultado de una red de rastreadores independiente antes de cerrar el problema.
HTML de la página de inicio no accesible
Por qué importa
Si los motores de búsqueda no pueden acceder a sus páginas de forma confiable, incluso el contenido sólido puede no clasificar.
Cómo lo revisamos
Se inspeccionaron el Content-Type y el cuerpo de respuesta de la página de inicio.
Cómo arreglarlo
Verifique que su página de inicio devuelva contenido HTML válido, no un bucle de redirección, página de error o respuesta en blanco.
Soft 404 detectado en la página de inicio
Cómo lo revisamos
Se revisó el contenido de la página de inicio para detectar patrones de soft 404.
Cómo arreglarlo
Corrija la página de inicio para que devuelva contenido significativo en lugar de una página de no encontrado con estado 200. Esto importa porque un soft 404 desperdicia presupuesto de rastreo y confunde a los motores de búsqueda.
Desafío detectado en la página de inicio
Cómo lo revisamos
Se revisó la página de inicio para detectar patrones de desafío anti-bot o CAPTCHA.
Cómo arreglarlo
Eliminar los desafíos dirigidos a rastreadores o CAPTCHAs de la página de inicio, o configurar el WAF para permitir rastreadores de búsqueda verificados mientras se conservan los controles de abuso. Una respuesta a un desafío puede impedir que un rastreador recupere el contenido de la página, pero este informe no infiere resultados de búsqueda posteriores.
Ver cómo se clasifica tu sitio
Get a free IA-powered SEO report with actionable findings and priority fixes for your website.
Sin registro obligatorio.