Back to articles

La mayoría de los sitemaps que auditamos falla la validación; el nuestro era válido y aun así estaba mal

SEOReport Team·
xml-sitemapstechnical-seoseo-auditindexingcrawlingdata-analysis

49 sitios auditados: el 57 % de los sitemaps no pasa la validación XML, y los que la pasan esconden problemas peores. Incluye el día en que nuestro propio sitemap válido dejó de funcionar.

Entre el 5 de mayo y el 15 de agosto de 2026, validamos el XML sitemap de cada sitio que completó una auditoría — 49 dominios, la última instantánea cada uno. 28 de ellos, 57.1%, fallaron la validación de inmediato: malformado XML, falta de espacio de nombres del protocolo, entradas loc rotas, o valores lastmod que ningún rastreador está obligado a respetar. Eso convierte al sitemap en el archivo de descubrimiento más roto que medimos. Y la misma semana que compilamos estos números, encontramos el fallo de sitemap más instructivo en todo el conjunto de datos en nuestro propio dominio — dentro de un sitemap que pasó todas las comprobaciones de validación.

Más de la mitad de los sitemaps fallan antes de que un rastreador lea el primer URL

Nuestro motor ejecuta 4 comprobaciones de sitemap separadas, y fallan en un orden revelador. Validación — la comprobación más superficial — falla la mayoría. Las comprobaciones más profundas, que recuperan las URLs listadas y prueban si cada una merece estar en un sitemap, fallan con menos frecuencia pero cuestan más cuando lo hacen.

XML se valida contra el protocolo de sitemap492857.1%
URLs listadas libres de suaves 404s461021.7%
URLs listadas libres de directivas noindex21733.3%
Las URLs listadas responden sin redirigir19526.3%

Metodología: instantánea de auditoría completada más reciente por dominio de nuestro conjunto de comprobaciones actual, mayo 5 – August 15, 2026, anonimizada. Sitios auditados 49; los denominadores por comprobación varían entre 19 y 49 porque las comprobaciones más profundas solo se ejecutan donde el sitemap y sus URLs miembros muestreadas realmente pudieron ser recuperados. La muestra es auto-seleccionada — propietarios de sitios que realizaron una auditoría — y sesga a tamaños pequeños-medios. Trate las tasas como direccionales.

Share of Evaluated Sites Failing Each Sitemap Check, in Percent

La validación falla en detalles que la mayoría de los generadores nunca prueban

El protocolo del sitemap es pequeño, lo cual es exactamente por eso que fallarlo es evitable. Nuestro validador verifica lo que el protocolo realmente requiere: el documento se analiza como XML, el elemento raíz es urlset o sitemapindex y declara el namespace del sitemap, cada entrada lleva exactamente 1 loc no vacío que es un HTTP absoluto o HTTPS URL en el mismo sitio que el sitemap, y cualquier lastmod es una fecha W3C válida o una fecha y hora con zona horaria. Los fallos se agrupan en las últimas reglas 2. Las entradas loc cross-site suelen significar un hostname de staging o un origen CDN filtrado en producción. Y lastmod es el campeón silencioso de valores inválidos: los generadores aman escribir marcas de tiempo de base de datos como 2026-07-14 19:10:31 — espacio en lugar de T, sin zona horaria — lo cual no es una fecha y hora W3C. La documentación del sitemap de Google (https://developers.google.com/search/docs/crawling-indexing/sitemaps/build-sitemap) dice que usa lastmod cuando los valores son consistentemente y verificablemente precisos; un formato que no puede analizar pierde esa señal en cada entrada. Los archivos truncados también fallan: un sitemap que se corta a mitad de la transferencia no es un sitemap más pequeño, es uno roto. Cada fallo de esta clase es una corrección de capa de configuración, el mismo patrón que encontramos en los sitios web de comprobaciones 10 que fallan más: los errores viven por debajo de cualquier cosa que un navegador renderice, así que nadie los ve sin una máquina mirando.

Un sitemap válido aún puede enviar rastreadores a páginas muertas

Las comprobaciones más profundas 3 tratan el sitemap como un conjunto de afirmaciones y prueban cada una. Una entrada de sitemap afirma: este URL está vivo, indexable y vale el tiempo de un rastreador. Nuestro motor recupera URLs muestreadas listadas y busca contradicciones 3:

  • URLs no indexadas — 33.3% de los sitios evaluados. Una entrada de sitemap dice "indexa esto"; una directiva noindex robots en el mismo URL dice "no lo hagas." Los rastreadores resuelven la contradicción en la dirección que no desea, y la señal mixta degrada la confianza en el resto del archivo. 1 en 3 de los sitios donde podríamos obtener miembros del sitemap tenía al menos 1 de estas contradicciones en vivo.
  • Redirigiendo URLs — 26.3%. Entradas que 301 o 302 en otro lugar. El sitemap debe listar URLs finales; cada redirección en él es una reclamación obsoleta y un viaje extra por rastreo.
  • Soft 404s — 21.7%. Páginas que responden 200 pero no están realmente allí: respuestas delgadas cuyo título, encabezado o texto de apertura dice "no encontrado", páginas con casi ninguna palabra, o páginas que canonizan a la página de inicio. Cada una gasta presupuesto de rastreo y enseña a los rastreadores que tu sitemap exagera.

Estas tasas son más bajas que el número de validación, pero el orden cambia cuando ponderas las consecuencias. Un lastmod inválido te cuesta una pista de programación. Un sitemap lleno de contradicciones y soft 404s te cuesta la confianza del rastreador en todo el archivo.

Nuestro propio sitemap pasó la validación mientras ocultaba cada artículo

El 15 de agosto de 2026, descubrimos que el sitemap de seoreport.dev había estado omitiendo silenciosamente cada artículo URL que hemos publicado. La causa fue un endurecimiento de autorización que implementamos el agosto 1. Movió las rutas del plugin API a denegación por defecto — la postura de seguridad correcta — pero la lista blanca admitió solo 1 superficie interna. Los puntos finales de artículos públicos comenzaron a responder 401 a llamantes anónimos, incluido nuestro propio generador de sitemap y nuestra propia página de artículos. El generador capturó la falla, no registró nada y emitió un sitemap perfectamente válido que contenía solo las páginas estáticas. La página de artículos mostró una lista vacía. Cada artículo publicado registró 0 vistas en la ventana. Nada alarmó porque todo siguió pasando. El sitemap se analizó, declaró su espacio de nombres, listó URLs reales de estado 200 con valores lastmod bien formados. Según el estándar de validación que 57.1% de sitios auditados fallan, el nuestro fue ejemplar. También faltaba su razón completa de existir. La falla era invisible precisamente porque el archivo permanecía sintácticamente válido — un fallback que degrada silenciosamente en una salida plausible es peor que un fallo, porque un fallo se arregla el mismo día. Lo arreglamos en 1 día, en 4 movimientos. La frontera de autorización ahora admite explícitamente las lecturas de artículos publicados — lista, por-slug, contador de vistas — limitado por método, mientras que borradores y mutaciones permanecen en denegación por defecto. El generador de sitemap y los buscadores de artículos ahora registran una falla de superficie pública a nivel de error en lugar de degradar. Una dimensión de chequeo de salud explora continuamente la ruta de artículo anónimo, así que esta clase de páginas de corte un operador en lugar de esperar a que un humano note una página vacía. Y reenviamos el conjunto completo URL vía IndexNow el mismo día — lo que reveló una lección adicional: un archivo clave IndexNow alojado bajo /.well-known/ solo puede respaldar URLs bajo esa ruta, así que aloja la clave en la raíz del sitio o cada envío a nivel de sitio vuelve 422.

El contrato de higiene: un sitemap es un conjunto de promesas sobre cada URL en él

La validación es el piso. El estándar que vale la pena mantener es que cada entrada mantiene 4 promesas, más 1 promesa sobre el propio archivo: No 3xx, no 404, no página de desafío. Lista solo URLs finales. Verifica mecánicamente: 1. Viva: el URL responde 200, directamente.

bash
curl -s https://example.com/sitemap.xml \
| grep -o '<loc>[^<]*</loc>' | sed 's/<[^>]*>//g' \
| xargs -n1 -P4 curl -s -o /dev/null -w '%{http_code} %{url_effective}
' \
| grep -v '^200'

Cualquier salida es una violación. 2. Indexable: sin directivas contradictorias. No <meta name="robots" content="noindex">, no X-Robots-Tag: noindex encabezado, ninguna regla robots.txt bloqueando la ruta. Si un URL no debe ser indexado, la solución es eliminarlo del sitemap, nunca listarlo con un noindex adjunto. Una entrada cuyo rel=canonical apunta a otro lugar indica a los rastreadores que indexen un URL diferente al que enviaste. Lista el canónico, descarta la variante. 3. Canónico: la página se canónica a sí misma. Solo formato W3C — 2026-08-24 o 2026-08-24T08:00:00-05:00 — impulsado por cambios reales de contenido. Un pipeline de construcción que marca cada entrada con la hora de despliegue anuncia que tu lastmod no significa nada, y los rastreadores aprenden a tratarlo así. 4. Verdadero lastmod. Esta es la promesa que nuestro propio incidente rompió. XML la validez no dice nada sobre la composición, así que monitorea la composición directamente — afirma que cada clase URL esperada está presente, y alerta cuando una clase colapsa a 0: 5. Completo: el archivo contiene lo que debe, y alguien está revisándolo.

bash
count=$(curl -s https://example.com/sitemap.xml | grep -c '/articles/')
[ "$count" -ge 1 ] || echo "ALERT: sitemap lost its article URLs"

Y haz que el generador sea honesto: cuando una fuente de datos falla, registra en voz alta y falla la compilación. Un generador de sitemap nunca debe degradarse a un archivo válido más pequeño. Las primeras 4 promesas son lo que nuestro auditor verifica en cada ejecución — el informe gratuito muestra qué entradas rompen qué promesa, con las URLs exactas. La quinta requiere saber qué debe contener tu sitemap, lo cual solo tú sabes; la forma sistemática de incorporar eso en una rutina repetible se cubre en cómo ejecutar una auditoría SEO sistemática. Un sitemap que valida no es un sitemap que es verdadero. 57.1% de sitios no han alcanzado el suelo, y el suelo es una tarde de correcciones. El techo — un archivo donde cada entrada está viva, indexable, canónica, fechada honestamente y completo — es lo que hace que los rastreadores traten tu sitemap como una fuente de verdad. Ahora mantenemos ambos estándares bajo revisión continua, porque aprendimos la diferencia en nuestro propio dominio, de la manera difícil, con el validador diciendo que todo estaba bien.

Ver cómo se clasifica tu sitio

Get a free IA-powered SEO report with actionable findings and priority fixes for your website.

Sin registro obligatorio.