Extractor de Encabezados y Enlaces
Extrae la estructura de encabezados y todos los enlaces de una página por URL.
🌐 sitekits fetches the URL server-side (private/internal addresses are blocked). The HTML is parsed as delivered — JavaScript is not executed, so client-rendered headings will not appear.
Resumen
La jerarquía de encabezados de una página es su índice, y la leen más cosas de lo que
suele pensarse: un motor de búsqueda que construye un resumen, un lector de pantalla
que ofrece una lista de encabezados navegable, y un motor de respuestas con IA que
decide de qué trata la página. Cuando la estructura es incorrecta, todos ellos se
degradan a la vez, y nada de eso se ve en pantalla — un h3 con estilo de título de
sección se lee exactamente igual que un h2.
Esta herramienta recupera una URL del lado del servidor, analiza el HTML tal como se
entrega y devuelve el árbol completo de encabezados, el número de h1, cada nivel
saltado y todos los enlaces separados en internos y externos con los nofollow
señalados.
Cómo se usa
- Pegue una URL. El esquema puede omitirse; se asume
https. - Lea la línea de resumen: número de
h1, número de encabezados y saltos de nivel. - Alterne entre Outline y Links para ver el detalle.
Qué significa «el HTML tal como se entrega»
No se ejecuta JavaScript. Es una restricción deliberada, no una limitación que haya que sortear: muestra la página tal como la ve todo aquello que no ejecuta scripts.
Si sus encabezados provienen de un framework del lado del cliente, la estructura aquí estará casi vacía — y ese es el hallazgo. Los motores de búsqueda sí renderizan JavaScript, pero según su propio calendario y sin garantías, y muchos otros consumidores de su HTML nunca renderizan: vistas previas de enlaces, lectores de feeds, navegadores en modo texto y la mayoría de los rastreadores de IA. Una estructura renderizada en el servidor es la única que ven todos los consumidores.
El contenido de <script> y <style> y los comentarios HTML se eliminan antes del
análisis, así que un encabezado dentro de un bloque comentado o de una cadena de
plantilla no aparece. Las etiquetas dentro del texto de los encabezados se quitan y
las entidades HTML se decodifican, así que <h2>Precios & planes</h2> se lee como
Precios & planes.
Cómo leer los saltos de nivel
Se informa un salto cada vez que un encabezado está más de un nivel por debajo del
anterior: h1 a h3, o h2 a h5. Volver hacia arriba nunca es un salto — un h3
seguido de un h2 simplemente cierra una subsección.
El motivo para prestar atención es que el nivel de encabezado es la única señal de
anidamiento en HTML. Quienes usan lector de pantalla recorren un documento por nivel,
y un nivel saltado les indica que existe una subsección que el contenido no tiene. La
causa habitual es visual: se eligió un h4 porque tenía el tamaño adecuado, y ese
tamaño se cambió después en CSS de todos modos.
La corrección consiste en elegir los niveles por estructura y fijar el tamaño en CSS. La estructura queda entonces correcta para todos los lectores, y la apariencia no cambia.
Cómo leer la lista de enlaces
Cada enlace se resuelve respecto a la URL final de la página, así que los href
relativos aparecen como las URL absolutas que sigue un rastreador. Los enlaces
relativos al protocolo (//host/ruta) heredan el esquema de la página. Los href mal
formados se descartan en lugar de informarse como enlaces.
rel="nofollow" se detecta sin distinguir mayúsculas y dentro de atributos rel con
varios valores, así que rel="NoFollow noopener" queda señalado. Tenga en cuenta que
nofollow es una indicación y no una directiva para el rastreo desde 2019: ya no
impide de forma fiable que un enlace se siga, lo que importa si contaba con él para
mantener una URL fuera de un índice. Eso solo lo consigue un noindex en la página
de destino.
El texto vacío se muestra de forma explícita. Un enlace sin texto — habitualmente un
ancla de solo icono sin aria-label — es inalcanzable para quienes usan lector de
pantalla y no aporta ninguna señal sobre su destino.
Ejemplos
- Auditar una plantilla, no una página — procese una página por plantilla. Los defectos de encabezados viven casi siempre en la plantilla, así que un puñado de URL cubre un sitio.
- Comprobar si su contenido se renderiza en el servidor — si la estructura está vacía pero la página está llena de encabezados, nada que se salte el JavaScript puede leerla.
- Antes de una migración — registre la estructura y el número de enlaces de las
páginas clave y compare después. Un
h1que desaparece o una sección degradada un nivel se publican con muchísima facilidad sin que nadie lo note. - Encontrar enlaces externos accidentales — un host de preproducción o de CDN perdido en la lista externa suele indicar una URL absoluta escrita a mano que sobrevivió a un despliegue.
- Preparar contenido para motores de respuestas con IA — una jerarquía de encabezados correcta es la señal estructural más económica disponible, y la que se rompe con más frecuencia. El validador de HTML cubre los errores de marcado, y la vista previa OG cómo se presenta la página al compartirla.
Qué no se cuenta
Solo se recogen elementos <a href>. <link>, <form action>, <iframe src> y la
navegación gobernada por JavaScript quedan excluidos, porque no son enlaces que un
rastreador siga desde el documento.
Notas
Se siguen hasta cinco redirecciones, y cada salto se revalida con las mismas reglas de direcciones, por lo que una URL pública no puede redirigir a una red privada. La estructura describe la respuesta final, y se muestra la cadena.
La lectura se detiene en 1 MB y el informe se limita a 300 encabezados y 500 enlaces. Cuando se alcanza cualquiera de los dos límites se le avisa, porque una estructura truncada en silencio parece una estructura completa.
Las peticiones a direcciones privadas, de bucle local, enlace local y reservadas se rechazan antes de abrir cualquier conexión. El cuerpo de la respuesta se analiza en memoria para producir este informe y nunca se almacena — véase la política de privacidad.