Extrator de Títulos e Links
Extraia a estrutura de títulos e todos os links de uma página pela URL.
🌐 sitekits fetches the URL server-side (private/internal addresses are blocked). The HTML is parsed as delivered — JavaScript is not executed, so client-rendered headings will not appear.
Visão geral
A hierarquia de títulos de uma página é o seu índice, e é lida por mais coisas do que
normalmente se imagina: um motor de busca a construir um resumo, um leitor de ecrã a
oferecer uma lista de títulos navegável, e um motor de respostas com IA a decidir do
que trata a página. Quando a estrutura está errada, todos eles degradam ao mesmo
tempo, e nada disso é visível no ecrã — um h3 estilizado para parecer um título de
secção lê-se exatamente como um h2.
Esta ferramenta recupera um URL do lado do servidor, analisa o HTML tal como é
entregue e devolve a árvore completa de títulos, o número de h1, cada nível saltado
e todas as ligações separadas em internas e externas com os nofollow assinalados.
Como usar
- Cole um URL. O esquema pode ser omitido; assume-se
https. - Leia a linha de síntese: número de
h1, número de títulos e saltos de nível. - Alterne entre Outline e Links para ver o detalhe.
O que significa «o HTML tal como é entregue»
Nenhum JavaScript é executado. É uma restrição deliberada, não uma limitação a contornar: mostra a página tal como a vê tudo aquilo que não executa scripts.
Se os seus títulos vêm de uma framework do lado do cliente, a estrutura aqui estará quase vazia — e esse é o achado. Os motores de busca renderizam JavaScript, mas ao seu próprio ritmo e sem garantia, e muitos outros consumidores do seu HTML nunca renderizam: pré-visualizações de ligações, leitores de feeds, navegadores em modo de texto e a maioria dos rastreadores de IA. Uma estrutura renderizada no servidor é a única que todos os consumidores vêem.
O conteúdo de <script> e <style> e os comentários HTML são removidos antes da
análise, pelo que um título dentro de um bloco comentado ou de uma cadeia de modelo
não aparece. As etiquetas dentro do texto dos títulos são retiradas e as entidades
HTML descodificadas, pelo que <h2>Preços & planos</h2> lê-se Preços & planos.
Como ler os saltos de nível
Um salto é relatado sempre que um título está mais de um nível abaixo do anterior:
h1 para h3, ou h2 para h5. Subir nunca é um salto — um h3 seguido de um h2
simplesmente fecha uma subsecção.
A razão para dar atenção é que o nível de título é o único sinal de aninhamento em
HTML. Quem usa leitor de ecrã percorre um documento por nível, e um nível saltado
anuncia-lhe uma subsecção que o conteúdo não possui. A causa habitual é visual:
escolheu-se um h4 porque o tamanho servia, e esse tamanho foi de qualquer forma
alterado em CSS mais tarde.
A correção consiste em escolher os níveis pela estrutura e definir o tamanho em CSS. A estrutura fica então correta para todos os leitores, e a aparência não muda.
Como ler a lista de ligações
Cada ligação é resolvida em relação ao URL final da página, pelo que os href relativos
aparecem como os URL absolutos que um rastreador segue. As ligações relativas ao
protocolo (//anfitrião/caminho) herdam o esquema da página. Os href malformados são
descartados em vez de relatados como ligações.
rel="nofollow" é detetado sem distinguir maiúsculas e dentro de atributos rel com
vários valores, pelo que rel="NoFollow noopener" fica assinalado. Note que
nofollow é uma indicação e não uma diretiva para o rastreio desde 2019: já não
impede de forma fiável que uma ligação seja seguida, o que importa se contava com ele
para manter um URL fora de um índice. Só um noindex na página de destino faz isso.
O texto vazio é assinalado explicitamente. Uma ligação sem texto — habitualmente uma
âncora apenas com ícone e sem aria-label — é inalcançável para quem usa leitor de
ecrã e não transporta qualquer sinal sobre o seu destino.
Exemplos
- Auditar um modelo, não uma página — processe uma página por modelo. Os defeitos de títulos vivem quase sempre no modelo, pelo que um punhado de URL cobre um site.
- Verificar se o seu conteúdo é renderizado no servidor — se a estrutura está vazia mas a página está cheia de títulos, nada que ignore o JavaScript a consegue ler.
- Antes de uma migração — registe a estrutura e o número de ligações das páginas
principais e compare depois. Um
h1que desaparece ou uma secção rebaixada um nível são publicados com muita facilidade sem que ninguém repare. - Encontrar ligações externas acidentais — um anfitrião de pré-produção ou de CDN perdido na lista externa indica normalmente um URL absoluto escrito à mão que sobreviveu a uma implantação.
- Preparar conteúdo para motores de respostas com IA — uma hierarquia de títulos correta é o sinal estrutural mais barato disponível, e o que é mais vezes quebrado. O validador de HTML cobre os erros de marcação, e a pré-visualização OG a forma como a página se apresenta ao ser partilhada.
O que não é contado
Só são recolhidos elementos <a href>. <link>, <form action>, <iframe src> e a
navegação conduzida por JavaScript ficam excluídos, porque não são ligações que um
rastreador siga a partir do documento.
Observações
São seguidas até cinco redireções, e cada salto é revalidado com as mesmas regras de endereços, pelo que um URL público não pode redirecionar para uma rede privada. A estrutura descreve a resposta final, e a cadeia é mostrada.
A leitura pára em 1 MB e o relatório é limitado a 300 títulos e 500 ligações. Quando qualquer um dos limites é alcançado é avisado, porque uma estrutura truncada em silêncio parece uma estrutura completa.
Os pedidos para endereços privados, de loopback, link-local e reservados são recusados antes de qualquer ligação. O corpo da resposta é analisado em memória para produzir este relatório e nunca é guardado — ver a política de privacidade.