pressione ⌘K para trocar de ferramenta
NETWORK · HTTP

Extrator de Títulos e Links

Extraia a estrutura de títulos e todos os links de uma página pela URL.

server
page-outline

🌐 sitekits fetches the URL server-side (private/internal addresses are blocked). The HTML is parsed as delivered — JavaScript is not executed, so client-rendered headings will not appear.

§01 SOBRE ESTA FERRAMENTA

Visão geral

A hierarquia de títulos de uma página é o seu índice, e é lida por mais coisas do que normalmente se imagina: um motor de busca a construir um resumo, um leitor de ecrã a oferecer uma lista de títulos navegável, e um motor de respostas com IA a decidir do que trata a página. Quando a estrutura está errada, todos eles degradam ao mesmo tempo, e nada disso é visível no ecrã — um h3 estilizado para parecer um título de secção lê-se exatamente como um h2.

Esta ferramenta recupera um URL do lado do servidor, analisa o HTML tal como é entregue e devolve a árvore completa de títulos, o número de h1, cada nível saltado e todas as ligações separadas em internas e externas com os nofollow assinalados.

Como usar

  1. Cole um URL. O esquema pode ser omitido; assume-se https.
  2. Leia a linha de síntese: número de h1, número de títulos e saltos de nível.
  3. Alterne entre Outline e Links para ver o detalhe.

O que significa «o HTML tal como é entregue»

Nenhum JavaScript é executado. É uma restrição deliberada, não uma limitação a contornar: mostra a página tal como a vê tudo aquilo que não executa scripts.

Se os seus títulos vêm de uma framework do lado do cliente, a estrutura aqui estará quase vazia — e esse é o achado. Os motores de busca renderizam JavaScript, mas ao seu próprio ritmo e sem garantia, e muitos outros consumidores do seu HTML nunca renderizam: pré-visualizações de ligações, leitores de feeds, navegadores em modo de texto e a maioria dos rastreadores de IA. Uma estrutura renderizada no servidor é a única que todos os consumidores vêem.

O conteúdo de <script> e <style> e os comentários HTML são removidos antes da análise, pelo que um título dentro de um bloco comentado ou de uma cadeia de modelo não aparece. As etiquetas dentro do texto dos títulos são retiradas e as entidades HTML descodificadas, pelo que <h2>Preços &amp; planos</h2> lê-se Preços & planos.

Como ler os saltos de nível

Um salto é relatado sempre que um título está mais de um nível abaixo do anterior: h1 para h3, ou h2 para h5. Subir nunca é um salto — um h3 seguido de um h2 simplesmente fecha uma subsecção.

A razão para dar atenção é que o nível de título é o único sinal de aninhamento em HTML. Quem usa leitor de ecrã percorre um documento por nível, e um nível saltado anuncia-lhe uma subsecção que o conteúdo não possui. A causa habitual é visual: escolheu-se um h4 porque o tamanho servia, e esse tamanho foi de qualquer forma alterado em CSS mais tarde.

A correção consiste em escolher os níveis pela estrutura e definir o tamanho em CSS. A estrutura fica então correta para todos os leitores, e a aparência não muda.

Como ler a lista de ligações

Cada ligação é resolvida em relação ao URL final da página, pelo que os href relativos aparecem como os URL absolutos que um rastreador segue. As ligações relativas ao protocolo (//anfitrião/caminho) herdam o esquema da página. Os href malformados são descartados em vez de relatados como ligações.

rel="nofollow" é detetado sem distinguir maiúsculas e dentro de atributos rel com vários valores, pelo que rel="NoFollow noopener" fica assinalado. Note que nofollow é uma indicação e não uma diretiva para o rastreio desde 2019: já não impede de forma fiável que uma ligação seja seguida, o que importa se contava com ele para manter um URL fora de um índice. Só um noindex na página de destino faz isso.

O texto vazio é assinalado explicitamente. Uma ligação sem texto — habitualmente uma âncora apenas com ícone e sem aria-label — é inalcançável para quem usa leitor de ecrã e não transporta qualquer sinal sobre o seu destino.

Exemplos

  • Auditar um modelo, não uma página — processe uma página por modelo. Os defeitos de títulos vivem quase sempre no modelo, pelo que um punhado de URL cobre um site.
  • Verificar se o seu conteúdo é renderizado no servidor — se a estrutura está vazia mas a página está cheia de títulos, nada que ignore o JavaScript a consegue ler.
  • Antes de uma migração — registe a estrutura e o número de ligações das páginas principais e compare depois. Um h1 que desaparece ou uma secção rebaixada um nível são publicados com muita facilidade sem que ninguém repare.
  • Encontrar ligações externas acidentais — um anfitrião de pré-produção ou de CDN perdido na lista externa indica normalmente um URL absoluto escrito à mão que sobreviveu a uma implantação.
  • Preparar conteúdo para motores de respostas com IA — uma hierarquia de títulos correta é o sinal estrutural mais barato disponível, e o que é mais vezes quebrado. O validador de HTML cobre os erros de marcação, e a pré-visualização OG a forma como a página se apresenta ao ser partilhada.

O que não é contado

Só são recolhidos elementos <a href>. <link>, <form action>, <iframe src> e a navegação conduzida por JavaScript ficam excluídos, porque não são ligações que um rastreador siga a partir do documento.

Observações

São seguidas até cinco redireções, e cada salto é revalidado com as mesmas regras de endereços, pelo que um URL público não pode redirecionar para uma rede privada. A estrutura descreve a resposta final, e a cadeia é mostrada.

A leitura pára em 1 MB e o relatório é limitado a 300 títulos e 500 ligações. Quando qualquer um dos limites é alcançado é avisado, porque uma estrutura truncada em silêncio parece uma estrutura completa.

Os pedidos para endereços privados, de loopback, link-local e reservados são recusados antes de qualquer ligação. O corpo da resposta é analisado em memória para produzir este relatório e nunca é guardado — ver a política de privacidade.

FAQ
Porque é que faltam títulos que vejo no meu navegador?
O HTML é analisado tal como o servidor o entregou, sem executar JavaScript. Títulos desenhados por uma framework do lado do cliente após o carregamento não aparecem. Essa diferença é em si informação útil: um rastreador que não executa o seu JavaScript vê exatamente a mesma estrutura vazia que esta ferramenta.
Ter mais do que um h1 prejudica o SEO?
Não diretamente, e o seccionamento HTML5 permite-o. O que custa é clareza: com vários h1 a página não enuncia um tema único no seu nível mais alto, pelo que tudo o que a resuma — um motor de busca, a lista de títulos de um leitor de ecrã, um motor de respostas com IA — tem de adivinhar qual é o tema. O número é relatado para que decida, não é pontuado.
O que é um salto de nível e porque é que importa?
Um título que salta um nível, por exemplo um h3 imediatamente após um h1. Quem usa leitor de ecrã navega por nível de título, pelo que um nível saltado faz a estrutura anunciar uma profundidade de aninhamento que o conteúdo não tem. É um defeito estrutural invisível no ecrã, e por isso vale a pena relatá-lo.
As ligações de fragmento e mailto: são contadas?
Não. Um href vazio, os fragmentos internos (#top), javascript: e mailto: são excluídos, porque nenhum é uma ligação para uma página. Todo o resto é resolvido em relação ao URL da página, pelo que as ligações relativas aparecem como os URL absolutos que um rastreador seguiria.
Como é decidido se uma ligação é interna ou externa?
Comparando o anfitrião da ligação resolvida com o anfitrião do URL final após redireções. Um subdomínio diferente conta como externo, porque os motores de busca e os navegadores tratam-no em grande medida assim.
Há um limite para a quantidade lida?
A resposta é lida até 1 MB e são relatados até 300 títulos e 500 ligações. Se a página excedeu 1 MB é avisado explicitamente, em vez de lhe ser mostrada uma estrutura truncada que parece completa.