Nota técnica · Recuperação por IA

Porque é que a página certa continua difícil de recuperar por agentes de IA.

Continuei a encontrar a mesma falha: a resposta existia, mas a ferramenta de IA recuperava uma página antiga, vaga ou menos útil. Esta nota reúne as verificações que passei a usar—encaminhamento, estrutura das respostas, ligações internas, schema e llms.txt. Chamo ao modelo de trabalho AESO. Não é uma norma nem garante citações.

Começar pela resposta Todos os artigos

Resposta curta

O problema costuma ser a escolha da fonte, não a falta de um truque para pesquisa por IA.

Antes de acrescentar uma nova camada de otimização, verifico se o agente consegue chegar à página pretendida, perceber a pergunta, extrair uma passagem autónoma, identificar a fonte canónica e seguir o contexto. Isso devolve o trabalho a decisões web conhecidas: URLs limpos, sitemap atual, regras de crawling deliberadas, títulos diretos, ligações descritivas, dados estruturados corretos e um llms.txt curto quando ajuda. Uso AESO como abreviatura para essa verificação conjunta. O acrónimo importa menos do que tornar a fonte certa mais fácil de recuperar e mais difícil de interpretar mal.

01 · Quando prestar atenção

Procuro seis sinais de que a resposta existe, mas a página errada está a ganhar.

  1. 01

    Uma resposta de IA aponta para uma versão antiga apesar de existir documentação atual.

  2. 02

    A resposta útil está escondida por um título vago, uma introdução longa ou navegação dependente de JavaScript.

  3. 03

    Várias páginas usam nomes diferentes para o mesmo produto, funcionalidade ou API.

  4. 04

    Guias prioritários estão no sitemap, mas não têm um caminho útil a partir de uma página pilar.

  5. 05

    Os dados estruturados descrevem conteúdo incompleto, contraditório ou invisível.

  6. 06

    A equipa publicou llms.txt como um segundo sitemap sem escolher as fontes que realmente importam.

02 · Modelo de trabalho

O meu modelo de trabalho tem quatro partes: encaminhar, estruturar, ligar e testar.

Começo pelas páginas que devem responder a perguntas reais. Não adiciono schema a todos os templates nem copio o sitemap para llms.txt antes de decidir que fontes merecem ser encontradas e qual deve prevalecer quando várias se sobrepõem.

Base e encaminhamento

Verifique acesso público, HTML renderizado, alinhamento entre canonical e sitemap, redirecionamentos, versões e páginas órfãs. Classifique cada página como criar, atualizar, corrigir, defender ou ignorar.

Estrutura das respostas

Dê a cada secção importante um título que nomeie a pergunta. Coloque a resposta direta primeiro e depois condições, provas, exemplos e procedimento. A passagem deve fazer sentido fora do contexto.

Entidades, ligações e schema

Use nomes e identificadores estáveis para produtos, autores, APIs, versões e conceitos. Ligue pilares, páginas de apoio e páginas irmãs com âncoras descritivas. Use o tipo de schema correspondente ao conteúdo visível.

Contexto e testes

Use llms.txt como guia curado para as melhores fontes canónicas, não como inventário. Execute um banco de prompts e registe resposta, URL citado, versões erradas e fontes em falta antes de alterar.

03 · Comparação

robots.txt, sitemap.xml, dados estruturados e llms.txt têm funções diferentes.

SinalFunçãoO que não prova
robots.txtComunica que URLs os crawlers compatíveis podem aceder.Não é controlo de acesso e não garante que um URL fica fora dos resultados.
sitemap.xmlLista URLs canónicos e indexáveis que os crawlers devem conhecer.Não indica a melhor página para cada pergunta nem fornece contexto compacto.
Dados estruturadosAcrescentam informação explícita e legível por máquinas sobre a página visível.Não corrigem conteúdo fraco, escondido, contraditório ou desatualizado.
llms.txtPropõe um guia Markdown conciso para o site e fontes selecionadas.É uma proposta, não um protocolo universal nem garantia de ranking ou citação.

Sequência prática

Esta é a sequência que usaria num conjunto real de documentação.

  1. 01

    Escolher as fontes que devem prevalecer

    Liste perguntas prioritárias, páginas pretendidas, versões, responsáveis e provas. Verifique acesso, renderização, canonicals, sitemap, redirecionamentos e respostas duplicadas.

  2. 02

    Encaminhar e atualizar páginas prioritárias

    Classifique as páginas e reescreva as secções de maior valor com títulos diretos, respostas na primeira frase, nomes consistentes e blocos autónomos.

  3. 03

    Reparar o grafo

    Ligue pilares a páginas de apoio, páginas de apoio aos pilares e páginas irmãs úteis entre si. Acrescente breadcrumbs e schema correto. Remova âncoras genéricas e becos sem saída.

  4. 04

    Empacotar e testar o contexto

    Publique llms.txt se servir o site, ligue as melhores fontes canónicas e teste um conjunto fixo de prompts nos motores relevantes. Registe a linha de base antes de iterar.

O que mediria

O único teste útil é saber se a fonte pretendida foi recuperada.

Não considero mais um ficheiro ou um grafo de schema maior como resultado. Procuro menos fontes erradas, menos páginas prioritárias órfãs, versões mais claras e mais perguntas respondidas pela página escolhida. Guardo prompts, URLs recuperados e datas de publicação para investigar o que mudou.

Fontes primárias

Especificações e orientação primária.

Leitura relacionada

Perguntas

Perguntas que resolveria antes de chamar à documentação preparada para IA.

AESO é uma norma oficial?

Não. Uso AESO como nome de trabalho para uma auditoria que combina práticas web estabelecidas, a proposta llms.txt e testes de recuperação. O valor está nas verificações e medições, não no acrónimo.

llms.txt garante que um motor de IA cita a documentação?

Não. É uma proposta para fornecer contexto conciso e ligações selecionadas durante a inferência. O suporte varia. Publique-o quando o guia for útil e teste se as ferramentas relevantes o recuperam.

Dados estruturados bastam para tornar uma página citável?

Não. Podem descrever a página e as entidades, mas a resposta visível continua a precisar de ser correta, específica, atual e fácil de extrair. O markup deve corresponder ao conteúdo.

Todas as páginas precisam de uma cópia Markdown?

Não automaticamente. A proposta recomenda alternativas Markdown para páginas úteis porque são compactas. Comece pelas fontes canónicas selecionadas e garanta que as cópias ficam sincronizadas.

O que deve medir uma auditoria AESO?

Registe prompts, fonte pretendida, URL citado ou recuperado, versões erradas, respostas sem suporte, páginas órfãs, profundidade, schema, ligações quebradas e atualização dos ficheiros de contexto.