Note technique · Récupération IA

Pourquoi la bonne page reste difficile à récupérer pour les agents IA.

J’ai retrouvé plusieurs fois le même échec : la réponse existait, mais l’outil IA récupérait une page ancienne, vague ou moins utile. Cette note rassemble les vérifications que j’utilise désormais—orientation, structure des réponses, liens internes, schema et llms.txt. J’appelle ce modèle de travail AESO. Ce n’est ni une norme ni une garantie de citation.

Commencer par la réponse Tous les articles

Réponse courte

Le problème vient souvent du choix de la source, pas d’une astuce manquante pour la recherche IA.

Avant d’ajouter une nouvelle couche d’optimisation, je vérifie si l’agent peut atteindre la page prévue, comprendre la question, extraire un passage autonome, identifier la source canonique et suivre le contexte. Le travail revient alors à des décisions web connues : URLs propres, sitemap à jour, règles de crawl délibérées, titres directs, liens descriptifs, données structurées exactes et fichier llms.txt court lorsqu’il est utile. J’utilise AESO comme raccourci pour ce contrôle commun. L’acronyme compte moins que le fait de rendre la bonne source plus facile à récupérer et plus difficile à mal interpréter.

01 · Quand y prêter attention

Je cherche six signes que la réponse existe, mais que la mauvaise page gagne.

  1. 01

    Une réponse IA renvoie vers une ancienne version alors que la documentation actuelle existe.

  2. 02

    La bonne réponse est enfouie sous un titre vague, une longue introduction ou une navigation dépendante de JavaScript.

  3. 03

    Plusieurs pages nomment différemment le même produit, la même fonction ou la même API.

  4. 04

    Des guides prioritaires figurent dans le sitemap sans chemin utile depuis une page pilier.

  5. 05

    Les données structurées décrivent un contenu incomplet, contradictoire ou invisible.

  6. 06

    L’équipe a publié llms.txt comme un second sitemap sans choisir les sources importantes.

02 · Méthode de travail

Mon modèle de travail tient en quatre parties : orienter, structurer, relier, tester.

Je pars des pages censées répondre à de vraies questions. Je n’ajoute pas de schema partout et ne copie pas le sitemap dans llms.txt avant d’avoir décidé quelles sources méritent d’être trouvées et laquelle doit prévaloir lorsqu’elles se chevauchent.

Base et orientation

Vérifiez accès public, rendu HTML, cohérence entre canonical et sitemap, redirections, versions et pages orphelines. Classez chaque page : créer, actualiser, corriger, défendre ou ignorer.

Structure des réponses

Donnez à chaque section importante un titre qui nomme la question. Placez la réponse directe avant les conditions, preuves, exemples et procédures. Le passage doit rester compréhensible seul.

Entités, liens et schema

Utilisez des noms et identifiants stables pour les produits, auteurs, API, versions et concepts. Reliez piliers, supports et pages sœurs avec des ancres descriptives. Choisissez le type de schema correspondant au contenu visible.

Contexte et tests

Utilisez llms.txt comme guide sélectionné vers les meilleures sources canoniques. Exécutez une banque de prompts et consignez réponse, URL citée, mauvaise version et source absente avant de modifier.

03 · Comparaison

robots.txt, sitemap.xml, données structurées et llms.txt ne font pas le même travail.

SignalSon rôleCe qu’il ne prouve pas
robots.txtIndique les URLs que les robots conformes peuvent explorer.Ce n’est pas un contrôle d’accès et il n’empêche pas forcément une URL d’apparaître dans les résultats.
sitemap.xmlListe les URLs canoniques et indexables à faire connaître aux robots.Il ne désigne pas la meilleure page pour chaque question et ne fournit pas un contexte compact.
Données structuréesAjoutent des informations explicites et lisibles par machine sur la page visible.Elles ne réparent pas un contenu faible, caché, contradictoire ou périmé.
llms.txtPropose un guide Markdown concis du site et de sources sélectionnées.C’est une proposition, pas un protocole universel ni une garantie de classement ou de citation.

Séquence pratique

Voici la séquence que j’utiliserais sur un vrai ensemble documentaire.

  1. 01

    Choisir les sources qui doivent gagner

    Listez questions prioritaires, pages prévues, versions, responsables et preuves. Vérifiez accès, rendu, canonicals, sitemap, redirections et réponses dupliquées.

  2. 02

    Orienter et réviser les pages prioritaires

    Classez les pages et réécrivez les sections à forte valeur avec titres directs, réponses dès la première phrase, noms cohérents et blocs autonomes.

  3. 03

    Réparer le graphe

    Reliez piliers et supports, supports et piliers, puis les pages sœurs utiles. Ajoutez breadcrumbs et schema exact. Retirez les ancres génériques et les impasses.

  4. 04

    Conditionner et tester le contexte

    Publiez llms.txt s’il sert le site, liez les meilleures sources canoniques et testez un ensemble fixe de prompts dans les moteurs pertinents. Consignez la référence avant d’itérer.

Ce que je mesurerais

Le seul test utile consiste à vérifier si la source prévue est récupérée.

Je ne considère ni un fichier supplémentaire ni un graphe schema plus grand comme un résultat. Je cherche moins de mauvaises sources, moins de pages prioritaires orphelines, une sélection de version plus claire et davantage de questions traitées par la page prévue. Je conserve prompts, URLs récupérées et dates de publication afin d’examiner ce qui a changé.

Sources primaires

Spécifications et recommandations primaires.

À lire aussi

Questions

Questions que je réglerais avant de qualifier la documentation de compatible IA.

AESO est-il une norme officielle ?

Non. J’utilise AESO comme nom de travail pour un audit qui combine des pratiques web établies, la proposition llms.txt et des tests de récupération. La valeur réside dans les contrôles et mesures, pas dans l’acronyme.

llms.txt garantit-il qu’un moteur IA citera la documentation ?

Non. C’est une proposition pour fournir un contexte concis et des liens sélectionnés lors de l’inférence. Le support varie. Publiez-le quand ce guide est utile et testez les outils qui comptent.

Les données structurées suffisent-elles à rendre une page citable ?

Non. Elles peuvent décrire la page et ses entités, mais la réponse visible doit rester exacte, spécifique, actuelle et facile à extraire. Le balisage doit correspondre au contenu.

Chaque page doit-elle avoir une copie Markdown ?

Pas automatiquement. La proposition recommande des alternatives Markdown pour les pages utiles parce qu’elles sont compactes. Commencez par les sources canoniques retenues et gardez les copies synchronisées.

Que faut-il mesurer dans un audit AESO ?

Consignez prompts, source prévue, URL citée ou récupérée, mauvaises versions, réponses sans preuve, pages orphelines, profondeur, schema, liens cassés et fraîcheur des fichiers de contexte.