Un site web peut contenir des centaines de pages sans qu’aucune d’entre elles ne soit visible depuis le menu principal. Entre les URL orphelines, les contenus bloqués par erreur et les pages enfouies à plusieurs clics de profondeur, la cartographie réelle d’un site ne correspond presque jamais à ce que son arborescence laisse supposer.
Accéder à toutes les pages d’un site web suppose de comprendre comment les moteurs de recherche, les navigateurs et les fichiers de configuration interagissent pour rendre (ou masquer) un contenu.
Page inaccessible ou page simplement introuvable : une distinction technique
Quand une page ne s’affiche pas, deux situations très différentes coexistent. La première : la page existe sur le serveur, répond avec un code HTTP 200, mais aucun lien interne ne pointe vers elle. C’est une page orpheline, techniquement accessible si on connaît son URL, mais invisible pour les robots d’exploration et les visiteurs.
La seconde : la page est bloquée par une directive dans le fichier robots.txt, protégée par une authentification, ou renvoie un code 403 ou 404. Dans ce cas, même en connaissant l’adresse exacte, l’accès est restreint ou impossible.
La confusion entre ces deux cas est fréquente. Une URL absente des résultats de recherche Google n’est pas forcément supprimée. Elle peut simplement être exclue de l’index parce qu’un fichier robots.txt demande aux robots de ne pas l’explorer. Les données disponibles ne permettent pas toujours de trancher sans vérification manuelle : il faut tester l’URL directement dans un navigateur, puis consulter les journaux serveur pour confirmer le statut réel de la page.
Pour illustrer cette logique appliquée à un site concret, vous pouvez accéder à toutes les pages de Le Site de Julia via son plan de site, ce qui permet de vérifier quelles URL sont déclarées et lesquelles restent absentes de cette liste.

Robots.txt et RFC 9309 : ce que ces fichiers contrôlent vraiment
Le fichier robots.txt est souvent mal compris. Beaucoup le considèrent comme un mécanisme de sécurité. En réalité, robots.txt ne constitue pas un contrôle d’accès. Il se contente d’indiquer aux robots coopératifs les chemins qu’ils peuvent ou non explorer.
Un robot non coopératif, ou un utilisateur humain, peut ignorer ces directives et accéder librement au contenu. Une URL interdite dans robots.txt peut même apparaître dans les résultats de recherche si elle est découverte par des liens externes. Les contenus réellement sensibles doivent être protégés par une authentification côté serveur.
Depuis la publication de la RFC 9309 en septembre 2022, le Robots Exclusion Protocol dispose d’un cadre formel. Parmi les points à retenir :
- Les règles s’appliquent à un hôte, un protocole et un port précis, ce qui signifie qu’un robots.txt sur le port 443 ne couvre pas le port 80 du même domaine.
- En cas de conflit entre directives, la règle la plus spécifique l’emporte, avec priorité donnée à la directive Allow en cas d’égalité de spécificité.
- Une panne ou une indisponibilité temporaire du fichier robots.txt peut produire des effets opposés selon les robots : certains suspendront l’exploration, d’autres considéreront que tout est autorisé.
Ce dernier point est souvent négligé. Un serveur qui renvoie une erreur 500 à la place du fichier robots.txt ne bloque pas l’accès : il le rend imprévisible.
Sitemap XML : cartographier un site sans garantie d’exhaustivité
Le plan de site XML (sitemap) est l’outil le plus direct pour lister les pages d’un site web. On le trouve généralement à l’adresse /sitemap.xml, et il peut aussi être référencé dans le fichier robots.txt via la directive Sitemap.
Le sitemap facilite le travail des moteurs de recherche en déclarant explicitement les URL à indexer. En revanche, un sitemap n’est jamais une preuve d’exhaustivité. Plusieurs raisons à cela :
- Des pages peuvent exister sur le serveur sans figurer dans le sitemap, soit par oubli, soit parce qu’elles ont été créées après la dernière génération du fichier.
- La directive Sitemap ne fait pas partie du protocole central défini par la RFC 9309. Un robot peut donc l’ignorer sans violer le standard.
- Certains CMS génèrent des sitemaps incomplets qui excluent des types de contenus (pages de taxonomie, archives, documents PDF).
Pour vérifier la couverture réelle d’un site, la seule méthode fiable consiste à croiser les données du sitemap avec les journaux serveur et les réponses HTTP obtenues lors d’un crawl complet. Les outils d’exploration SEO (crawlers) parcourent la structure de liens internes et identifient les écarts entre les pages déclarées et les pages réellement accessibles.

Contrôles anti-robots et filtrage par type d’agent : l’accès fragmenté aux pages
La découverte de toutes les pages d’un site est de plus en plus affectée par les systèmes de protection anti-robots. Des services comme Cloudflare permettent désormais aux administrateurs de distinguer les robots de recherche, les agents automatisés et les robots d’entraînement IA.
Cette segmentation crée une situation nouvelle : un site peut rester parfaitement visible dans les résultats de Google tout en bloquant l’accès à d’autres types de crawlers. Pour un professionnel du référencement qui tente de cartographier un site concurrent, ou pour un propriétaire de site qui vérifie sa propre couverture, les résultats d’un crawl varient selon l’identifiant (user-agent) utilisé par l’outil d’exploration.
En pratique, cela signifie qu’un outil de crawl SEO classique peut se voir refuser l’accès à des pages que Googlebot explore sans difficulté. Les retours terrain divergent sur ce point : certains crawlers contournent ces restrictions en imitant un user-agent de navigateur standard, d’autres échouent silencieusement sans signaler le blocage.
Vérifier les journaux d’accès du serveur reste la méthode la plus fiable pour confirmer quels robots accèdent réellement à quelles pages. Sans cette vérification, toute liste de pages reste partielle.
Accéder à l’ensemble des pages d’un site web n’est pas un problème technique unique, mais une superposition de vérifications : statut HTTP, présence dans le sitemap, directives robots.txt, filtrage par user-agent. Chaque couche peut masquer ou révéler des URL différentes, et aucune méthode isolée ne donne une image complète.



