Un client m'appelle un mardi matin, paniqué. Il a publié six articles la semaine précédente. Aucun n'apparaît dans Google. Il a tout vérifié : le site est en ligne, les textes sont corrects, aucun message d'erreur. Et pourtant, rien. Je lui demande d'ouvrir Search Console et de regarder le rapport sur l'indexation des pages. Verdict en quatre secondes : cinq des six articles étaient en "Explorée, actuellement non indexée". Google les avait bien vus. Il avait juste décidé de ne pas les garder.
C'est la confusion numéro un que je rencontre chez mes clients : croire que publier suffit. Le crawl et l'indexation par les moteurs de recherche sont deux étapes distinctes, et la seconde n'est jamais automatique. Tant que vous ne comprenez pas ce qui se passe entre les deux, vous pilotez à l'aveugle. Voici ce que j'ai appris à force de débugger des sites qui ne sortaient pas.
Points clés à retenir
- Le crawl consiste à découvrir et lire vos pages ; l'indexation consiste à les stocker et à les rendre disponibles dans les résultats. Ce sont deux opérations séparées.
- Une page explorée n'est pas une page indexée. Google peut lire votre contenu et choisir de l'ignorer.
- Le crawl budget n'est un vrai sujet que sur les gros sites. Sur un site de 50 pages, ce n'est presque jamais le problème.
- Le rapport "Indexation des pages" de Search Console est votre point de départ pour tout diagnostic, pas la fin de l'analyse.
- Les délais réels varient énormément : quelques heures pour un site à forte autorité, plusieurs semaines pour un site récent.
- La demande d'indexation manuelle est un outil ponctuel, pas une stratégie. Trop l'utiliser dilue son effet.
Crawl et indexation : pourquoi la différence change tout votre SEO
La métaphore la plus utile que j'aie trouvée, c'est celle de la bibliothèque. Le robot (Googlebot, principalement) est un lecteur qui se promène dans les rayons. Il ouvre les livres, note ce qu'il trouve, suit les renvois vers d'autres ouvrages. C'est le crawl. Ensuite, un bibliothécaire décide quels livres méritent une place définitive dans le catalogue central. C'est l'indexation.
Beaucoup de gens imaginent un seul processus. Il y en a deux, et l'échec se produit le plus souvent au second.
Ce que fait réellement Googlebot quand il explore
Googlebot commence par une poignée d'URLs connues : votre page d'accueil, votre sitemap, les liens entrants depuis d'autres sites. Puis il suit les liens internes, page après page. À chaque passage, il récupère le HTML, exécute le JavaScript s'il y en a, et télécharge les ressources nécessaires au rendu (CSS, polices, images).
Cette phase de rendu est celle qui pose le plus de problèmes. J'ai eu le cas d'un site vitrine dont tout le contenu était injecté par un framework JavaScript côté client. Googlebot voyait une page quasi vide, alors que l'utilisateur, lui, voyait un site complet. Résultat : indexation d'une coquille. Cette histoire m'a coûté deux semaines de diagnostic avant que je comprenne.
Ce que fait l'index une fois la page lue
Une fois le contenu récupéré, Google l'analyse, en extrait le texte, les entités, la structure, et décide quoi en faire. Trois issues possibles :
- La page est indexée et peut apparaître dans les résultats.
- La page est explorée mais non indexée : Google l'a vue, l'a jugée trop pauvre, trop proche d'une autre, ou sans intérêt suffisant.
- La page est exclue volontairement, par une directive que vous avez posée (sans le savoir, parfois).
Le troisième cas est le plus frustrant, parce qu'il vient presque toujours d'une erreur humaine. Une balise noindex oubliée sur un environnement de préproduction, et voilà trois mois de contenu invisible.
Le workflow de diagnostic que j'applique systématiquement
Ma méthode tient en quatre étapes, dans cet ordre. Je la répète à chaque nouveau site et elle ne m'a jamais laissé en rade.
Étape 1 : partir du rapport d'indexation des pages
Search Console propose un rapport dédié qui classe vos URLs par statut. Ne le lisez pas en diagonale. Repérez d'abord les motifs d'exclusion les plus volumineux. Si vous voyez 200 pages en "Explorée, actuellement non indexée", ce n'est pas un problème de crawl : c'est un problème de contenu ou de duplication.
Étape 2 : inspecter une URL représentative
Prenez une page du lot problématique et lancez l'inspection d'URL. Vous verrez la dernière date de crawl, le rendu tel que Googlebot l'a perçu, et les éventuelles erreurs bloquantes. C'est ici qu'on découvre les surprises : balise canonique pointant vers la mauvaise page, contenu principal absent du rendu, redirection mal configurée.
Étape 3 : corriger la cause, pas le symptôme
Demander une indexation sans avoir corrigé la cause, c'est arroser une plante morte. Si Google n'a pas indexé votre page, il y avait une raison. Trouvez-la d'abord.
Étape 4 : redemander l'exploration, avec parcimonie
Une fois la correction faite, vous pouvez demander une nouvelle exploration. Comptez quelques jours pour que le crawl repasse, et parfois une à trois semaines pour que la décision d'indexation suive. Ce délai m'a souvent surpris : on corrige un lundi, on vérifie le mercredi, rien n'a bougé. C'est normal.
Combien de temps entre publication et indexation ?
Franchement, la fourchette est énorme. Sur un site établi avec une bonne autorité, une page peut être crawlé en quelques heures et indexée dans les 48 heures. Sur un site récent, comptez plutôt une à quatre semaines. Et pour un tout nouveau domaine, plusieurs mois ne sont pas rares.
Ce qui influence ce délai :
- La fréquence à laquelle Googlebot revient sur votre site (elle dépend de votre historique de publication et de mise à jour).
- La qualité perçue de votre contenu par rapport au reste du web sur le même sujet.
- Le nombre de liens internes pointant vers la nouvelle page.
- Votre sitemap, s'il est propre et à jour.
Un point qu'on oublie : la mise à jour d'une page existante est souvent traitée plus vite qu'une nouvelle URL. Si vous avez un contenu proche, pensez à enrichir l'ancien plutôt que créer un doublon.
Le crawl budget : mythe ou vrai sujet ?
On en parle beaucoup, souvent à tort. Le crawl budget, c'est le nombre de requêtes qu'un moteur accepte d'envoyer à votre site sur une période donnée. Sur un site de 50 à 200 pages, cette limite n'est presque jamais atteinte. Vous n'avez pas de problème de budget.
Là où ça devient réel, c'est au-delà de plusieurs milliers d'URLs, ou quand votre site génère des pages à l'infini : filtres, paramètres d'URL, résultats de recherche internes, calendriers. J'ai vu un site e-commerce gaspiller une part importante de son crawl sur des milliers d'URLs de tri qui n'avaient aucune valeur. En les bloquant et en les retirant du sitemap, la fréquence de passage sur les pages produits a nettement augmenté.
Les ressources non-HTML consomment aussi du crawl
PDF, images, CSS, polices : tout ce que Googlebot télécharge compte. Un gros PDF que vous exposez partout peut mobiliser de la ressource pour rien si vous ne voulez pas qu'il soit indexé. Dans ce cas, une directive explicite est plus propre qu'un blocage aveugle.
Les erreurs que je vois le plus souvent
Après plusieurs années à auditer des sites, certains motifs reviennent avec une régularité déprimante.
- La balise noindex oubliée en production. Je l'ai fait moi-même, sur un site entier, après une migration. Trois semaines perdues.
- Le sitemap généré automatiquement qui liste des pages interdites à l'indexation. Contradiction directe, Google tranche en votre défaveur.
- Les paramètres d'URL qui créent des variantes infinies de la même page, sans canonique pour consolider.
- Le contenu principal absent du HTML initial, injecté plus tard par JavaScript, et mal rendu.
- Les redirections en chaîne, qui ralentissent le crawl et diluent la valeur.
Ces cinq erreurs, à elles seules, expliquent la grande majorité des problèmes d'indexation que je rencontre. Elles sont toutes évitables, et toutes détectables dans Search Console.
Quel outil utiliser pour quoi
Voici comment je répartis les outils selon ce que je cherche à faire.
| Objectif | Outil | Ce qu'il apporte |
|---|---|---|
| Voir l'état réel d'indexation | Search Console | Statut officiel de Google, motif d'exclusion, date de crawl |
| Comprendre le rendu perçu | Inspection d'URL | HTML tel que Googlebot l'a vu, ressources bloquées |
| Auditer tout un site | Crawler tiers (Screaming Frog, Sitebulb) | Détection de masse : balises, redirections, canoniques |
| Vérifier les règles de blocage | Testeur robots.txt | Confirmation des chemins autorisés ou interdits |
Un seul outil ne suffit jamais. Search Console dit ce que Google pense ; un crawler tiers montre la structure d'ensemble ; l'inspection tranche sur une page précise.
Déclarer son site à Google : ce qui compte vraiment
Beaucoup de débutants cherchent une case à cocher, un formulaire d'enregistrement. Il n'y en a pas. Vous ne "déclarez" pas votre site à Google comme on s'inscrit à un annuaire.
Ce qui compte, c'est de rendre la découverte facile :
- Créez un compte Google Search Console et validez la propriété de votre domaine.
- Soumettez un sitemap XML propre, sans pages bloquées.
- Assurez-vous que votre fichier robots.txt ne bloque rien d'utile.
- Ajoutez des liens internes depuis vos pages déjà indexées vers les nouvelles.
- Publiez régulièrement. La fréquence de passage d'un robot dépend en partie de la fréquence à laquelle votre site change.
Le reste suit naturellement. Le point le plus sous-estimé de cette liste, à mon avis, ce sont les liens internes. Une nouvelle page orpheline, sans aucun lien pointant vers elle, prend une éternité à être découverte. Un simple lien depuis votre page d'accueil ou depuis un article connexe peut tout accélérer.
Pourquoi une page explorée n'est pas forcément indexée
C'est la question qui revient le plus dans ma boîte mail, et la réponse tient en une phrase : Google n'a aucune obligation de stocker ce que vous publiez.
Une page sur trois environ, dans mon expérience, tombe dans la catégorie "explorée, actuellement non indexée". Les causes habituelles :
- Contenu trop mince ou trop proche d'une autre page existante.
- Pages de listing ou de catégorie qui n'apportent rien de propre.
- Pages récentes dont la qualité n'est pas encore évaluée favorablement.
- Contenu dupliqué à l'échelle du site, faute de canonique bien posée.
La bonne réaction n'est pas de forcer l'indexation à coups de demandes manuelles. C'est de se demander, honnêtement : cette page mérite-t-elle sa place dans un index qui en contient déjà des milliards ? Si la réponse est non, fusionnez ou enrichissez.
Un dernier point qui m'a marqué. J'ai longtemps cru que Google "raturait" certaines pages. C'est faux. Il ne supprime rien : il cesse simplement de les proposer. La nuance est importante, parce qu'une page non indexée peut revenir dans l'index dès qu'elle change de qualité perçue. Une refonte éditoriale d'un article vieux de deux ans a suffi, dans un de mes projets, à le faire réapparaître dans les résultats en trois semaines. Rien d'autre n'avait bougé.
Alors la prochaine fois qu'une page reste invisible, ne cherche pas l'astuce technique. Regarde le contenu. Le crawl et l'indexation par les moteurs de recherche sont des processus mécaniques, mais la décision qui les gouverne, elle, reste éditoriale.