Groupe User-agent
Un ou plusieurs robots ciblés, suivis des règles qui les concernent.
User-agent : robot visé,puis Allow et DisallowComposez un fichier robots.txt sûr, expliqué ligne par ligne, et vérifiez-en un existant.
Décrivez votre site, l’outil écrit les directives et vous montre ce que chaque ligne fait. robots.txt demande, il n’impose pas : il ne garantit pas l’indexation, ne supprime aucune page des moteurs et ne protège rien.
Ce profil applique
Aucun chemin personnalisé. Ajoutez-en un pour exclure un dossier précis, par exemple /exports/.
Adresse complète, avec https://.
Bloquer un moteur le fait disparaître de ses résultats. Bloquer un robot de réseau social casse l’aperçu de vos liens partagés.
Directive non standard, ignorée par Google. Préférez une redirection permanente et une balise canonique.
# Profil : Site vitrine
# Vérifiez ce fichier avant de le mettre en ligne.
User-agent: *
Disallow:
Le fichier doit être déposé à la racine du domaine, à l’adresse /robots.txt. Vérifiez-le en ligne après publication.
À quoi servent ces chiffres ?
Outils associés
Tous les outils gratuitsBon à savoir
Les résultats se recalculent à chaque frappe. Vous pouvez charger un exemple pour comprendre le fonctionnement, puis remplacer les valeurs par les vôtres.
Formules et hypothèses
Chaque indicateur affiché plus haut correspond exactement à l’une de ces formules. Tous les montants sont exprimés hors taxes.
Un ou plusieurs robots ciblés, suivis des règles qui les concernent.
User-agent : robot visé,puis Allow et DisallowDemande de ne pas explorer les adresses commençant par ce chemin.
Préfixe d’URL,barre oblique initiale obligatoireRouvre une adresse à l’intérieur d’un chemin par ailleurs exclu.
Motif plus spécifiqueque le Disallow qu’il corrigeAdresse absolue du plan du site, indépendante de tout groupe.
Adresse complète,http:// ou https:// obligatoireLecture des contrôles automatiques. Ne certifie jamais une configuration.
Cohérente, à vérifier,ou risque critiqueLe fichier robots.txt exprime une consigne d’exploration à destination des robots. Les crawlers sérieux la respectent, mais rien ne les y oblige techniquement : le fichier est public, lisible par n’importe qui, et un robot mal intentionné se contentera de l’ignorer. C’est une convention de bonne conduite entre un site et les moteurs, pas un mécanisme de contrôle d’accès.
La conséquence est directe : n’écrivez jamais dans un robots.txt le chemin d’une ressource qui doit rester confidentielle. Le déclarer revient à le signaler à quiconque ouvre le fichier. Ce qui doit être protégé se protège par une authentification côté serveur, jamais par une ligne Disallow.
C’est la confusion la plus coûteuse en référencement. Une ligne Disallow demande à un robot de ne pas explorer une adresse ; elle ne lui demande pas de l’oublier. Si d’autres pages pointent vers cette adresse, un moteur peut continuer à la connaître et à la faire apparaître dans ses résultats, généralement sans titre ni extrait puisqu’il n’a pas le droit d’aller lire la page.
Pour retirer réellement une page des résultats, il faut faire l’inverse de ce que l’intuition suggère : laisser le robot y accéder, et lui servir une balise meta robots en noindex, qu’il ne pourra lire que s’il a le droit d’explorer la page. Bloquer l’exploration empêche justement le moteur de découvrir cette instruction.
On trouve encore des robots.txt WordPress qui interdisent les dossiers wp-includes, wp-content/plugins ou wp-content/themes. Ces recommandations datent d’une époque où les moteurs lisaient seulement le code source des pages. Aujourd’hui, ils affichent la page comme le ferait un navigateur pour l’évaluer : bloquer les feuilles de style, les scripts et les polices leur donne à voir une page cassée, très différente de celle que voit un visiteur.
Le profil WordPress de cet outil applique donc une configuration volontairement courte : l’administration est exclue, mais son point d’entrée technique admin-ajax.php reste accessible, car il alimente des fonctions de la partie publique. Tout le reste est laissé ouvert, parce qu’un robots.txt bref et compris vaut mieux qu’un fichier long recopié d’un forum.
Cet outil ne bloque aucun robot d’intelligence artificielle par défaut. Deux usages très différents cohabitent derrière cette appellation : la collecte de pages destinée à l’entraînement de modèles, et la consultation en direct d’une page pendant une conversation d’utilisateur. Bloquer le second peut retirer votre site des sources citées, ce qui n’est pas toujours l’effet recherché.
Chaque robot listé indique donc son opérateur, ce qu’il fait et l’effet concret d’un blocage, afin que la décision vous appartienne. Rappelons que ce blocage repose lui aussi sur le respect volontaire du robot : il ne protège pas juridiquement un contenu, et le comportement d’un robot peut changer sans préavis.
Questions fréquentes
Non. Autoriser l’exploration d’une page n’oblige aucun moteur à l’indexer ni à la classer. Le fichier retire un obstacle, il ne crée aucune obligation : l’indexation dépend ensuite de la qualité de la page, des liens qui pointent vers elle et des choix propres à chaque moteur.
Pas avec robots.txt. Une adresse bloquée peut rester connue d’un moteur et apparaître sans titre ni extrait. Pour retirer réellement une page, laissez le robot y accéder et servez-lui une balise meta robots en noindex : il doit pouvoir lire la page pour découvrir cette instruction. Bloquer l’exploration l’en empêche.
En aucun cas. Le fichier est public et lisible par tout le monde : y écrire un chemin sensible revient à le signaler. Un robot peut l’ignorer, et une personne peut simplement ouvrir l’adresse. Protégez ce qui doit l’être par une authentification côté serveur.
Non, volontairement. Ces dossiers contiennent les feuilles de style, les scripts et les images nécessaires à l’affichage. Les moteurs rendent la page pour l’évaluer : leur en bloquer les ressources leur montre une page cassée. Seule l’administration est exclue, avec son point d’entrée admin-ajax.php laissé accessible.
C’est un choix qui vous appartient, et l’outil n’en coche aucun d’avance. Distinguez la collecte pour l’entraînement de modèles de la consultation en direct pendant une conversation : bloquer la seconde peut retirer votre site des sources citées. Dans tous les cas, ce blocage repose sur le respect volontaire du robot et ne constitue ni une protection juridique ni une mesure de sécurité.
Non. La génération, l’import d’un fichier existant, l’analyse et les diagnostics s’exécutent entièrement dans votre navigateur. Aucune adresse n’est visitée, aucun site n’est interrogé, et rien n’est conservé après la fermeture de l’onglet.
À la racine du domaine, à l’adresse /robots.txt exactement. Un fichier placé dans un sous-dossier n’est jamais lu. Après publication, ouvrez cette adresse dans un navigateur pour vérifier que le contenu servi correspond bien à ce que vous avez généré.
Outils associés
Les outils qui complètent le mieux celui-ci, tous gratuits et sans inscription.
Créez un sitemap valide à partir d’une liste d’adresses, avec priorités et fréquences.
Décomposez une adresse : domaine, chemin, paramètres, encodage et éléments de suivi.
Voyez le rendu de votre titre et de votre méta description dans les résultats de recherche.
Aller plus loin
Un robots.txt correct ne suffit pas : l’audit vérifie ce que les moteurs voient réellement de vos pages.