Aller au contenu

Générateur de robots.txt

Composez un fichier robots.txt sûr, expliqué ligne par ligne, et vérifiez-en un existant.

Gratuit, sans inscriptionTraitement dans votre navigateurExport disponible

Décrivez votre site, l’outil écrit les directives et vous montre ce que chaque ligne fait. robots.txt demande, il n’impose pas : il ne garantit pas l’indexation, ne supprime aucune page des moteurs et ne protège rien.

robots.txt

Profil du site

Ce profil applique

  • Exploration ouverte à tous les robots
  • Déclaration du sitemap

Exploration

Chemins à exclure

Chemins personnalisés

Aucun chemin personnalisé. Ajoutez-en un pour exclure un dossier précis, par exemple /exports/.

Sitemaps

Adresse complète, avec https://.

Robots à bloquer

Bloquer un moteur le fait disparaître de ses résultats. Bloquer un robot de réseau social casse l’aperçu de vos liens partagés.

Robots d’IA
Rien n’est coché par défaut, et c’est volontaire. robots.txt repose sur le respect volontaire des robots : il ne protège pas juridiquement un contenu, ne constitue pas une mesure de sécurité, et le comportement de chaque robot peut évoluer.
Hôte de référence

Directive non standard, ignorée par Google. Préférez une redirection permanente et une balise canonique.

Configuration cohérente
robots.txt
# Profil : Site vitrine
# Vérifiez ce fichier avant de le mettre en ligne.

User-agent: *
Disallow: 

Le fichier doit être déposé à la racine du domaine, à l’adresse /robots.txt. Vérifiez-le en ligne après publication.

À quoi servent ces chiffres ?

  • Groupe User-agentUn ou plusieurs robots ciblés, suivis des règles qui les concernent.
  • DisallowDemande de ne pas explorer les adresses commençant par ce chemin.
  • AllowRouvre une adresse à l’intérieur d’un chemin par ailleurs exclu.
  • SitemapAdresse absolue du plan du site, indépendante de tout groupe.
  • Niveau de risqueLecture des contrôles automatiques. Ne certifie jamais une configuration.
Voir les formules

Bon à savoir

Les résultats se recalculent à chaque frappe. Vous pouvez charger un exemple pour comprendre le fonctionnement, puis remplacer les valeurs par les vôtres.

Formules et hypothèses

Rien n’est caché : voici les calculs.

Chaque indicateur affiché plus haut correspond exactement à l’une de ces formules. Tous les montants sont exprimés hors taxes.

Groupe User-agent

Un ou plusieurs robots ciblés, suivis des règles qui les concernent.

User-agent : robot visé,puis Allow et Disallow

Disallow

Demande de ne pas explorer les adresses commençant par ce chemin.

Préfixe d’URL,barre oblique initiale obligatoire

Allow

Rouvre une adresse à l’intérieur d’un chemin par ailleurs exclu.

Motif plus spécifiqueque le Disallow qu’il corrige

Sitemap

Adresse absolue du plan du site, indépendante de tout groupe.

Adresse complète,http:// ou https:// obligatoire

Niveau de risque

Lecture des contrôles automatiques. Ne certifie jamais une configuration.

Cohérente, à vérifier,ou risque critique

robots.txt est une demande, pas une barrière

Le fichier robots.txt exprime une consigne d’exploration à destination des robots. Les crawlers sérieux la respectent, mais rien ne les y oblige techniquement : le fichier est public, lisible par n’importe qui, et un robot mal intentionné se contentera de l’ignorer. C’est une convention de bonne conduite entre un site et les moteurs, pas un mécanisme de contrôle d’accès.

La conséquence est directe : n’écrivez jamais dans un robots.txt le chemin d’une ressource qui doit rester confidentielle. Le déclarer revient à le signaler à quiconque ouvre le fichier. Ce qui doit être protégé se protège par une authentification côté serveur, jamais par une ligne Disallow.

Bloquer une page n’est pas la désindexer

C’est la confusion la plus coûteuse en référencement. Une ligne Disallow demande à un robot de ne pas explorer une adresse ; elle ne lui demande pas de l’oublier. Si d’autres pages pointent vers cette adresse, un moteur peut continuer à la connaître et à la faire apparaître dans ses résultats, généralement sans titre ni extrait puisqu’il n’a pas le droit d’aller lire la page.

Pour retirer réellement une page des résultats, il faut faire l’inverse de ce que l’intuition suggère : laisser le robot y accéder, et lui servir une balise meta robots en noindex, qu’il ne pourra lire que s’il a le droit d’explorer la page. Bloquer l’exploration empêche justement le moteur de découvrir cette instruction.

Pourquoi les vieilles recettes WordPress font plus de mal que de bien

On trouve encore des robots.txt WordPress qui interdisent les dossiers wp-includes, wp-content/plugins ou wp-content/themes. Ces recommandations datent d’une époque où les moteurs lisaient seulement le code source des pages. Aujourd’hui, ils affichent la page comme le ferait un navigateur pour l’évaluer : bloquer les feuilles de style, les scripts et les polices leur donne à voir une page cassée, très différente de celle que voit un visiteur.

Le profil WordPress de cet outil applique donc une configuration volontairement courte : l’administration est exclue, mais son point d’entrée technique admin-ajax.php reste accessible, car il alimente des fonctions de la partie publique. Tout le reste est laissé ouvert, parce qu’un robots.txt bref et compris vaut mieux qu’un fichier long recopié d’un forum.

Les robots d’IA méritent un choix, pas une case cochée d’avance

Cet outil ne bloque aucun robot d’intelligence artificielle par défaut. Deux usages très différents cohabitent derrière cette appellation : la collecte de pages destinée à l’entraînement de modèles, et la consultation en direct d’une page pendant une conversation d’utilisateur. Bloquer le second peut retirer votre site des sources citées, ce qui n’est pas toujours l’effet recherché.

Chaque robot listé indique donc son opérateur, ce qu’il fait et l’effet concret d’un blocage, afin que la décision vous appartienne. Rappelons que ce blocage repose lui aussi sur le respect volontaire du robot : il ne protège pas juridiquement un contenu, et le comportement d’un robot peut changer sans préavis.

Questions fréquentes

Ce que l’on nous demande le plus souvent.

Non. Autoriser l’exploration d’une page n’oblige aucun moteur à l’indexer ni à la classer. Le fichier retire un obstacle, il ne crée aucune obligation : l’indexation dépend ensuite de la qualité de la page, des liens qui pointent vers elle et des choix propres à chaque moteur.

Pas avec robots.txt. Une adresse bloquée peut rester connue d’un moteur et apparaître sans titre ni extrait. Pour retirer réellement une page, laissez le robot y accéder et servez-lui une balise meta robots en noindex : il doit pouvoir lire la page pour découvrir cette instruction. Bloquer l’exploration l’en empêche.

En aucun cas. Le fichier est public et lisible par tout le monde : y écrire un chemin sensible revient à le signaler. Un robot peut l’ignorer, et une personne peut simplement ouvrir l’adresse. Protégez ce qui doit l’être par une authentification côté serveur.

Non, volontairement. Ces dossiers contiennent les feuilles de style, les scripts et les images nécessaires à l’affichage. Les moteurs rendent la page pour l’évaluer : leur en bloquer les ressources leur montre une page cassée. Seule l’administration est exclue, avec son point d’entrée admin-ajax.php laissé accessible.

C’est un choix qui vous appartient, et l’outil n’en coche aucun d’avance. Distinguez la collecte pour l’entraînement de modèles de la consultation en direct pendant une conversation : bloquer la seconde peut retirer votre site des sources citées. Dans tous les cas, ce blocage repose sur le respect volontaire du robot et ne constitue ni une protection juridique ni une mesure de sécurité.

Non. La génération, l’import d’un fichier existant, l’analyse et les diagnostics s’exécutent entièrement dans votre navigateur. Aucune adresse n’est visitée, aucun site n’est interrogé, et rien n’est conservé après la fermeture de l’onglet.

À la racine du domaine, à l’adresse /robots.txt exactement. Un fichier placé dans un sous-dossier n’est jamais lu. Après publication, ouvrez cette adresse dans un navigateur pour vérifier que le contenu servi correspond bien à ce que vous avez généré.

Aller plus loin

Vos calculs sont justes. Reste à savoir à qui vous vendez.

Un robots.txt correct ne suffit pas : l’audit vérifie ce que les moteurs voient réellement de vos pages.

Entreprises et contactsPipeline d’opportunitésAudits SEO reliés