Gratuit · sans inscription · sans connexion
L’IA peut-elle vraiment lire votre site ?
La plupart des outils s’arrêtent au code HTTP. Nous envoyons des requêtes avec 16 user-agents de vrais robots, puis mesurons ce qui revient, car une page peut renvoyer un code 200 tout en ne laissant presque rien à lire aux robots.
Comptez environ 15 secondes. Rien n’est enregistré à votre nom et aucune inscription n’est requise.
Ce que nous récupérons : votre page d’accueil avec 16 user-agents de robots et un user-agent de navigateur, ainsi que robots.txt, llms.txt, sitemap.xml et trois pages choisies dans votre sitemap.
Questions fréquentes
- Un code 200 signifie-t-il que l’IA peut lire mon site ?
- Non. Une page de vérification anti-bot peut renvoyer un 200 alors qu’elle ne contient qu’un défi JavaScript. Une application monopage (SPA) peut renvoyer un 200 avec une coquille vide. Pour un outil qui s’arrête au code HTTP, rien ne les distingue d’une page normale : c’est pourquoi celui-ci mesure le contenu de la réponse.
- Bloquer GPTBot me pénalise-t-il ?
- Pas forcément. GPTBot collecte des données d’entraînement ; c’est OAI-SearchBot qui alimente les réponses avec citations. Bloquer le premier et autoriser le second est une position cohérente, et cet outil la traite comme telle au lieu de tout marquer en rouge.
- Pourquoi vérifier d’autres pages que ma page d’accueil ?
- Parce que la page d’accueil et les pages internes ne posent généralement pas les mêmes problèmes. La page d’accueil est construite autour de la mise en page et assemble souvent son texte dans le navigateur ; les pages internes sont construites autour du contenu, et leur texte figure déjà dans le HTML. N’en vérifier qu’une seule catégorie ne donne qu’une moitié de réponse.
- Ai-je besoin d’un fichier llms.txt ?
- Aucun moteur n’en exige aujourd’hui. Il est bien plus important que votre robots.txt soit correct, que votre contenu figure dans le HTML et que vos pages aient des titres et des données structurées.
- Conservez-vous les données de mon site ?
- Le rapport est conservé brièvement, pour que la page puisse être rechargée et que des vérifications répétées du même domaine ne sollicitent pas sans cesse votre serveur. Aucun compte, aucune adresse e-mail ni aucune information permettant de vous identifier n’y est associé.
Une fois que les robots peuvent vous lire
L’accès n’est que l’étape zéro. Reste à savoir quelles requêtes sont à votre portée, et ce qu’il faut modifier pour vous y positionner.
