User-agent: * Allow: / # Sitemaps & Context Sitemap: https://bourbon-digital.com/sitemap.xml # llms.txt volontairement accessible (contexte pour les agents/LLMs) # Crawlers IA (GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot, Google-Extended, CCBot…) # volontairement AUTORISÉS — stratégie GEO, cf. dossiers France Num sur l'optimisation # pour les moteurs génératifs. Ils sont couverts par le groupe "User-agent: *" ci-dessus. # ⚠️ NE PAS leur créer de groupes nommés : un robot nommé n'applique QUE son propre groupe # et ignore "*" — il perdrait alors TOUS les Disallow de bas de fichier (/*.json$, /_*, # /admin, /.well-known/), qu'il faudrait répliquer dans chaque groupe et tenir à jour # à chaque ajout (source de divergence silencieuse). # Craw delay pour respecter les serveurs Crawl-delay: 1 # Autorisation des répertoires importants pour le SEO Allow: /blog/ Allow: /test-pilote-google-workspace Allow: /infrastructure Allow: /gemini-enterprise Allow: /ai-factory Allow: /diagnostic-data-ia Allow: /transparence-ia Allow: /signatures Allow: /ai-mail-dispatcher # WordPress legacy query params — ne PAS bloquer, laisser Google crawler pour découvrir les 301/404 # (bloquer = URLs coincées en "Blocked by robots.txt" dans GSC sans jamais se résoudre) # Blocage des fichiers système Disallow: /*.json$ Disallow: /_* Disallow: /admin Disallow: /.well-known/