# robots.txt d’Ambriel, agence web. # # Tout est ouvert à l’exploration, à une exception près : /api/, qui ne # sert aucune page. Deux chemins ont été retirés de cette exclusion, pour # la même raison de fond : Disallow empêche le téléchargement, donc # empêche la lecture de toute directive posée dans la page. # # - /actualites-web/page/ porte déjà « noindex, follow », qui est le # comportement voulu : pages non indexées, liens suivis. Bloquée ici, # ce « follow » n’était jamais lu. # - /communaute/espace répond déjà « noindex, nofollow ». Une URL # bloquée mais découverte par un lien externe peut être indexée sans # son contenu, avec la mention « aucune information disponible ». La # vraie protection de l’espace client est son authentification. User-agent: * Allow: / Disallow: /api/ # ------------------------------------------------------------------ # Moteurs génératifs : robots de corpus et d’indexation. # Explicitement acceptés. Être présent dans le corpus est la condition # d’entrée, pas la citation elle-même. # ------------------------------------------------------------------ User-agent: GPTBot Allow: / Disallow: /api/ User-agent: ClaudeBot Allow: / Disallow: /api/ User-agent: PerplexityBot Allow: / Disallow: /api/ User-agent: Google-Extended Allow: / Disallow: /api/ User-agent: Applebot-Extended Allow: / Disallow: /api/ User-agent: Google-CloudVertexBot Allow: / Disallow: /api/ # ------------------------------------------------------------------ # Moteurs génératifs : robots de récupération à la demande. # Ceux-ci vont chercher la page au moment où une question est posée : # ce sont eux qui décident si le site est cité dans la réponse. # ------------------------------------------------------------------ User-agent: OAI-SearchBot Allow: / Disallow: /api/ User-agent: ChatGPT-User Allow: / Disallow: /api/ User-agent: Claude-User Allow: / Disallow: /api/ User-agent: Claude-SearchBot Allow: / Disallow: /api/ User-agent: Perplexity-User Allow: / Disallow: /api/ # ------------------------------------------------------------------ # Moteurs de recherche classiques nommés. # ------------------------------------------------------------------ User-agent: Bingbot Allow: / Disallow: /api/ # ------------------------------------------------------------------ # Position retenue sur les robots qui n’apportent aucune citation # ------------------------------------------------------------------ # # CCBot (Common Crawl), Bytespider (ByteDance), cohere-ai et # meta-externalagent (Meta) collectent du contenu pour l’entraînement de # modèles sans jamais renvoyer de lien vers la source. Aucun ne produit # de citation, donc aucun ne produit de visite. # # Décision : ils ne sont ni nommés, ni bloqués. # # Ne pas les bloquer, parce que les bloquer coûterait quelque chose de # réel sans rien rapporter de mesurable. Common Crawl alimente des # corpus publics à partir desquels se construit une part de ce que les # modèles savent d’une entreprise ; en sortir, pour une marque jeune et # homonyme d’une figure d’angélologie, revient à renoncer au peu de # notoriété que ces corpus peuvent porter. Le contenu de ce site est # déjà public, et une exclusion ne le retire d’aucun corpus existant. # # Ne pas les nommer non plus, parce qu’un groupe « Allow: / » à leur nom # n’ajoute aucune permission : le groupe générique les autorise déjà. Il # ferait seulement croire à une politique là où il n’y a qu’une absence # d’objection. # # À réexaminer si l’un d’eux se met à peser sur la bande passante, ou si # une licence de contenu est un jour définie pour ce site. # ------------------------------------------------------------------ # Résumés du site destinés aux moteurs génératifs # ------------------------------------------------------------------ # # Deux fichiers Markdown décrivent le site sans balisage ni JavaScript. # Ils sont générés depuis les mêmes fichiers de contenu que les pages, # et ne peuvent donc pas s’en désynchroniser. Ils sont également # annoncés par un sur # chaque page du site. # # llms.txt : https://ambriel.fr/llms.txt # llms-full.txt : https://ambriel.fr/llms-full.txt Sitemap: https://ambriel.fr/sitemap.xml # Directive propriétaire Yandex, ignorée par Google et par Bing. Elle # attend un nom d’hôte nu : ni schéma, ni barre finale. Host: ambriel.fr