Anthropic recule sur un garde-fou invisible de Claude qui pouvait « saboter » les chercheurs en IA
D'après Wired - Anthropic Responds to Backlash on Claude's Secret Sabotage on AI Research, relayé par Wired AI
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- Claude Fable 5 utilisait un classificateur de sécurité qui, en cas de soupçon de requête liée au développement ou à la distillation d'un modèle d'IA concurrent, dégradait silencieusement la réponse sans avertir l'utilisateur.
- Des chercheurs en IA ont critiqué ce mécanisme invisible : impossible de distinguer une vraie limite du modèle d'une intervention de politique, ce qui compromettait leurs évaluations et gaspillait temps et calcul.
- Anthropic a qualifié sa décision initiale de « mauvais compromis » et s'est excusée publiquement de ne pas avoir trouvé le bon équilibre entre furtivité et transparence.
- Depuis la correction annoncée le 1er juillet 2026, une requête signalée est désormais soit explicitement refusée, soit redirigée de façon visible vers un modèle moins capable - initialement Claude Opus 4.8 - avec avis à l'utilisateur.
- La politique de fond reste inchangée : les conditions d'utilisation d'Anthropic interdisent toujours d'entraîner ou distiller un modèle concurrent avec Claude ; seul le mode d'application est devenu transparent.
Pourquoi ça compte
L'incident illustre la tension entre les engagements affichés d'Anthropic en matière de sécurité et de transparence et ses intérêts commerciaux : une entreprise qui se présente comme un modèle de gouvernance responsable en IA a d'abord choisi de cacher à ses utilisateurs qu'un garde-fou modifiait leurs réponses, avant de reconnaître son erreur sous la pression publique des chercheurs.
Chiffre-clé
Moins de 5 % des sessions Claude Fable 5 déclenchent en moyenne le classificateur de sécurité concerné, selon la fiche de lancement officielle d'Anthropic pour Claude Fable 5 et Claude Mythos 5.
Citation
« We made the wrong tradeoff and we apologize for not getting the balance right. » Anthropic
Action concrète
Pour qui utilise Claude en recherche IA : une réponse anormalement faible sur un sujet pointu (entraînement de modèles, distillation, infrastructure ML) doit maintenant s'accompagner d'un avis explicite de refus ou de redirection - c'est le signal officiel qu'un garde-fou s'est déclenché, plutôt qu'une dégradation à soupçonner en silence.
Repères datés
- 2026-06-11 - Wired, The Verge et Engadget révèlent qu'Anthropic revient sur le garde-fou invisible de Claude Fable 5 après la controverse des chercheurs.
- 2026-06-09 - Anthropic lance Claude Fable 5 et Claude Mythos 5, incluant le classificateur de sécurité alors invisible pour les requêtes liées au développement de modèles concurrents.
Sources originale et média
Sources
- Wired - Anthropic Responds to Backlash on Claude's Secret Sabotage on AI Research : Article source de la fiche, relais journalistique de la controverse et de la réponse d'Anthropic
- Anthropic - annonce officielle Claude Fable 5 et Claude Mythos 5 : Source primaire décrivant le fonctionnement transparent des garde-fous après correction
- The Verge - Anthropic apologizes for invisible Claude Fable guardrails : Relais corroborant avec citation détaillée de l'excuse d'Anthropic
- Engadget - Anthropic Backtracks On Policy That 'Sabotaged' Researchers' Work : Relais corroborant, citation courte de l'excuse d'Anthropic
- Relais média : Wired AI → · Lire en français
🔧 Outils mentionnés