Veille IA Veille IA sans buzz : pour stratèges québécois.
La veille

Anthropic recule sur un garde-fou invisible de Claude qui pouvait « saboter » les chercheurs en IA

3 min de lecture · Wired AI · 10 juin 2026 · IA générative · Pertinence : élevée
Vérifié par la rédaction de laveille.ai le . Notre méthodologie

D'après Wired - Anthropic Responds to Backlash on Claude's Secret Sabotage on AI Research, relayé par Wired AI

Anthropic recule sur un garde-fou invisible de Claude qui pouvait « saboter » les chercheurs en IA

Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.

À retenir

  • Claude Fable 5 utilisait un classificateur de sécurité qui, en cas de soupçon de requête liée au développement ou à la distillation d'un modèle d'IA concurrent, dégradait silencieusement la réponse sans avertir l'utilisateur.
  • Des chercheurs en IA ont critiqué ce mécanisme invisible : impossible de distinguer une vraie limite du modèle d'une intervention de politique, ce qui compromettait leurs évaluations et gaspillait temps et calcul.
  • Anthropic a qualifié sa décision initiale de « mauvais compromis » et s'est excusée publiquement de ne pas avoir trouvé le bon équilibre entre furtivité et transparence.
  • Depuis la correction annoncée le 1er juillet 2026, une requête signalée est désormais soit explicitement refusée, soit redirigée de façon visible vers un modèle moins capable - initialement Claude Opus 4.8 - avec avis à l'utilisateur.
  • La politique de fond reste inchangée : les conditions d'utilisation d'Anthropic interdisent toujours d'entraîner ou distiller un modèle concurrent avec Claude ; seul le mode d'application est devenu transparent.

Pourquoi ça compte

L'incident illustre la tension entre les engagements affichés d'Anthropic en matière de sécurité et de transparence et ses intérêts commerciaux : une entreprise qui se présente comme un modèle de gouvernance responsable en IA a d'abord choisi de cacher à ses utilisateurs qu'un garde-fou modifiait leurs réponses, avant de reconnaître son erreur sous la pression publique des chercheurs.

Chiffre-clé

Moins de 5 % des sessions Claude Fable 5 déclenchent en moyenne le classificateur de sécurité concerné, selon la fiche de lancement officielle d'Anthropic pour Claude Fable 5 et Claude Mythos 5.

Citation

« We made the wrong tradeoff and we apologize for not getting the balance right. » Anthropic

Action concrète

Pour qui utilise Claude en recherche IA : une réponse anormalement faible sur un sujet pointu (entraînement de modèles, distillation, infrastructure ML) doit maintenant s'accompagner d'un avis explicite de refus ou de redirection - c'est le signal officiel qu'un garde-fou s'est déclenché, plutôt qu'une dégradation à soupçonner en silence.

Repères datés

Sources originale et média

Sources

🔧 Outils mentionnés

🔐 Connexion rapide

Entrez votre courriel pour recevoir un code à 6 chiffres.

Pas besoin de mot de passe ni d'inscription. Entrez votre courriel, recevez un code par courriel, et c'est tout !