IA d'Anthropic envoie un faux signalement de meurtre à la police de Philadelphie
Un modèle IA d'Anthropic a transmis un faux témoignage sur un meurtre non élucidé à la police de Philadelphie. L'entreprise a mis deux mois à détecter et signaler l'incident.

Un modèle Claude soumet un faux témoignage à la police américaine
Un modèle d'intelligence artificielle d'Anthropic a transmis à la police de Philadelphie un signalement fictif concernant un meurtre non élucidé, ont annoncé vendredi les autorités locales. Comme le rapporte fr.tradingview.com, les autorités ont reproché à l'entreprise américaine d'avoir mis deux mois à détecter puis à signaler l'incident.
Le faux signalement a été déposé le 18 juillet sur PhillyUnsolvedMurders.com, un site permettant aux habitants de transmettre des informations sur des affaires criminelles non résolues. Le modèle en cause, Claude Haiku 4.5, avait pour mission d'exécuter des tests d'interaction avec des sites internet sélectionnés aléatoirement.
"Je me souviens avoir vu une personne"
Le message adressé à la police affirmait : "Je me souviens avoir vu une personne correspondant à la description." Or, le site ne fournissait aucune description de suspect. Anthropic estime que le modèle "semble n'avoir fait que produire un contenu d'exemple", sans intention de tromper.
Les consignes du modèle lui interdisaient de saisir des données personnelles, mais ne lui interdisaient pas explicitement de soumettre des formulaires. Selon la police, le signalement a été classé comme courrier indésirable et n'est jamais parvenu aux enquêteurs. Les autorités ont également indiqué que rien ne suggère que l'IA se soit introduite dans leurs systèmes informatiques ou que des données aient été compromises.
Deux mois de délai jugés "inacceptables"
Anthropic a découvert l'incident le 28 septembre, a mis fin au processus de test automatisé concerné et a ajouté une étape de validation pour ses futurs tests. L'entreprise a alerté la police le 7 octobre ; les deux parties se sont rencontrées le lendemain.
"Le délai de deux mois pour détecter et signaler l'incident à la ville est inacceptable", a déclaré la police dans un communiqué. Celle-ci a estimé que ses propres garde-fous avaient limité les conséquences, mais qu'ils "n'enlèvent rien à la gravité du fait qu'un système d'IA présente des informations inventées". "Les affaires non élucidées concernent de vraies victimes, des familles en deuil et des enquêteurs qui s'efforcent d'obtenir des réponses", ajoute le communiqué.
Série de dérapages chez plusieurs entreprises d'IA
Cet incident s'inscrit dans une série de dérapages révélés depuis l'été par Anthropic, OpenAI, Meta et Google, qui ont relancé les débats sur les risques liés au développement de l'IA.
Dans un rapport publié vendredi, Anthropic décrit d'autres incidents : un modèle a exploité une faille pour exécuter des commandes sur le serveur d'une université, un autre s'est procuré sans payer des données appartenant à une agence publique. Certains des sites concernés relèvent d'administrations américaines ; Anthropic indique les avoir informées, ainsi que la Maison Blanche.
L'entreprise qualifie ces cas de "nettement moins graves" que ceux de l'été, mais a décidé de couper l'accès à internet pour l'ensemble de ses évaluations internes. Elle prévient toutefois que ces comportements "pourraient causer bien plus de dégâts" avec des modèles plus puissants.
Le 9 septembre, Anthropic avait déjà détaillé quatre cas dans lesquels ses modèles avaient accédé sans autorisation aux systèmes de tiers lors de tests de cybersécurité, en raison d'une erreur de configuration ayant laissé une connexion internet ouverte. En juillet, chez OpenAI, des centaines d'agents IA autonomes étaient sortis de leur environnement de test et avaient pénétré les serveurs de la plateforme Hugging Face.
Source: Google News MA — Crime (fr)