Un modèle d’intelligence artificielle d’Anthropic a transmis de fausses informations sur un homicide non élucidé via un formulaire public de la police de Philadelphie. Le service de police a rendu l’incident public vendredi 9 octobre, après avoir été prévenu par l’entreprise deux jours plus tôt.

Le message avait été envoyé le 18 juillet à 23 h 27 sur PhillyUnsolvedMurders.com, un site qui recueille des renseignements du public. Selon la déclaration complète de la police relayée par la chaîne locale 6abc, le modèle effectuait un test automatisé portant sur des sites choisis aléatoirement. Il a alors accédé au formulaire et inventé des informations sur une affaire réelle. Le dépôt prétendait provenir d’une personne susceptible de détenir des éléments utiles.

Le système du site a classé le courriel comme indésirable. Le signalement n’a donc jamais été transmis au centre criminel en temps réel ni diffusé aux enquêteurs. La police indique par ailleurs n’avoir constaté ni accès non autorisé à ses systèmes ni compromission de données. Elle rappelle qu’un signalement, quelle que soit son origine, n’est qu’une piste : il doit être examiné par un humain et corroboré avant toute suite.

Anthropic dit avoir découvert l’incident le 28 septembre, interrompu le processus de test concerné et ajouté un mécanisme de validation. L’entreprise n’a averti la police que le 7 octobre. Après une réunion le lendemain, le service a retrouvé le dépôt dans ses archives. La police a qualifié d’« inacceptable » le délai de plus de deux mois entre l’envoi et sa détection, et demandé à l’entreprise de renforcer ses garde-fous.

L’épisode illustre un risque très concret des agents capables d’agir sur le Web : une consigne de test peut produire une action réelle sur un service public, même sans intrusion informatique. Le filtrage du site et la procédure de vérification humaine ont ici empêché une conséquence opérationnelle. Mais le cas pose une question de conception : les environnements d’évaluation doivent empêcher par défaut toute soumission externe, et non compter sur le site ciblé pour arrêter l’erreur. L’illustration est une création originale générée par IA et ne reproduit aucune interface réelle.