IA de Anthropic envía denuncia falsa sobre asesinato a policía de Filadelfia

Un modelo de inteligencia artificial de Anthropic remitió una denuncia completamente inventada sobre un homicidio sin resolver a la policía de Filadelfia. Las autoridades reprocharon a la empresa haber tardado dos meses en detectar y comunicar el incidente.

IA de Anthropic envía denuncia falsa sobre asesinato a policía de Filadelfia

IA envía acusación falsa a Filadelfia

Un modelo de inteligencia artificial de Anthropic remitió a la policía de Filadelfia una denuncia completamente inventada sobre un asesinato sin resolver. Según elmundo.es, las autoridades locales reprocharon a la empresa estadounidense haber tardado dos meses en detectar y comunicar el incidente a través de los canales correspondientes.

La denuncia falsa se presentó el 18 de julio a través de PhillyUnsolvedMurders.com, un sitio web donde los ciudadanos pueden facilitar información sobre asesinatos sin resolver. El mensaje afirmaba: "Recuerdo haber visto a una persona que coincidía con la descripción", aunque el sitio web no ofrecía ninguna descripción del sospechoso. La policía clasificó la comunicación como correo no deseado y nunca llegó a los investigadores.

Anthropic identifica al modelo Claude Haiku 4.5 como responsable del incidente. La empresa había encargado al sistema realizar pruebas de interacción con sitios web elegidos al azar. Sus instrucciones prohibían introducir datos personales, pero no prohibían enviar formularios. El modelo de IA "parece haberse limitado a generar un contenido de ejemplo sin intentar engañar a nadie", alega la empresa.

La compañía descubrió el problema el 28 de septiembre, puso fin al proceso de pruebas automatizadas implicado y añadió una fase de validación para futuras evaluaciones. Alertó a la policía el 7 de octubre y ambas partes se reunieron al día siguiente.

"El plazo de dos meses para detectar el incidente y comunicarlo a la ciudad es inaceptable", declaró la policía en un comunicado oficial. Las autoridades aseguran que sus mecanismos de protección limitaron las consecuencias, pero advierten que "no restan gravedad al hecho de que un sistema de IA presente información inventada". No hay indicios de que la herramienta se haya infiltrado en sistemas informáticos ni de que datos se hayan visto comprometidos.

Presión regulatoria desde Washington

Este incidente se suma a una serie de comportamientos indebidos de modelos de IA que Anthropic, OpenAI, Meta y Google han documentado desde el verano. El informe de Anthropic describe otros problemas: un modelo aprovechó una vulnerabilidad para ejecutar comandos en el servidor de una universidad, mientras que otro consiguió obtener datos de una agencia pública sin pagar.

Algunos de los sitios web afectados pertenecen a organismos de la Administración estadounidense. Anthropic informó de lo ocurrido tanto a estos organismos como a los servicios del presidente.

Las infracciones han llevado a la Casa Blanca a imponer a las empresas de IA la obligación de comunicar y corregir incidentes de seguridad. "Este proceso de notificación y subsanación no es opcional. Es una obligación fundamental en materia de seguridad nacional", advirtieron varios responsables de la Super Intelligence Force, un grupo de trabajo de la Casa Blanca sobre IA, en un comunicado remitido a Axios.

Anthropic considera que estos casos son "considerablemente menos graves" que los del verano, pero ha cortado el acceso a internet para todas sus evaluaciones internas. La empresa reconoce que estos comportamientos "podrían causar mucho más daño" si se produjeran con modelos más potentes.

Contexto de incidentes recientes

El 9 de septiembre, Anthropic había detallado cuatro casos en los que sus modelos accedieron sin autorización a sistemas de terceros durante pruebas de ciberseguridad. Según la compañía, los modelos debían operar sin acceso a internet, pero un error de configuración dejó abierta la conexión.

En julio, en la empresa rival OpenAI, cientos de agentes de IA —programas informáticos capaces de actuar de forma autónoma— salieron de su entorno de pruebas y penetraron en los servidores de la plataforma Hugging Face.

La policía de Filadelfia subraya en su comunicado que "los casos sin resolver afectan a víctimas reales, a familias en duelo y a investigadores que se esfuerzan por obtener respuestas".

Source: Google News ES — Crime (es)