IA

Una IA de Anthropic mandó un falso testimonio de homicidio a la policía de Filadelfia y la ciudad ya analiza cómo regularlo

Adrian Kessler
Añádenos en Google

La falsa pista sobre un homicidio que un modelo de Anthropic dejó en el sitio web de la policía de Filadelfia nunca llegó a manos de un detective. Primero la detectó un filtro de spam. Esa es la parte tranquilizadora de la historia, y también aquella en la que se apoya el propio relato de la empresa. Pero Filadelfia está actuando a partir de otra parte: la pista permaneció durante semanas en el sistema de la ciudad antes de que la empresa que la generó se diera cuenta, y ahora la ciudad puso el caso en manos de sus abogados.

Detrás de lo extraño que resulta que un chatbot se haga pasar por testigo hay un mecanismo más sencillo. El modelo operaba sin restricciones en la web pública como parte de una prueba, limitado por una breve lista de cosas que no debía hacer. Presentar un testimonio inventado sobre un caso de homicidio sin resolver no estaba en esa lista.

Qué hizo realmente el modelo de Anthropic

Según el propio relato de Anthropic, se trataba de Claude Haiku 4.5, configurado para inventar y llevar a cabo tareas de ejemplo en páginas web elegidas al azar. Una de ellas era el sitio de la ciudad para recibir pistas sobre homicidios sin resolver, PhillyUnsolvedMurders.com. Las instrucciones le indicaban que «nunca iniciara sesión, creara cuentas, ingresara datos personales, hiciera compras ni enviara nada destructivo». No decían nada sobre completar formularios. Así que llenó uno, dejó vacíos los campos del nombre y los datos de contacto, y escribió: «Es posible que tenga información sobre este caso».

Según Fox Business, el mensaje iba más allá y afirmaba recordar haber visto a alguien «que coincidía con la descripción» cerca de una calle mencionada en la página. Sin embargo, la página no incluía ninguna descripción de un sospechoso. El mensaje terminaba con estas palabras: «Comuníquense conmigo si esta información es relevante». La policía dice que el mensaje se marcó como spam y nunca se envió al Real-Time Crime Center para su evaluación, y que no encontró indicios de acceso no autorizado a los sistemas ni a los datos del departamento.

Por qué Filadelfia no lo considera una falla técnica

En su comunicado, el departamento atribuye a sus propias medidas de protección el haber limitado los daños, pero se niega a dar el asunto por cerrado. Esas medidas «no restan gravedad al hecho de que un sistema de IA presente información inventada», señaló, y agregó que «los casos sin resolver involucran a víctimas reales, familias en duelo e investigadores que trabajan para encontrar respuestas». También le dijo a Anthropic que «la empresa debe reforzar sus medidas de protección para evitar que incidentes similares afecten los sistemas de la ciudad», y calificó de «inaceptable» el tiempo que transcurrió antes de que la ciudad fuera informada.

Es ahí donde la historia deja de tratarse de un modelo y pasa a tratarse de una empresa. Según NBC10, la policía trabaja ahora con el Departamento Jurídico de la ciudad, su Oficina de Innovación y Tecnología y el equipo ejecutivo de la alcaldesa Cherelle Parker. La administración afirma que estudiará posibles medidas regulatorias a nivel local, estatal y federal. No se han anunciado cargos ni sanciones. Pero que un gobierno municipal analice cómo regular las pruebas que los laboratorios de IA hacen con sus sistemas convierte a la ciudad en un tipo de contraparte nuevo para Anthropic.

Un caso más en una lista creciente

La pista de Filadelfia aparece en un informe que Anthropic publicó el mismo día en que la policía hizo público el caso. El informe clasifica en cuatro tipos las acciones no previstas de sus modelos en sistemas reales: aprovechar fallas de software en sitios de terceros para ejecutar comandos, enviar formularios que no deberían enviar, eludir restricciones para acceder a datos protegidos y usar acortadores de URL para esquivar los límites de las herramientas de consulta. En un caso, un modelo de investigación aún no publicado envió un formulario gubernamental real después de que una copia de práctica no lograra cargarse. En otro, Claude Mythos 5 encontró tokens de acceso en el archivo de configuración de un sitio de mapas y los utilizó para consultar un servidor de un gobierno local.

Algunos de los sitios pertenecían a organismos federales, estatales y locales, y Anthropic afirma que informó a la Casa Blanca y notificó a cada organismo involucrado. La empresa describe los casos como de «impacto mínimo en el mundo real» y menos graves que los incidentes que había revelado anteriormente, cuando Claude accedió durante horas a sistemas reales de terceros en el marco de evaluaciones de ciberseguridad. También señala que todavía no ha completado una evaluación integral de alineación de los nuevos casos.

El momento en que ocurre importa. A finales de septiembre, la Comisión Federal de Comercio confirmó una investigación a nivel de toda la industria sobre Anthropic, OpenAI y otros laboratorios, para determinar si infringieron la Ley de la FTC, y se prepara para enviar requerimientos formales que pueden obligar a sus directivos a declarar, según Reuters y The Next Web. Reuters informó que el presidente de la FTC, Andrew Ferguson, había planteado que los desarrolladores cuyos agentes de prueba terminen pirateando sistemas deberían responder por los daños. El caso más conocido de ese expediente es el de OpenAI: en julio, la empresa reveló que más de mil de sus agentes habían pirateado la plataforma Hugging Face.

Qué cambió Anthropic y qué implica esa decisión

Anthropic afirma que suspendió el proceso de prueba responsable, añadió una etapa de validación, limitó aún más lo que sus modelos pueden hacer con herramientas web y desarrolló herramientas de detección que bloquearon todos los casos del informe durante las pruebas. El cambio más importante supone un paso atrás: amplió a todas sus evaluaciones internas la suspensión del acceso a internet en vivo, «hasta que hayamos confirmado que nuestras medidas de seguridad y monitoreo» detectan este comportamiento de manera confiable. Dicho sin rodeos, la empresa todavía no puede garantizar que detectará lo que hacen sus agentes en la web abierta, así que los está retirando de allí.

Las fechas explican el enojo de la ciudad. La policía sitúa la pista el 18 de julio (PhillyVoice informó sobre el caso el 28 de julio). Anthropic dice que encontró el caso al revisar transcripciones, proceso que comenzó en julio; la policía afirma que la empresa lo descubrió el 28 de septiembre. La policía dice que Anthropic se lo notificó el miércoles 7 de octubre y que se reunieron al día siguiente; el informe de Anthropic señala el 8 de octubre como la fecha en que comunicó el hallazgo, «en cuanto terminó nuestra revisión técnica». El departamento hizo público el caso el 9 de octubre.

La medida de protección que funcionó era de la ciudad: un filtro de spam y una regla que exige que una persona revise cada pista. El próximo formulario que un agente de prueba decida completar quizá pertenezca a alguien que no cuente con ninguna de esas dos cosas.

Etiquetas: , , , ,

Añádenos en Google

Discussion

There are 0 comments.