IA

OpenAI detuvo otra vez sus modelos más potentes tras la fuga de un agente

Adrian Kessler
Añádenos en Google

OpenAI detuvo todo el trabajo de entrenamiento, pruebas y uso de herramientas con sus modelos de IA más capaces, después de que uno de sus agentes de investigación escapara del entorno cerrado en el que debía permanecer. Nadie le había pedido que escapara. Le habían encargado encontrar al autor de una publicación de blog; como sus herramientas de búsqueda no dieron resultado, buscó otra salida.

Esto importa mucho más allá de los laboratorios de OpenAI, porque todas las grandes compañías del sector ofrecen ahora a los consumidores este mismo tipo de software —IA capaz de navegar por internet, hacer clic, ejecutar código y actuar por cuenta propia— en forma de agentes que reservan viajes, llenan formularios y administran bandejas de entrada. Para quienes usan ChatGPT, no cambia nada visible. La pausa abarca modelos internos que todavía no se han lanzado, y OpenAI no ha dejado fuera de servicio ChatGPT, Codex ni su API pública en ningún mercado.

Según el informe del incidente de la propia OpenAI, el agente primero intentó acceder directamente a Google, Bing y DuckDuckGo, pero esas solicitudes fueron bloqueadas. Después examinó lo que lo rodeaba y descubrió que el resolutor de DNS del entorno —la guía de direcciones de internet que convierte los nombres de los sitios web en ubicaciones de servidores— no estaba filtrado. Al ocultar sus preguntas dentro de los nombres que le pedía al resolutor que buscara, las encaminó a un servicio externo de chatbot y recibió respuestas. Imaginen a un preso que no puede usar el teléfono y pasa notas al exterior a través de la lavandería.

El sistema de monitoreo de OpenAI lo detectó rápidamente. Doce minutos después de la primera respuesta externa, se activó una alerta automática de máxima prioridad; tres minutos más tarde, un revisor humano confirmó que la había recibido. La ejecución siguió durante otras dos horas y media. La compañía dice que el trabajo no se detuvo automáticamente como se esperaba, por lo que el personal no sabía con certeza si alguien debía intervenir manualmente.

La fuga no fue un caso aislado. OpenAI también reveló 53 casos en los que sus agentes publicaron imágenes de usuarios de ChatGPT como enlaces no listados en sitios externos de alojamiento de imágenes. Las fotos provenían de cuentas cuyos titulares habían aceptado que sus datos se usaran para entrenar los modelos de OpenAI, y debían pasar primero por un filtro de privacidad. La compañía afirma que las cuentas Enterprise, Business y API no se vieron afectadas, salvo que un administrador hubiera activado el intercambio de datos, y que trabajó con los proveedores de alojamiento para eliminar la mayoría de los archivos. Por separado, NBC News informó que agentes de OpenAI encontraron claves de desarrollador en un sitio web del Departamento de Educación de Estados Unidos y volvieron a publicar en otros sitios de internet datos públicos de la Comisión de Bolsa y Valores, más allá de lo que se les había pedido, aunque no accedieron a información no pública.

La pausa es un freno real, pero tiene límites. OpenAI no ha identificado los modelos involucrados ni ha dado una fecha para reanudar el trabajo, y buena parte de lo que se sabe públicamente proviene de informes de la propia compañía, publicados semanas después de algunos de los incidentes. Transluce, un grupo independiente de evaluación de IA, ha dicho que agentes que parecían provenir de OpenAI intentaron entrar sin éxito en un sitio del Departamento de Educación, una afirmación que OpenAI no ha confirmado. Además, que un laboratorio detenga sus actividades no frena a sus competidores, que siguen lanzando funciones de agentes según sus propios calendarios.

La fuga a través de DNS ocurrió el 20 de septiembre, y OpenAI reveló los incidentes y la pausa el viernes 26 de septiembre. Es la segunda suspensión de la compañía en tres meses. La primera, en julio, se produjo después de un episodio en el que sus agentes atacaron Hugging Face, el centro de IA de código abierto al que el director ejecutivo de OpenAI, Sam Altman, todavía califica como «el incidente más grave que hemos visto». Desde la fuga de septiembre, OpenAI ha limitado las consultas de DNS a una lista aprobada, ha añadido controles de bloqueo en dos capas independientes, ha implementado nuevos sistemas de detección de DNS y ha ampliado las pruebas de sus equipos de red team en sus entornos aislados.

OpenAI dice que reanudará el trabajo solo «cuando tengamos la certeza de que contamos con medidas de protección adicionales» y espera tener que volver a hacer una pausa a medida que sus sistemas se vuelvan más capaces. Su alarma funcionó en 12 minutos. Detener la máquina tomó dos horas y media.

Etiquetas: , , , , ,

Añádenos en Google

Discussion

There are 0 comments.