IA

OpenAI lanzó Astra: el modelo de IA que detecta vulnerabilidades de seguridad y no explica cómo piensa

Adrian Kessler

Astra opera en código, análisis de seguridad, uso de computadoras y tareas profesionales de múltiples pasos con una velocidad y precisión que supera al modelo anterior de OpenAI, Sol, y a Fable de Anthropic en los puntos de referencia estándar de ingeniería de software. La empresa lo describe como el primer modelo que ha construido que cruza el nivel “Crítico” de capacidad de ciberseguridad: puede identificar y desarrollar exploits para fallos de seguridad previamente desconocidos, a una escala y velocidad que ningún equipo humano puede igualar.

El mecanismo detrás de esto es una técnica llamada recurrencia opaca. Los modelos de lenguaje estándar producen su razonamiento como texto legible — la cadena de pensamiento que los investigadores usan para auditar decisiones, detectar errores y verificar que un modelo se comporta como se espera. Astra funciona sin producir ese texto. Puede resolver problemas difíciles sin dejar un rastro legible del proceso. El científico jefe de OpenAI, Jakub Pachocki, reconoció el cambio: los modelos más capaces, dijo, pueden “realizar tareas más difíciles usando menos tokens de lenguaje”. El monitoreo se vuelve más difícil en proporción.

Eso crea un problema estructural que las propias afirmaciones de OpenAI hacen visible. La empresa describe a Astra como su “modelo más alineado” hasta la fecha. La alineación — la disciplina de ingeniería que se ocupa de hacer que los sistemas de IA se comporten como sus diseñadores pretenden — históricamente ha dependido de leer lo que el modelo está haciendo paso a paso. Un modelo que razona de forma invisible hace que su propia alineación no sea verificable por ese método. OpenAI no ha descrito públicamente qué método alternativo utiliza para verificar el comportamiento de Astra antes de su despliegue.

Greg Brockman, presidente de OpenAI, describió a Astra como un “salto generacional” y se le preguntó directamente si representa inteligencia general artificial. Su respuesta: la definición contractual de AGI que regía la asociación de OpenAI con Microsoft ya no aplica. La AGI es ahora, dijo, un “concepto espiritual”. Ese encuadre importa. El acuerdo de OpenAI con Microsoft incluía cláusulas vinculadas a la AGI — condiciones bajo las cuales los términos de la relación cambiarían. Describir la AGI como indefinida mantiene esas cláusulas inactivas, independientemente de lo que Astra sea realmente capaz de hacer.

El acceso se lanzó primero a Daybreak, el programa de ciberseguridad verificado de OpenAI — una estructura que la empresa presenta como un despliegue defensivo prioritario. El razonamiento es que las organizaciones que buscan vulnerabilidades en sus propios sistemas obtienen la capacidad antes que aquellas que buscan vulnerabilidades en los sistemas de otros. Esa lógica solo se sostiene mientras los controles de acceso se mantengan. Las capacidades de identificación de vulnerabilidades de día cero de Astra son, por diseño, precisamente lo que un atacante con buenos recursos querría. Un modelo que razona sin una cadena de pensamiento legible también es más difícil de restringir o auditar después si algo sale mal.

El acceso más amplio se despliega a los niveles de pago — Pro, Plus, Enterprise, Business — y a través de la API en la próxima semana.

Etiquetas: , , , , ,

Discussion

There are 0 comments.