IA

La IA de Alibaba que lee tu pantalla obtiene 92% en teléfonos reales y corre en tu propio hardware

Susan Hill

El Qwen-UI-Agent de Alibaba no necesita acceso especial a tus aplicaciones. Lee la pantalla, identifica lo que hay en ella y hace clic, manejando tareas desde mensajería hasta edición de documentos únicamente mediante percepción visual. Los pesos del modelo — MAI-UI-2B y MAI-UI-8B — llegaron a Hugging Face esta semana, poniendo el sistema al alcance de cualquier desarrollador con una GPU.

Los puntos de referencia son concretos. En MobileWorld, la evaluación estándar de agentes móviles, Qwen-UI-Agent obtuvo un 82.1%, superando a GPT-5.6 por 12 puntos porcentuales y a Claude Opus 4.8 por 14.6 puntos. La diferencia no es marginal — sistemas occidentales comparables se han estancado en el rango bajo a medio de los 70 en la misma prueba durante meses. En pruebas en dispositivos reales — tareas ejecutadas en teléfonos Android reales en lugar de emuladores — el puntaje subió a 92.2%. En AndroidDaily, una evaluación más amplia con teléfonos reales, el modelo alcanzó un 97.5%. Para uso en computadoras de escritorio, medido mediante OSWorld-Verified, obtuvo un 79.5%, superando tanto a GPT-5.5 como a Gemini 3.1 Pro.

Alibaba entrenó el modelo con datos de más de 100 dispositivos móviles reales ejecutando 150 aplicaciones distinctas, y lueo construyó su propio punto de referencia — MobileWorld-Real — con más de 400 tareas para verificar el rendimiento fuera del laboratorio. Aproximadamente el 40% de las tareas de escritorio involucraban operaciones por lotes de línea de comandos junto con clics visuales, una elección de diseño que refleja cómo funciona la informática real en lugar de cómo se montan las demos.

Una capa de seguridad está integrada en el flujo de trabajo. El modelo rechaza tareas que considera ilegales o de alto riesgo, y se detiene ante operaciones sensibles — pagos, eliminación de datos, autorizaciones de privacidad — solicitando confirmación explícita del usuario antes de continuar. El sistema maneja secuencias de más de 100 pasos usando aprendizaje por refuerzo entrenado en alrededor de 10,000 entornos simulados simultaneous.

Los puntajes de los puntos de referencia dejan abiertas las preguntas más difíciles. Qwen-UI-Agent fue evaluado en tareas estructuradas; el uso real del teléfono está lleno de interrupciones, saturado de notificacione, e involucra aplicaciones que actualizan sus interfaces sin previo aviso. La IA de lectura de pantalla también plantea una pregunt de privacidad que el informe técnico de Alibaba no aborda: un modelo que proceesa cada píxel de tu pantalla tiene acceso a detales bancarios, mensajes privados y datos que la mayría de los usuarios nunca han considerado entregar a un sistem de tereros. No hay directices sobre qué sucede con esos datos en implementacione de tereros.

El progetto está aljado en Tongyi-MAI/MAI-UI en GitHub; los pesos del modelo están en Huging Face aora. No se ha anunciado ninguna API comercial ni precio de implementación. La prúba prueba para Qwen-UI-Agent no es un punto de referencia — es si los desarrolladores que contruyen sobre los pesos abiertos pueden igualar en producción lo que Alibaba registró en el laboratorio.

Etiquetas: , , , , ,

Discussion

There are 0 comments.