Apple todavía está trabajando en formas de ayudar a Siri a ver aplicaciones en una pantalla, ya que un nuevo documento explica cómo está funcionando en una versión de Ferret que se ejecutará de forma nativa en un iPhone.
El trabajo de Apple para actualizar Siri con otros sistemas de inteligencia artificial que se pueden usar en un teléfono inteligente se está acelerando gradualmente. Si bien los intentos inmediatos de implementar un Siri nuevo y más contextual no están listos para el horario estelar, Apple todavía está mirando hacia el futuro en busca de otras actualizaciones que pueda realizar para su asistente y Apple Intelligence.
Parece que el camino a seguir es centrarse en su punto fuerte: el procesamiento de consultas local.
Negocio de hurones
En 2023, Apple e investigadores de la Universidad de Cornell impulsaron un LLM multimodal de código abierto llamado «Ferrets». Se trataba de la creación de un software que puede utilizar regiones de imágenes para preguntas, como identificar qué hay en un área dibujada de una fotografía.
Medio año después, en abril de 2024, el trabajo se amplió a una nueva versión de Ferret-UI que podía comprender los elementos de la interfaz de usuario. Es decir, una IA que puede leer una captura de pantalla de la pantalla de un teléfono, determinar y leer los elementos importantes que aparecen y potencialmente interactuar con la interfaz de usuario de una aplicación abierta.
En un artículo de febrero de 2026 para «Ferret-UI Lite», hay una evolución natural para crear una versión de Ferret que intenta solucionar un problema de versiones anteriores. Es decir, se basó en el procesamiento con grandes modelos lingüísticos (LLM) que eran bastante grandes y que en realidad no estaban diseñados para el procesamiento en el dispositivo.
El uso de estos LLM basados en la nube tenía sentido, porque las capacidades de planificación y razonamiento eran considerables, lo que garantizaba excelentes resultados. Sin embargo, todavía era necesario enviar los datos a estos servidores en la nube, cuando los defensores de la privacidad y la seguridad preferirían ver los datos procesados localmente.
Si bien el equipo vio avances en la producción de sistemas basados en GUI y de múltiples agentes para la tarea, especialmente al intentar reducir el trabajo requerido para que los agentes interactúen con las interfaces de usuario, todavía quedaba demasiado trabajo por hacer localmente en un teléfono inteligente.
Esto llevó a la creación de la nueva versión Lite de Ferret-UI.
Delgado y rápido
El resultado, Ferret-UI Lite, es un agente GUI de extremo a extremo que se ejecuta en múltiples plataformas, incluidos sistemas móviles, web y de escritorio. Es decir, es algo que funcionará en un smartphone, como un iPhone, sin demasiados problemas.
Para lograr esto, Ferret-UI Lite está creado con 3 mil millones de parámetros utilizando datos GUI de fuentes reales y sintéticas. También aumentó el rendimiento del tiempo de inferencia mediante el razonamiento en cadena de pensamiento y el uso de herramientas visuales, junto con el aprendizaje por refuerzo.
Recorte de imágenes de pantalla basado en predicciones para minimizar la cantidad de datos que deben analizarse, como se muestra en el artículo de Ferret-UI Lite
Como ejemplo de las formas en que Ferret-UI Lite funciona para ayudar a las consultas procesadas localmente, se incluye un mecanismo de acercamiento para ayudar a analizar la imagen de la interfaz de usuario. El modelo produce una predicción inicial y la imagen se recorta alrededor de la ubicación esperada en función de esta predicción.
Al tener menos imágenes con las que trabajar, puede centrarse más en la información que se presenta en esa región recortada, lo que le permite refinar mucho más la predicción.
Para los investigadores, esto parece imitar el comportamiento humano cuando se observa de cerca algo en detalle.
Investigación prometedora
Si bien el Ferret-UI Lite resultante no es muy innovador, los resultados obtenidos siguen siendo bastante buenos considerando que se enfrentó a agentes LLM a nivel de servidor. En algunos casos, el equipo dice que puede superar a los modelos más grandes.
En la prueba de conexión a tierra de la GUI de ScreenSpot-Pro, el modelo alcanza una precisión del 53,3%. Esto es más de un 15% mejor que UI-TARS-1.5, LLM de 7 mil millones de parámetros.
Sin embargo, no todo está bien. En una tarea de navegación GUI, Ferret tuvo un rendimiento más limitado frente a modelos más grandes, pero aún estaba a la par con el modelo UI-TARS-1.5.
En definitiva, el artículo concluye que el experimento «valida la eficacia de estas estrategias para agentes de pequeña escala», al tiempo que señala sus limitaciones. La reducción de los agentes GUI es prometedora y desafiante, y el equipo espera que la investigación ayude a informar futuros intentos de investigación.

