Google lanza Android Bench 2.0 para enfrentar tareas de desarrollo complejas

Google actualmente está desarrollando Android Bench, cuya última versión es la 2.0, reflejando la capacidad de la inteligencia artificial para manejar tareas de desarrollo más complejas. La primera versión se centró en mejoras incrementales a bibliotecas de código existentes, como la corrección de errores o solicitudes de funciones menores. Android Bench 2.0 se enfoca en «tareas de alta complejidad que requieren días o incluso semanas de trabajo por parte de los ingenieros», como añadir nuevas características, construir aplicaciones desde cero y convertir aplicaciones multiplataforma a Android.

Este nuevo enfoque requiere «evaluaciones y puntuaciones más detalladas», y va más allá de los criterios de aprobación o rechazo. Google está pasando de una puntuación binaria a una puntuación continua: calculamos esta tasa de finalización a través de múltiples factores como funcionalidad, realismo visual, y la evitación de retrocesos. También aplicamos penalizaciones objetivas por desviaciones de las directrices de evaluación o restricciones estructurales.

Android Bench 2.0 se centra en la evaluación de tareas de alta complejidad

Google ha evaluado Gemini 3.7/3.8 Flash, OpenAI GPT-6, Anthropic Fable 5.1, Kimi K3 y Qwen 3.8 Max. GPT-6 Astra se destacó en las pruebas de referencia, alcanzando una tasa de aprobación del 28% (en comparación con el rango de puntuación del 90% en métodos anteriores). Google compartió algunas ideas, como que «la portación de aplicaciones multiplataforma a Android sigue siendo un desafío no resuelto: ningún modelo ha alcanzado una tasa de aprobación del 100%, y los modelos más avanzados alcanzan como máximo una tasa de finalización del 80%.»

“La inteligencia artificial supera en rendimiento a la hora de escribir nuevo código en comparación con la reestructuración del código existente. La reestructuración y migración se vuelven más complicadas, ya que el éxito depende de la complejidad de la arquitectura, no de la cantidad de código.” Además, “los modelos muestran una gran capacidad al realizar conversiones determinísticas (como convertir Java a Kotlin, cambiar Retrofit por Ktor o introducir una capa ViewModel).” Sin embargo, estos modelos se ven limitados en tareas que requieren validación en tiempo de ejecución (como la falta de un gráfico de inyección de dependencias), que implican cambios significativos en el marco o que enfrentan vacíos de conocimiento sobre bibliotecas no publicadas.

A través de evaluaciones por proxy, Android Bench ejecutó «proxies de los respectivos proveedores de modelos», como Gemini 3.8 Flash ejecutándose en Google Antigravity y GPT-5.6 Sol utilizando Codex. Google afirmó que «aprovechar el diseño impacta positivamente en los resultados de los desarrolladores», y Android Bench planea incorporar en el futuro combinaciones de diferentes modelos y proxies.

Contenido original
Este artículo es la versión en español de un contenido original de TechRitual.
Stein Yep
Stein Yep