Como nueva generación de asistencia de búsqueda visual, ChatGPT ha optimizado este semana el proceso de uso en el ecosistema de iOS, permitiendo a los usuarios añadir fotos recientes en la conversación de manera más rápida. Anteriormente, los usuarios debían hacer clic en el botón +, seleccionar «Photos» y luego elegir de su álbum, aunque este proceso no era complicado, interrumpía el flujo natural de la conversación cuando se necesitaba subir varias fotos o vincular múltiples consultas visuales rápidamente. OpenAI, a través de Adam Fry en la comunidad, ha indicado que ahora solo se necesita mantener presionado el botón + a la izquierda del cuadro de conversación para mostrar un panel de selección rápida con las cuatro fotos más recientes del sistema; seleccionando una de ellas, se puede adjuntar a la conversación y luego hacer una pregunta o incluirla en el aviso. El lanzamiento de este nuevo gesto se produce junto con otras mejoras esta semana, como la captura más precisa de la hora actual, la mejora en la velocidad de carga y respuesta de conversaciones largas en la versión web, y la provisión de actualizaciones de interfaz de usuario más claras mientras se espera la conexión a Internet. Este cambio muestra que OpenAI está reduciendo la barrera de entrada para las consultas visuales diarias con un diseño de interacción más intuitivo, permitiendo a los usuarios completar búsquedas visuales rápidas sin interrumpir el flujo de la conversación.
En el fondo, la función de Inteligencia Visual ha estado funcionando en el sistema iOS durante casi dos años, pero actualmente solo es compatible con modelos de iPhone relativamente nuevos y todavía presenta limitaciones en la cobertura global. Para los usuarios que dependen de ChatGPT para realizar búsquedas visuales similares, el nuevo gesto ofrece una alternativa más inmediata: sin necesidad de cambiar de interfaz o seleccionar manualmente, se pueden enviar rápidamente las fotos recientes directamente en el cuadro de conversación, haciendo que las consultas sean más relevantes para el contexto actual. Este cambio demuestra la importancia que OpenAI otorga al «contexto visual» y extiende una experiencia de interacción más fluida entre dispositivos. En comparación con los procesos anteriores, este enfoque podría aumentar la eficiencia en las tareas diarias, especialmente aquellas que requieren una rápida comparación entre la apariencia de un objeto y su descripción textual.
El nuevo gesto hace que las consultas visuales de ChatGPT sean más intuitivas y fomenta un ritmo colaborativo entre dispositivos
Además, esta actualización no solo se centra en la carga rápida, sino que permite a los usuarios completar todo el proceso desde «seleccionar fotos» hasta «hacer preguntas visualmente relacionadas» en una sola pantalla. En la práctica, los usuarios mantienen presionado el botón +, el sistema mostrará las cuatro fotos más recientes, luego pueden seleccionar cualquiera de ellas para adjuntarla a la conversación, y después pueden añadir directamente comandos, describir detalles o hacer preguntas específicas sobre el contenido de la foto en el cuadro de conversación. El núcleo de este diseño radica en reducir la carga cognitiva, permitiendo a los usuarios establecer rápidamente escenarios de consulta centrados en fotos sin tener que alternar entre múltiples interfaces. Además, si las fotos provienen de múltiples momentos, seleccionar rápidamente las más recientes también ayuda a comparar y razonar de manera eficiente, siendo especialmente útil en situaciones cotidianas como compras, edición de fotos y planificación de viajes. Esto muestra que OpenAI sigue orientándose hacia los escenarios de los usuarios, promoviendo la adopción de búsquedas de imágenes a través de operaciones más intuitivas.
La actualización actual también pone atención en el rendimiento y la estabilidad, además de mejorar la respuesta en tiempo real de la interfaz frontal, la velocidad de procesamiento de conversaciones largas en la versión web también ha mejorado. Para aquellos que necesitan citar o comparar múltiples contenidos visuales en la conversación, estas optimizaciones pueden reducir significativamente el tiempo de espera, haciendo que la experiencia general sea más fluida. Indicaciones de espera de conexión más claras significan que los usuarios pueden comprender más rápidamente el estado actual incluso cuando la conexión a Internet es inestable, evitando confusiones causadas por retrasos en la visualización. Estos cambios apuntan en una dirección: ChatGPT está mejorando la utilidad de las consultas visuales digitales con un diseño más robusto e intuitivo, elevando su aplicabilidad en escenarios de trabajo y entretenimiento diarios.
En términos de cobertura regional y de dispositivos, aunque la velocidad de adopción de la Inteligencia Visual está limitada por los dispositivos y las regiones, OpenAI sigue invirtiendo en la optimización del soporte y la experiencia de uso relacionada. Para los usuarios, si se puede lograr un soporte de dispositivos más amplio y una sincronización entre dispositivos más rápida en futuras actualizaciones, la utilidad y accesibilidad de las consultas visuales aumentará significativamente. Esta serie de mejoras de OpenAI también podría incentivar a la comunidad de desarrolladores a incorporar referencias de diálogo visual más naturales en aplicaciones de terceros, ampliando aún más los escenarios de trabajo y entretenimiento donde «ver es entender».

