JetBrains ha anunciado el nuevo modo Junie /demo en la herramienta Junie CLI, con el objetivo de automatizar la parte interactiva de la verificación de los cambios de código. En lugar de limitarse a ejecutar las pruebas, el desarrollador puede describir el escenario requerido para que Junie construya y ejecute la aplicación, interactúe con su interfaz y genere después un informe HTML que incluya el resultado, capturas de pantalla y un vídeo de la ejecución.
¿Cómo funciona el nuevo modo?
Junie analiza el proyecto y propone un plan para construirlo y ejecutarlo; después crea los archivos de configuración tras la aprobación del usuario. Se pueden seleccionar los cambios de la rama, la sesión, el árbol de trabajo o el último commit, antes de introducir una solicitud que especifique las acciones y los resultados esperados. En el ejemplo presentado por JetBrains, el agente identifica dos incidencias en una herramienta de seguimiento de tareas, cambia su estado a Done, comprueba que los contadores hayan cambiado y vuelve a cargar la página para confirmar que el resultado se mantiene.
El usuario puede seguir la ejecución directamente mientras el agente se desplaza por la interfaz. El vídeo incluye diapositivas introductorias para cada escenario y una diapositiva final con los resultados, además de subtítulos explicativos que se pueden activar o desactivar. JetBrains explica que un modelo analiza las capturas de pantalla después de la grabación para preparar estas diapositivas, mientras que la narración de voz podría añadirse en una actualización posterior.
De la demostración manual a la revisión auditable
El informe HTML reúne la solicitud original, el resultado, el vídeo, las capturas de pantalla y los pasos ejecutados, e indica qué pruebas se superaron, cuáles fallaron y cuáles quedaron incompletas. Esto hace que los resultados puedan ser revisados por un desarrollador, un ingeniero de garantía de calidad o un miembro del equipo que quiera ver el comportamiento de la función en lugar de limitarse a leer el cambio de código.
certi.news considera que el valor práctico no reside aquí en sustituir las pruebas automatizadas, sino en añadir pruebas visuales del comportamiento de la interfaz. El juicio sobre la preparación del cambio sigue siendo responsabilidad del revisor; que el agente complete la ejecución no significa automáticamente que la comprobación haya sido satisfactoria. Por eso, los ejemplos de JetBrains solicitan a Junie que emita un veredicto explícito y solo pasan el resultado cuando escribe PASS, mientras que valores como FAIL y PARTIAL, o la ausencia de resultado, provocan que falle la comprobación.
Integración con GitHub Actions y costes
JetBrains utilizó el modo internamente con GitHub Actions en más de 1.500 solicitudes de incorporación de cambios únicas y creó más de 2.100 vídeos de demostración. También lo utilizó en 22 escenarios para pruebas smoke en ramas de lanzamiento, con un total de más de 1.300 pruebas internas. La empresa proporciona dos ejemplos de archivos YAML que se pueden adaptar: uno para comprobar los cambios que merecen una demostración y añadir enlaces a las pruebas en la solicitud de incorporación de cambios, y otro para las pruebas de lanzamiento que se ejecutan al hacer push o manualmente.
Los ejemplos se basan en GitHub Artifacts, por lo que no necesitan un servicio independiente para alojar el vídeo. JetBrains señala que la ejecución de 22 casos en una medición interna costó 19,94 dólares utilizando GPT-5.6 SOL, según la conversión de la suscripción que utiliza, con el coste del entorno de ejecución de CI separado. Son cifras internas que dependen de la aplicación, de los pasos de compilación y de la formulación de las solicitudes, y no una estimación general para todos los proyectos.
Entorno y limitaciones operativas
El modo funciona dentro de un contenedor Docker basado en Debian Bookworm, que incluye Chromium, Node.js, Xvfb, un gestor de ventanas y herramientas como xdotool y ffmpeg. Utiliza un modelo compatible con Computer Use para controlar los clics, el teclado y las capturas de pantalla. Los repositorios complejos pueden definir varias plantillas para máquinas virtuales, con configuraciones independientes para los servicios y las interfaces.
La ejecución no comienza sin un modelo compatible, y Junie utiliza el modelo activo si está disponible y admite Computer Use; de lo contrario, elige de una lista que incluye GPT-5.6 SOL y GPT-6 Astra, y después GPT-5.5 y GPT-5.4, con High reasoning effort configurado en el modo /demo. La ejecución también tarda varios minutos, y su mayor utilidad sigue estando en trasladar la verificación interactiva repetitiva a un flujo susceptible de inspección, no en garantizar la corrección del resultado sin revisión humana.