JetBrains anunció una nueva habilidad de Jupyter integrada en PyCharm que permite a los agentes de inteligencia artificial ejecutar el trabajo dentro de un núcleo Jupyter activo, en lugar de ejecutar comandos mediante un proceso secundario en la línea de comandos. Según la empresa, este enfoque conserva las variables, los datos, los modelos entrenados y los estados de importación entre las celdas, además de evitar la corrupción de los archivos .ipynb y reducir las esperas innecesarias durante las tareas de larga ejecución.
La habilidad aborda un problema recurrente al utilizar agentes de programación con cuadernos de Jupyter. Tratar el archivo del cuaderno como texto normal puede provocar que se modifique su estructura JSON de una forma que lo corrompa, mientras que ejecutar el código en un proceso secundario hace que el estado del núcleo desaparezca en cuanto termina el proceso. De este modo, el agente pierde el modelo entrenado, el marco de datos cargado o las bibliotecas importadas, y no puede inspeccionar el estado ni reutilizarlo. Además, las salidas pueden permanecer almacenadas en búfer hasta el final de la ejecución, lo que hace poco práctico supervisar entrenamientos prolongados.
Cómo funciona la habilidad dentro de PyCharm
La habilidad expone ante el agente las capacidades de PyCharm para trabajar con cuadernos y núcleos activos mediante un único envoltorio MCP llamado execute_tool. Este envoltorio abarca la creación, modificación y lectura de cuadernos; la ejecución de celdas; la espera hasta que finalicen las operaciones prolongadas; la inspección del núcleo durante la ejecución; y el control de su ciclo de vida.
El agente escribe código Python real dentro de una celda y luego lo ejecuta directamente en el núcleo, de modo que las variables, los modelos y los datos persisten entre las celdas, como ocurre al utilizar el cuaderno manualmente. Al ejecutar una tarea prolongada, la herramienta wait_cell_execution espera hasta que termine la celda o se alcance un límite seguro, en lugar de realizar consultas repetidas según un temporizador fijo. Asimismo, el agente lee únicamente la parte nueva de las salidas transmitidas, en vez de volver a enviar cada vez toda la salida creciente de la celda.
Pruebas de costes y resultados
JetBrains probó la habilidad utilizando 12 tareas del estándar MLGym para aprendizaje automático, que incluían clasificación, regresión y aprendizaje por refuerzo, y cada una requería cargar los datos, entrenar el modelo, evaluarlo y guardar el resultado. La empresa comparó tres modos: utilizar únicamente Bash, utilizar únicamente un núcleo Jupyter y combinar el núcleo con Bash.
En el caso de Claude Opus 5, el coste de ejecutar las tareas mediante el núcleo fue de 59,09 dólares, frente a 67,06 dólares mediante shell, es decir, aproximadamente un 12 % menos. La empresa afirma que el núcleo utilizó un número mayor de tokens, pero tuvo un coste menor gracias a mantener activa la memoria caché de solicitudes; las lecturas de la caché representaron el 98 % de las entradas, frente al 82 % en el modo shell, y la lectura de la caché se contabiliza con un coste equivalente a una doceava parte del coste de crear una memoria nueva.
Los resultados indicaron que la ventaja depende del modelo y de la tarea. Fue más clara con Claude Opus en trabajos prolongados que conservan el estado, mientras que shell resultó menos costoso en tareas cortas y con modelos Codex, que ya utilizan la memoria caché de forma eficiente. En estos casos, el valor de la habilidad consiste principalmente en mejorar el flujo de trabajo, no en reducir el coste.
Limitaciones de uso y disponibilidad
JetBrains indicó que una de las tareas, Titanic, estaba afectada por contaminación en el estándar, ya que los agentes pudieron consultar el conjunto de prueba y utilizarlo para seleccionar el modelo final. La empresa afirma que el problema apareció en los tres modos y que, al excluir la tarea, el núcleo siguió siendo menos costoso con Opus en un 10 %, con 56,34 dólares frente a 62,65 dólares mediante shell.
La habilidad no garantiza el guardado automático de las salidas; en uno de los experimentos, un agente terminó después de entrenar un buen modelo sin guardar el archivo de envío. La empresa recomienda añadir instrucciones claras en el archivo de contexto, como CLAUDE.md, o dentro de otra habilidad para guardar el modelo en cuanto alcance el criterio requerido. También subraya que la herramienta reduce el desperdicio operativo, pero no convierte una metodología débil de aprendizaje automático en una solución sólida, ya que algunas tareas pueden seguir necesitando intervención humana.
La habilidad se puede probar mediante AI Chat en PyCharm 2026.2.1 pidiendo al agente que trabaje en un cuaderno, cree un cuaderno, cargue un conjunto de datos o inicie un entrenamiento. El entorno de desarrollo también permite explorar y administrar habilidades, añadir bibliotecas externas desde registros como repositorios públicos de GitHub o importar habilidades preparadas para Claude Code o Codex.