La empresa TypeSafe AI ha lanzado el modelo Jev, un modelo de inteligencia artificial basado en una arquitectura Transformer, pero que no pertenece a la categoría de los grandes modelos de lenguaje ni produce textos para el usuario. En su lugar, el modelo devuelve probabilidades de lo que la empresa denomina «decisiones calibradas», después de que el desarrollador haya definido previamente los tipos de resultados requeridos.
La empresa está dirigida por Diogo Almeida, antiguo investigador de OpenAI que participó en la creación de ChatGPT y contribuyó al desarrollo de la técnica de aprendizaje por refuerzo a partir de la retroalimentación humana (RLHF). Almeida afirma que los modelos de inteligencia artificial se han centrado en gran medida en mejorar la interacción con el lenguaje humano, mientras que la automatización del software necesita resultados más disciplinados y directamente utilizables por el ordenador.
Mayor velocidad y menor coste
TypeSafe AI afirma que evitar la generación de lenguaje hace que Jev sea rápido y barato, y también reduce la probabilidad de alucinaciones, porque el usuario define previamente los resultados posibles. La empresa no cobra por los tokens de salida, mientras que los tokens de entrada se miden por miles de millones en lugar de por millones, según el material de origen.
El modelo atrajo rápidamente el interés de los desarrolladores, hasta el punto de que su interfaz de programación de aplicaciones dejó temporalmente de prestar servicio a los usuarios debido al aumento de la demanda. En una prueba realizada por Vercel para clasificar comandos con el objetivo de revisarlos desde el punto de vista de la seguridad, sustituir un modelo de OpenAI por Jev produjo resultados entre cinco y 18 veces más rápidos, con mayor precisión, según el ingeniero de software Pranit Sharma.
En otra prueba para clasificar correos electrónicos comerciales, Nikhil Mudholkar, director técnico de Bryo AI, descubrió que Gemini era ligeramente más preciso, pero entre 10 y 20 veces más caro. Mudholkar consideró que las puntuaciones de confianza que devuelve Jev son más importantes para la automatización, porque ofrecen una probabilidad que puede utilizarse para decidir si debe ejecutarse una acción o ignorarse.
¿Qué cambia en la práctica?
Estos usos muestran que Jev no pretende necesariamente sustituir a los modelos de lenguaje en todas las tareas. Puede encargarse de tareas de clasificación, dirigir las solicitudes al modelo adecuado, supervisar los efectos de los agentes de inteligencia artificial o detectar intentos de eludir las restricciones. En estos escenarios, la velocidad y el bajo coste pueden hacer más viable la supervisión en tiempo real.
Sin embargo, depender de las probabilidades no elimina la necesidad del juicio humano ni de reglas operativas. Armin Ronacher, director técnico de Earendil, señaló que el usuario debe definir cómo tratar una puntuación como el 50 % o el 95 %, es decir, establecer umbrales claros antes de convertir los resultados en acciones automatizadas. De este modo, parte de la responsabilidad de gestionar la incertidumbre pasa del modelo al diseño de la aplicación.
Arquitectura no revelada y competencia inminente
TypeSafe AI no ha revelado detalles de la arquitectura de Jev, mientras que observadores externos sospechan que podría estar construido sobre un modelo de lenguaje de pesos abiertos, algo que la empresa no confirmó en el material. TypeSafe AI describe el modelo como un «modelo System One» centrado en la intuición y en elegir la tarea adecuada, y afirma que fue entrenado exclusivamente con datos sintéticos mediante una técnica que denomina «aprendizaje por refuerzo a partir de decisiones calibradas».
La lectura de certi.news considera que la importancia de Jev no reside únicamente en que sea un modelo nuevo, sino en que plantea la inteligencia artificial como una capa de decisión especializada dentro del software, en lugar de como una interfaz de conversación general. Si los resultados de las pruebas mencionadas son correctos, este enfoque podría ser adecuado para tareas repetitivas con resultados definidos. Sin embargo, las comparaciones publicadas son limitadas y por sí solas no bastan para evaluar el rendimiento en distintos ámbitos o cargas de trabajo; además, la falta de claridad sobre la arquitectura y el método de producción de los datos deja abiertas preguntas sobre la verificabilidad y la escalabilidad.
TypeSafe AI planea crear otras versiones del modelo en diferentes modalidades, y Ronacher espera que aparezcan competidores una vez que se aclare la utilidad práctica de este tipo de modelos.