Usar un modelo de lenguaje para leer «50k» es pagar oro por lo que cuesta cero.
Estoy montando un simulador de impuestos donde el cliente habla como habla: «facturaré entre 50 y 70 mil, me mudo a Valencia en marzo, tengo dos hijos». Esa frase lleva dos cosas muy distintas dentro. La regla que sostiene el sistema decide cuál va a una regex y cuál a un modelo al que le está prohibido escribir.
«Facturaré entre 50 y 70 mil, me mudo a Valencia en marzo, tengo dos hijos.» Esa frase la dice un cliente como la dice, sin formulario. Estoy montando un simulador de impuestos pensado para entenderla. Y la decisión de diseño que sostiene todo el sistema cabe en una línea: dentro de esa frase hay dos cosas muy distintas, y cada una va a una herramienta distinta.
Están los números: 50 y 70 mil, dos hijos, marzo. Y está el significado: ¿Valencia capital o Comunitat Valenciana? ¿Vivienda habitual? ¿Qué renta domina el año del traslado? Mezclarlas es el error de diseño más caro del proyecto.
Los números, ni regalados
Para leer los números no llamo a ningún modelo. Los lee una expresión regular. Cuesta cero y tarda nada. Cada regla suya se audita línea a línea, y no hace falta sacar los importes del despacho para que una máquina los copie.
Usar un modelo de lenguaje para leer «50k» es pagar oro por lo que cuesta cero. Y no es solo el dinero. Un trozo de código determinista falla siempre igual y en el mismo sitio, que es justo lo que quieres de algo que alimenta un cálculo. Un modelo falla de maneras nuevas.
El significado, a un juez que no escribe
Lo que no entiende una regex es el matiz. Para eso elegí un juez al que le prohibí escribir.
Jev es un modelo hecho para juzgar en vez de redactar. Lo presentó TypeSafe AI en septiembre Fuente primaria ↗. Su cofundador, Diogo Almeida, trabajó en OpenAI y figura entre los autores del InstructGPT Fuente primaria ↗. El trato es este: tú defines las preguntas y las opciones permitidas. El modelo no suelta un párrafo. Devuelve la opción elegida con su distribución de probabilidad y un nivel de confianza Fuente primaria ↗.
En la prensa técnica que lo revisó, el ejemplo es una tienda con un cobro duplicado: el sistema pregunta de qué trata el mensaje y qué quiere el cliente, si su dinero o una explicación Fuente primaria ↗. Mi versión fiscal se parece mucho: «Valencia» se refiere a la ciudad o a la Comunitat. Ciudad. Comunitat. No lo sé. La tercera opción es la que hace honesto al sistema, y es la que un formulario cerrado no suele ofrecer.
La factura ayuda a meter varias preguntas cerradas en cada simulación. El vendedor anuncia respuestas entre 70 y 500 milisegundos, varias preguntas en paralelo y 0,042 dólares por millón de tokens de entrada, sin cobrar las salidas Fuente primaria ↗. Son cifras del propio vendedor: las tomo como orden de magnitud, no como promesa.
La regla que sostiene el sistema
Si Jev duda, el simulador pregunta al cliente. Nunca simulo sobre una adivinanza. En fiscal, una suposición silenciosa es un bug: si el sistema asume que Valencia era la ciudad y el cliente hablaba de la Comunitat, el resultado puede salir mal entero, con buena pinta. Es la supervisión del expediente 01 bajada a su versión más pequeña: no es que una persona revise cada paso, es que la decisión de avanzar o preguntar la marca la confianza que declara el clasificador.
Esa regla no la estoy estrenando. Mi enrutador de correos del despacho clasifica mensajes con la misma arquitectura: banda de confianza 0,7. Por debajo de la banda, no decide: avisa a una persona. En 45 casos reales, cero errores graves. Ojo con lo que eso prueba y lo que no: valida el patrón de la banda, no este modelo ni este dominio. El simulador tendrá su propia validación fiscal antes de tocar un cliente, y si no la pasa, no se publica.
Y una llamada por simulación, con timeout de tres segundos y sin reintentos. Si el juicio no llega, el simulador pide los datos a mano. Un clasificador no puede cobrarte por repetirse.
Lo que Jev tiene prohibido
Calcular. El cálculo lo hace mi motor, en Decimal y auditable: 306 casillas y 168 deducciones. Si un modelo genera números, ya no tengo motor: tengo una encuesta.
Extraer importes. Eso ya lo hace la regex: gratis y sin enviar nada fuera.
Redactar el informe. Para eso está el otro agente, con la salida de la simulación delante.
Y seguir interviniendo cuando ya no hace falta. En cuanto el formulario está completo, Jev se retira. Es el recepcionista inteligente del simulador, no su autor.
Lo que la garantía no garantiza
El vendedor dice que Jev no puede alucinar. Leído fino, la garantía es de estructura: el modelo no contesta nada fuera de las opciones que le diste. Elegir mal dentro de las opciones sigue siendo posible Fuente primaria ↗. Por eso existe la banda de confianza y la pregunta al cliente: el formato no me libra del error de juicio.
Tampoco me compro el formato como novedad. Los modelos grandes ya devuelven categorías y estructuras fijas Fuente primaria ↗. Lo que me interesa es otra cosa: prohibir la generación donde basta un juicio, y poder meter esas preguntas en cada simulación porque salen baratas y rápidas. El día que otro modelo haga lo mismo más barato, cambia el nombre y la regla sigue.
Sus pruebas públicas tienen un límite que la prensa técnica que lo revisó señala sin rodeos: las comparó la propia casa, con flujos suyos y usando respuestas de otros modelos como referencia, no soluciones verificadas de forma independiente Fuente primaria ↗. Yo estoy en el mismo sitio con mi simulador: la validación del patrón la tengo; la del producto, pendiente. No lo pondría delante de un cliente sin ella.
Usa el modelo para juzgar. Prohíbele escribir. Y cuando dude, que pregunte.
Lo que me preguntan cuando cierro el portátil.
¿Qué es Jev y en qué se diferencia de un chatbot?
Es un modelo de la casa TypeSafe AI, presentado en septiembre de 2026. No genera texto: recibe preguntas con un conjunto cerrado de opciones y devuelve la opción elegida con su distribución de probabilidad y un nivel de confianza. Su cofundador, Diogo Almeida, trabajó en OpenAI y figura entre los autores del InstructGPT. La diferencia con un chatbot es que aquí el programa que llama decide qué se pregunta y qué respuestas son admisibles; el modelo puntúa, no improvisa.
¿Por qué extraer los números con una regex y no con un modelo?
Porque extraer «entre 50 y 70 mil» es un problema determinista, y a los problemas deterministas les sienta mejor código normal: cuesta cero y se audita línea a línea. Falla siempre igual, que es justo lo que quieres de algo que va a alimentar un cálculo. Un modelo de lenguaje para esa tarea cuesta dinero por llamada y tarda. Y añade una manera nueva de fallar, con buena pinta.
¿Qué pasa cuando el clasificador duda?
Que no decide. Si la confianza no llega a la banda, el simulador pregunta al cliente antes de seguir. En fiscal, una suposición silenciosa es un bug: si el sistema asume que «Valencia» es la ciudad y el cliente hablaba de la Comunitat, el resultado puede salir mal con buena cara. La misma regla la validé en el enrutador de correos del despacho: banda de 0,7 y, por debajo, aviso humano. Cero errores graves en 45 casos.
El expediente detrás del artículo.
Why Jev ↗Diogo Almeida, TypeSafe AI · AI Engineer World's Fair, track Posttraining & Midtraining, 1 de julio · 2026Charla de conferencia de parte interesadaFormer OpenAI researcher builds an AI model that judges options instead of writing text ↗The Decoder · 16 de septiembre · 2026
Prensa técnicaPrimitives: preguntas con opciones cerradas ↗Documentación oficial de TypeSafe AI · docs.typesafe.ai/primitives · 2026
Documentación del producto
Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.
Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.