FundadorSupremo.
EL CUADERNO INCÓMODO DE LA IA PROFESIONAL
HECHO EN CASTELLANO, A PROPÓSITOEN CASTELLANO
Volver al archivo
EXPEDIENTE 31/Coste real/ANÁLISIS + FUENTES

Si comprobarlo cuesta lo que hacerlo, la IA no te ahorra nada.

La IA no se juzga por lo rápido que escribe, sino por lo que tardas en fiarte de lo que escribió. La regla para saber qué tarea darle y cuál es una trampa de tokens.

Lanzas cinco agentes en paralelo porque tienes prisa y porque mola. Muy futurista todo. Hasta que llega la factura y te preguntas si ha servido de algo.

Un diseñador de Yutori, Maximilian Piras, dio este año una charla titulada "los agentes que no se pueden medir, no se pueden gestionar". La vi entera. Y debajo del titular de conferencia hay la regla más útil que le he oído a nadie sobre cuándo usar IA en un despacho y cuándo estás tirando el dinero. Fuente primaria ↗

El problema no es que la IA sea cara. Es que no sabes si valió la pena

Piras lo llama un problema de medición. Compramos tokens, lanzamos agentes, y a fin de mes tenemos un gasto y ninguna forma limpia de atarlo a un resultado. "Gastamos de más y usamos de menos", dice, en un bucle donde nos pasamos de tokens hasta la resaca y luego nos escondemos hasta que vuelve el FOMO.

Te sonará. Cronometras lo que la IA tarda en escribir el borrador, treinta segundos, y no cronometras lo que tú tardas en comprobar que ese borrador no te mete un gol. Esa es la cuenta que nadie enseña en la demo.

Caballos de vapor, para que se entienda

Para explicarlo, Piras se va a 1770 y a James Watt vendiendo máquinas de vapor. En la época, la fuerza de un molino la daba un caballo dando vueltas a una noria. Watt tenía una máquina mejor, pero la gente pensaba en caballos, no en pistones. Así que se inventó una medida: el caballo de vapor. Ni científica ni exacta. Pero le daba al cliente una forma de calcular lo que ganaba y, sobre todo, de atreverse a probar.

La lección para hoy: si no le das a alguien una forma tangible de ver el retorno, no le vendes la máquina, por buena que sea. Y en la IA todavía no tenemos ese caballo de vapor. Tenemos tokens, que son un gasto, no un resultado.

La regla que sí puedes usar mañana

Aquí está lo que me llevo, y lo que te sirve en un despacho. Piras propone mirar cada tarea en dos ejes. Uno: cuánta incertidumbre hay en los pasos para hacerla. Dos, y este es el bueno: cuánta incertidumbre hay en comprobar que está bien hecha. De ahí salen tres cajones.

El cajón del script. Tareas con pasos muy predecibles. Sacar las casillas de un modelo 303 que siempre van en el mismo sitio. No gastes un agente de IA en esto: es un script. Matar moscas a cañonazos, pero pagando el cañón por disparo.

El punto dulce. Tareas que cuestan hacerse pero se comprueban de un vistazo. "Encuéntrame la referencia del CENDOJ de esta doctrina." Buscarla es un marrón. Comprobar que existe es abrir el enlace. Ahí la IA vuela, porque verificar sale barato. Piras lo compara con los problemas tipo NP: más fáciles de comprobar que de resolver.

La trampa de tokens. Tareas donde comprobar cuesta lo mismo que hacer. Clasificar un asiento contable con matiz. Redactar el argumento jurídico fino de un caso raro. Para saber si el agente acertó, tienes que rehacer el razonamiento tú. La IA no te ha ahorrado nada: ha movido el trabajo de la mesa a la revisión, y encima te ha cobrado el viaje.

Esa es la frase para tatuarse: si comprobarlo cuesta lo mismo que hacerlo, la IA no te ha ahorrado, te ha cambiado el marrón de sitio.

Y no lo digo yo. Lo dice hasta quien la fabrica

Lo bonito es que esto no es una manía de escéptico. Anthropic, que hace uno de los modelos que uso, ha reconocido que "la revisión de código se ha convertido en un cuello de botella": los agentes generan más rápido de lo que un humano revisa. Fuente primaria ↗ Y los datos del sector lo rematan: según el informe de LinearB de 2026, el código escrito por IA suspende la primera revisión el 67% de las veces, frente al 16% del humano, llega un 154% más gordo y trae un 75% más de errores de lógica. Fuente primaria ↗

¿Y cuál es la solución que ha sacado Anthropic? Más agentes. Un equipo de agentes que revisa lo que escribió el otro agente, a quince dólares la revisión. La pescadilla mordiéndose la cola. No digo que esté mal: digo que hasta el que fabrica la máquina admite que el problema es verificar, no generar.

Y un grupo de Stanford, revisando 84 estudios, encontró que el 83% mide a los agentes por métricas técnicas y solo el 30% por su valor real cuando alguien los usa. Un agente médico con un 95% de acierto en el laboratorio acabó relegado a dar consejitos, porque en la vida real nadie se fiaba. Fuente primaria ↗ El benchmark bonito no es el trabajo hecho.

Lo que te llevas al despacho

No preguntes cuánto genera la IA. Pregunta cuánto tardas en comprobar que sirve. Si la respuesta es "un vistazo", adelante, es tuya. Si la respuesta es "tengo que rehacerlo para saberlo", cierra el chat y hazlo tú, que sale más barato y firmas con la conciencia tranquila.

La IA no se mide en lo rápido que escupe. Se mide en lo rápido que puedes fiarte de lo que escupió. Dale solo lo que se comprueba solo.

Lo que me preguntan cuando cierro el portátil.

¿Cuándo merece la pena usar IA para una tarea del despacho?

Cuando hacerla cuesta esfuerzo pero comprobar el resultado es rápido. Buscar una referencia de jurisprudencia es un buen ejemplo: encontrarla lleva su tiempo, verificar que existe es abrir el enlace. Cuando comprobar cuesta lo mismo que hacer, como clasificar un asiento con matiz o redactar un argumento fino, la IA no ahorra: mueve el trabajo a la revisión.

¿Por qué la IA no me ahorra tanto tiempo como prometía?

Porque el tiempo no desaparece, se muda. El borrador sale en segundos, pero comprobar que no tiene un error que te comprometa lleva su rato, y ese rato no sale en la demo. Hasta Anthropic ha reconocido que la revisión se ha convertido en el cuello de botella: generar se hizo rápido, verificar no.

¿Qué significa medir el valor de un agente y por qué importa?

Es atar el gasto en tokens a un resultado concreto: cuántas tareas cerró bien, no cuántas palabras generó. Un estudio de Stanford sobre 84 trabajos encontró que casi todos miden a los agentes por métricas técnicas de laboratorio y muy pocos por su valor real cuando alguien los usa. Un buen número en el benchmark no es lo mismo que trabajo hecho.

El expediente detrás del artículo.

Mousepower: agents that can't be measured, can't be managed ↗Maximilian Piras, Yutori · AI Engineer World's Fair · 2026
Charla de conferencia
Anthropic: la revisión de código se ha convertido en un cuello de botella ↗IT Pro · sobre Code Review para Claude Code, 9 de marzo · 2026
Cobertura técnica
2026 Software Engineering Benchmarks Report ↗LinearB · vía DevOps.com · 2026
Informe de sector
The Measurement Imbalance in Agentic AI Evaluation Undermines Industry Productivity Claims ↗Kochenderfer y otros, Stanford · arXiv 2506.02064 · 2025
Preprint; revisión de 84 estudios

Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.

Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.

Busca una idea. O una grieta.

BUSCA EN EL TEXTO COMPLETO · ↑ ↓ PARA MOVERTE · ESC PARA CERRAR

El cuaderno.

Kenyi & el criterio

Copia con contexto.

Tu navegador no permite copiar automáticamente. Selecciona este texto y cópialo.