FundadorSupremo.
EL CUADERNO INCÓMODO DE LA IA PROFESIONAL
Volver al archivo
EXPEDIENTE 16/Promesa y prueba/ANÁLISIS + FUENTES

Tu pitch deck afirma. Tu producto todavía promete.

Casi todo lo que suena a dato en esas páginas describe una intención bien redactada. La diferencia se cobra tarde, cuando la frase ya viajó hasta el contrato.

La diapositiva dice precisión. No dice sobre qué conjunto de casos se midió esa precisión ni quién eligió el conjunto. Como afirmación es impecable. Como prueba no existe.

Este cuaderno se ocupa de lo que alguien puede demostrar cuando se lo piden. Aplicar esa exigencia a un documento de presentación resulta incómodo, porque casi todo el mundo ha acordado no aplicarla ahí. Yo la aplicaría igual. Esas frases sobreviven al documento y acaban en un contrato.

Qué afirma un pitch deck de IA y qué puede sostener

Hay dos clases de frase en esas páginas y se parecen demasiado. Una describe algo que ocurrió y que alguien puede volver a comprobar. La otra describe algo que ocurrirá si se cumplen condiciones que la propia página no menciona.

«El sistema procesó los expedientes de un trimestre entero en producción» pertenece a la primera clase. Tiene fecha y tiene un volumen que alguien puede volver a contar. «El sistema automatiza el proceso de principio a fin» pertenece a la segunda, y no porque sea mentira, sino porque calla qué ocurre con el caso que se sale del patrón.

La segunda clase se escribe en presente de indicativo precisamente porque el futuro delata que todavía no está hecho. Escrita así, el lector la archiva como dato y sigue leyendo.

Precisión es una palabra, no una medición

Cuando leo precisión quiero saber sobre qué se midió. Un porcentaje sin su conjunto de referencia no informa de nada, porque cambiar el conjunto mueve el número sin tocar una línea de código. Los casos raros, que son los que producen las reclamaciones, apenas pesan dentro de un promedio.

Lo que preguntaría es aburrido. Qué casos entraron en la medición y en qué fecha se hizo, porque un sistema actualizado hereda el número del anterior con una facilidad que asusta.

Y preguntaría por la medida contraria: cuántas veces el sistema dio por bueno algo que no lo era. Ese dato existe siempre, porque para calcular el primero hubo que calcular este. Que no aparezca en la página no significa que nadie lo tenga.

«Automatización completa» describe una entrada, no un proceso

Un proceso no termina cuando el sistema produce la salida. Termina cuando alguien la da por buena y carga con las consecuencias. Entre esos dos puntos vive un trabajo que la palabra completa borra de un plumazo: mirar el resultado y decidir si se acepta. Ese trabajo cambia de sitio y cambia de persona.

Lo comprobable aquí no es el adjetivo. Es qué proporción de casos llegó al final sin que nadie tocara nada, medida sobre entradas reales. Ese dato lo tiene cualquiera que haya puesto el sistema a funcionar de verdad. Que no aparezca es, en sí mismo, la información.

La productividad es el número que peor envejece

La promesa de ahorro es la que más veces he visto sostenida sobre nada. No lo achaco a la honestidad de nadie: medirlo bien es difícil incluso cuando alguien lo intenta en serio.

En 2025, METR montó un experimento con desarrolladores experimentados sobre proyectos que ya conocían. Con las herramientas evaluadas, el trabajo salió más lento en lugar de más rápido Fuente primaria ↗. Ese titular circuló después como si fuera una ley de la naturaleza. Meses más tarde, la propia METR matizó su continuación del experimento: admitía sesgos de selección y consideraba probable una mejora del efecto, sin poder cifrarla con fiabilidad Fuente primaria ↗.

Me interesa menos el resultado que la conducta. Un equipo dedicado a medir esto, sin producto que vender, tardó meses en decir con cuánta confianza sabía lo que creía saber. Una página que anuncia un ahorro redondo, sin decir sobre qué tarea ni contra qué línea de partida, no ha hecho ese trabajo. Ha hecho una división.

El cumplimiento normativo no se enseña con un logotipo

La página de cumplimiento suele ser la más tranquila del documento y la que menos dice. Aparece un sello y el asunto queda cerrado.

ISO/IEC 42001 especifica requisitos para establecer y mantener un sistema de gestión de inteligencia artificial dentro de una organización Fuente primaria ↗. Una certificación así acredita eso: que existe un procedimiento y que alguien lo ha auditado. No dice que una salida concreta sea correcta, y nadie prometió que lo dijera.

La pregunta que hace ruido en una sala es qué sistema cubre exactamente ese certificado y con qué fecha se emitió. Si eso no se puede enseñar, lo que hay es un logotipo.

La prueba negativa: enseña lo que el sistema no hizo

Todos los ejemplos apuntan en la misma dirección. El sistema recibió algo y produjo algo correcto. Es información, pero es la mitad barata. La otra mitad es qué pasó cuando la entrada no encajaba con ningún patrón conocido, y esa mitad nunca se presenta sola.

Yo pediría dos piezas. Una operación que el sistema se negó a ejecutar, con el motivo. Y un caso donde se equivocó, con cuánto tiempo pasó hasta que alguien lo vio.

La segunda incomoda a cualquiera que esté enseñando su producto, y por eso vale. Un sistema del que nadie sabe contar un fallo concreto es un sistema que nadie ha llevado lo bastante lejos, o uno cuyos fallos no se están detectando. Las dos lecturas son malas y la segunda es peor.

Un fallo contado con detalle demuestra que existe un mecanismo capaz de darse cuenta. Eso separa un producto en producción de una demostración larga. No se puede simular en una diapositiva porque exige haber estado ahí.

La frase que envejece mientras nadie la mira

Nadie relee estas páginas mientras todo funciona. Se releen cuando alguien reclama o cuando el producto tiene que hacer exactamente lo que la presentación decía que hacía.

Para entonces la frase ha viajado. De la presentación pasó a la web. De la web pasó al contrato, perdiendo los matices que quizá alguien dijo en voz alta en una reunión y nadie escribió.

Lo que más veces he visto complicarse no es la afirmación falsa. Es la afirmación verdadera dentro de un contexto que ya no existe. Se midió con un modelo ya sustituido, sobre un tipo de documento que el cliente nuevo no usa. Nadie mintió y la frase ya no describe nada.

Lo que preguntaría al margen de cada afirmación

No haría una lista ni un baremo. Haría una sola pregunta delante de cada frase que suene a hecho: qué tendría que enseñarme alguien para que dejara de ser una promesa.

Cuando la respuesta es que habría que preparar algo, ya sé en qué clase de frase estoy. Y cuando la respuesta es que se ve en la demostración, sé que la frase describe un recorrido que alguien preparó para que saliera bien.

Nada de esto va contra quien escribe la página. Va contra la costumbre de que nadie pregunte. Aplico lo mismo a lo que publico aquí: si afirmo algo que no puedo enseñar, es opinión, y me toca decirlo con esa palabra.

Una afirmación que solo puede comprobarse creyéndote no es una afirmación. Es un compromiso que todavía no sabes que has firmado.

Lo que me preguntan cuando cierro el portátil.

¿Qué afirmaciones de un pitch deck se pueden comprobar?

Las que describen algo que ya ocurrió y dejó rastro. Un volumen procesado en un periodo concreto se puede volver a contar. Una medición se puede repetir si alguien dice sobre qué casos se hizo y con qué versión del sistema. Lo que describe capacidad futura no es comprobable por definición, y eso no lo convierte en falso. Lo convierte en una promesa, que se lee de otra manera.

¿Qué significa una precisión anunciada sin más contexto?

Poco. Un porcentaje depende del conjunto de casos donde se midió, y ese conjunto lo elige quien hace la medición. Cambiando la selección cambia el número sin que el sistema haya mejorado en nada. Sin saber qué entró en la muestra y en qué fecha, la cifra informa del criterio de quien la calculó bastante más que del producto.

¿Qué es la prueba negativa y por qué pedirla?

Es enseñar lo que el sistema no hizo. Una operación que se negó a ejecutar y su motivo. O un caso donde se equivocó y cómo se detectó el error. Un producto del que nadie sabe contar un fallo concreto suele ser un producto poco usado, o uno cuyos errores no se están detectando. Poder contar el fallo demuestra que existe un mecanismo capaz de verlo, y eso vale más que otro ejemplo de acierto.

El expediente detrás del artículo.

Productividad con IA: experimento de 2025 ↗METR · Becker y colaboradores · 2025
Estudio experimental / preprint
METR revisa cómo mide la productividad ↗METR · actualización del 24 de febrero · 2026
Actualización de investigación
ISO/IEC 42001:2023 ↗International Organization for Standardization · 2023
Norma de sistema de gestión de IA

Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.

Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.

Busca una idea. O una grieta.

BUSCA EN EL TEXTO COMPLETO · ↑ ↓ PARA MOVERTE · ESC PARA CERRAR

El cuaderno.

Kenyi & el criterio

Copia con contexto.

Tu navegador no permite copiar automáticamente. Selecciona este texto y cópialo.