FundadorSupremo.
EL CUADERNO INCÓMODO DE LA IA PROFESIONAL
HECHO EN CASTELLANO, A PROPÓSITOEN CASTELLANO
Volver al archivo
EXPEDIENTE 24/Verificación de citas/ANÁLISIS + FUENTES

Las máquinas acertaron el artículo. El libro, no.

Tres modelos contestaron las mismas 56 preguntas sacadas de un glosario jurídico, sin internet y sin el libro delante. Los fallos no aparecieron donde se esperaban, y uno de ellos venía impreso.

«Se lo he preguntado a la IA y me ha dicho que sí». Vale. Y si te lo hubiera dicho un libro con ISBN, dirección académica de dos catedráticos y financiación pública, ¿lo habrías comprobado?

Casi todo lo que se escribe sobre alucinaciones jurídicas parte de la misma comodidad: la máquina se inventa cosas y el libro no. Quería saber si eso sigue siendo verdad, así que monté un examen. No lo monté contra la máquina. Lo monté contra las dos partes.

Qué hice exactamente

Cogí un glosario jurídico de inteligencia artificial publicado en acceso abierto, obra colectiva de cerca de cincuenta autores, y lo leí entero. Fuente primaria ↗ De ahí saqué 56 preguntas con respuesta corta y verificable: artículos, apartados, fechas, autorías, números de norma.

Se las hice a tres modelos a puerta cerrada, sin internet, sin herramientas y sin el libro delante. Es la situación real del profesional que abre un chat un martes a las ocho. A cada uno le pedí que declarara su confianza de 0 a 100, y le dije que «no lo sé» era preferible a una respuesta inventada.

ModeloAciertosErroresNo lo séErrores por encima del 70% declarado
Claude Opus 5430130
GPT-5.640794
Grok 4.6282260

Las 168 respuestas literales, con su confianza y la fuente de cada respuesta correcta, están en el anexo: anexo probatorio completo (PDF, 14 páginas) ↗. Si algún recuento no te cuadra, ahí está el material para rebatirme.

Donde no fallaron, y conviene decirlo

Los tres aciertan el articulado del Reglamento europeo de inteligencia artificial con precisión de apartado. Supervisión humana, gestión de riesgos, gobernanza de datos, la prohibición de evaluar el riesgo delictivo por perfilado de la personalidad, la clasificación de alto riesgo con su anexo, la fecha de entrada en vigor. Y en la segunda ronda, hasta el apartado numerado que define la ultrasuplantación y el título literal del derecho a explicación. Fuente primaria ↗

La tesis de que estas herramientas no saben Derecho positivo europeo no se sostiene con estos datos. Quien la siga repitiendo está describiendo un producto de hace tres años.

El fallo que sí entra en un escrito

Pregunté por los dos Reglamentos de Ejecución que desarrollan las especificaciones técnicas de e-CODEX, el sistema europeo de intercambio judicial.

Un modelo contestó que eran el 2023/1690 y el 2023/1691, con un 75% de confianza declarada. Son el 2026/101 y el 2026/102, de 15 de enero de 2026. Fuente primaria ↗ Otro modelo, con la misma pregunta, contestó «no lo sé».

Ahí está el problema, y no es que la máquina no sepa. Un número de reglamento inventado es indistinguible de uno real para quien no lo comprueba. No tiene faltas de ortografía, no suena raro, no pide permiso. Entra en un escrito con la misma cara que una cita buena, y sale por la puerta con tu firma debajo.

La confianza que te declara no sirve para decidir

Pregunté qué artículo del Reglamento de IA obliga a la Comisión a revisar periódicamente la lista de ámbitos de alto riesgo, esa donde figura la administración de justicia.

Un modelo contestó el artículo 112, que es el correcto y se titula «Evaluación y revisión», declarando un 35% de confianza. Otro contestó el 111, que regula los sistemas ya introducidos en el mercado, declarando un 70%. Fuente primaria ↗

Acertó el que dudaba. Dentro de un mismo modelo el porcentaje es una señal débil; entre modelos distintos no vale nada. Si tu proceso de revisión se apoya en que la herramienta avise cuando no está segura, tu proceso no existe.

Abstenerse es un resultado

El modelo que menos acertó dijo «no lo sé» 26 veces de 56, casi todas sobre instrumentos de 2026: la Instrucción 2/2026 del Consejo General del Poder Judicial Fuente primaria ↗, la fecha de aprobación del Proyecto de Ley Orgánica de gobernanza de la IA Fuente primaria ↗, las Directrices de la CEPEJ para los tribunales Fuente primaria ↗. Ese material es posterior a su corte de conocimiento, así que abstenerse era la respuesta correcta. El que rellena el hueco es el que se equivoca. Por eso conté las abstenciones en columna aparte: sumarlas a los errores convierte el buen comportamiento en penalización.

Y el libro también tenía un error

Esta es la parte que no esperaba. En la entrada sobre inversión de la carga de la prueba algorítmica, el glosario atribuye al artículo 9 de la Directiva (UE) 2024/2853 la flexibilización de la carga de la prueba en tres escenarios. Fuente primaria ↗

En el texto publicado, el artículo 9 es «Exhibición de pruebas». La carga de la prueba y sus presunciones están en el artículo 10, apartados 2 a 4. Fuente primaria ↗

Conviene ser preciso, porque la relación existe y alguien la usará como objeción: el artículo 10, apartado 2, letra a) remite expresamente al artículo 9, apartado 1, de modo que la falta de exhibición dispara la primera presunción. Las demás están en el 10.2.b), el 10.2.c) y el 10.4. Pero no es el 9 el que introduce la flexibilización. Es un error de cita, no de doctrina, y no cambia el fondo de la entrada.

Los tres modelos respondieron artículo 10. Y uno de ellos, preguntado otra vez por el número y el título literal, cambió al artículo 9 con un 45% de confianza: reprodujo el error del libro y se contradijo a sí mismo en media hora. Las dos cosas caben en el mismo expediente.

Lo que este examen no demuestra

No mide alucinación en redacción libre, que es donde se producen las sanciones reales. Mide preguntas cerradas de cita. Es una sola pasada por modelo, así que no hay medida de varianza. Y no es una comparación igualada: cada modelo corrió en la configuración por defecto de su herramienta, una de ellas con esfuerzo de razonamiento bajo. Mide lo que recibe quien abre la aplicación, no la capacidad máxima de nadie.

Dos puntuaciones son criterio mío y no del libro: en dos preguntas los modelos dieron una respuesta más precisa que la del glosario y se la conté como acierto. Van señaladas en el anexo. También corregí una vez mis propias cifras, al recontar respuesta por respuesta y encontrar un error que se me había pasado. Se corrige y se dice, que es lo mismo que le pido al libro.

La pregunta ya no es si la máquina sabe Derecho. Es si tú puedes enseñar de dónde salió el número. Y esa pregunta hay que hacérsela también al papel.

Lo que me preguntan cuando cierro el portátil.

¿Los modelos de IA se inventan las citas jurídicas?

Menos de lo que se dice, y peor de lo que parece. En un examen de 56 preguntas de cita, el mejor de los tres modelos no cometió ningún error y el peor cometió siete. El problema no es la frecuencia: es que el fallo se concentra en números de norma, fechas y autorías, que son lo único que un lector no distingue de una cita correcta sin abrir la fuente.

¿Sirve el porcentaje de confianza que da un modelo?

Dentro de un mismo modelo es una señal débil. Entre modelos distintos no sirve para nada. En una de las preguntas de este examen, el modelo que acertó declaró un 35% de confianza y el que falló declaró un 70%. Si tu control de calidad consiste en fiarte de cuándo la herramienta avisa de que duda, no tienes control de calidad.

¿Qué hago antes de citar una norma que me ha dado una IA?

Abrir la norma. No la referencia que te da la herramienta: el texto publicado, con su número y su fecha. Un número de reglamento inexistente se escribe igual que uno real. Y conviene aplicar la misma regla al manual, al glosario y al artículo de doctrina: en este examen, el libro que servía de patrón también tenía un artículo mal citado.

El expediente detrás del artículo.

Glosario básico de inteligencia artificial jurídica ↗Ediciones Laborum · dirección de Fernando H. Llano Alonso y José Ignacio Solar Cayón; ISBN 979-13-88025-85-3 · 2026
Obra colectiva en acceso abierto, licencia CC BY-NC-ND 4.0
Directiva (UE) 2024/2853 sobre responsabilidad por productos defectuosos ↗DOUE · artículo 9 exhibición de pruebas; artículo 10 carga de la prueba; transposición el 9 de diciembre de 2026 por el artículo 22.1 · 2024
Normativa UE; texto en el BOE
Reglamentos de Ejecución (UE) 2026/101 y 2026/102, especificaciones técnicas de e-CODEX ↗Recopilación DOUE en el BOE · fichas DOUE-L-2026-80043 y DOUE-L-2026-80044, de 15 de enero · 2026
Normativa UE de ejecución
Reglamento europeo de inteligencia artificial ↗EUR-Lex · Reglamento (UE) 2024/1689 · 2024
Normativa UE; comprobar versión y calendario
Instrucción 2/2026 del CGPJ sobre inteligencia artificial en la actividad jurisdiccional ↗BOE · 30 de enero · 2026
Instrucción del Consejo General del Poder Judicial
Proyecto de Ley Orgánica para el buen uso y la gobernanza de la inteligencia artificial, 121/000096 ↗Congreso de los Diputados · BOCG de 12 de junio · 2026
Proyecto de ley en tramitación
Directrices sobre el uso de la IA generativa por los tribunales, CEPEJ(2025)18Final ↗Consejo de Europa · Comisión Europea para la Eficacia de la Justicia, diciembre · 2025
Directrices de un organismo internacional, no vinculantes

Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.

Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.

Busca una idea. O una grieta.

BUSCA EN EL TEXTO COMPLETO · ↑ ↓ PARA MOVERTE · ESC PARA CERRAR

El cuaderno.

Kenyi & el criterio

Copia con contexto.

Tu navegador no permite copiar automáticamente. Selecciona este texto y cópialo.