Lo que pagas en una IA jurídica no es la inteligencia.
Un tribunal gallego multó a un abogado por 24 citas falsas y señaló como remedio una IA jurídica de pago. Entre paréntesis añadió otro: comprobar las citas en el CENDOJ, gratis. Entre las dos opciones cabe todo lo que el sector no te cuenta.
En mayo de 2026, la Sala de lo Social del Tribunal Superior de Justicia de Galicia leyó un recurso con citas del Tribunal Supremo y del Constitucional que, en palabras de la propia sentencia, «hilvanan un discurso coherente y ponderado». Veinticuatro de ellas eran falsas. La Sala lo comprobó en el CENDOJ Fuente primaria ↗.
En julio llegó la multa: 1.800 euros. Para calcularla, el tribunal buscó el «palmario remedio» y lo encontró en «una IA generativa especializada de pago». Tomó como referencia lo que, según la Sala, cuestan las del mercado español: entre 1.500 y 3.000 euros al año en sus planes básicos. Y luego, entre paréntesis, añadió la otra opción: «o, en su defecto, la simple comprobación de las citas a través del CENDOJ, de acceso gratuito y muy intuitivo» Fuente primaria ↗.
Ese paréntesis es el mejor resumen del sector que he leído este año. Entre la herramienta de 3.000 euros y la comprobación gratis cabe todo lo que no sale en las demostraciones comerciales.
¿Una IA jurídica es más lista que ChatGPT?
Con el ChatGPT de hace un año ya empataba. Vals AI, un evaluador estadounidense que declara tener relación comercial con alguno de los participantes, puso en julio de 2025 las mismas preguntas de investigación jurídica a tres herramientas especializadas, a ChatGPT y a un grupo de abogados. En exactitud, cuando llegaron a responder, las jurídicas puntuaron entre el 78 y el 81 %. ChatGPT, el 80 % Fuente primaria ↗. Y eso fue antes de GPT-5.6 Sol y de Claude Opus 5.
Con los modelos de este año, la única tabla que he encontrado que los pone frente a las plataformas jurídicas la ha publicado HAQQ, que también vende IA jurídica y se coloca primera. Lo avisa ella misma: trátalo como cualquier puntuación de un fabricante. Con esa cautela, en su prueba de junio de 2026, Claude Fable 5 sacó 42,7 puntos sobre 50 y Claude Opus 4.7, 40,8. Harvey, 37,9. CoCounsel, 36,6. Lexis+ AI, 32,0 Fuente primaria ↗.
Lo más revelador lo escribió el propio Harvey en mayo de 2025. Los modelos generales habían mejorado tanto en razonamiento jurídico básico que siete de ellos, integrados en su plataforma, ya superaban al sistema con el que Harvey se había medido al principio en su propio banco de pruebas, y su trabajo pasaba a centrarse en ejecutar tareas, incorporar el conocimiento del despacho y colaborar con el usuario Fuente primaria ↗. En 2026, un equipo de Stanford midió que Westlaw AI y Lexis+ AI acertaban menos, un 58 y un 64 %, que un sistema de recuperación estándar, al recopilar los requisitos del seguro de desempleo de todos los estados de Estados Unidos Fuente primaria ↗.
Hay un detalle que me gusta todavía más. Hubo fabricantes que en la primera edición del estudio de Vals se habían apuntado a la parte de investigación jurídica y que, cuando esa parte se separó en una prueba propia, decidieron no estar. Vals no dice quiénes ni por qué Fuente primaria ↗. En el expediente 17 conté que el benchmark lo elige quien te lo está enseñando. Aquí el problema es el contrario: el examen lo ponía otro, y algunos prefirieron no presentarse.
La inteligencia es alquilada
No es un secreto. Lo dicen los propios fabricantes. Aranzadi LA LEY presenta Allegra como la unión de su fondo jurídico con «Azure Open AI», el servicio de Microsoft con modelos de OpenAI, bajo «algoritmos patentados de Karnov Group» Fuente primaria ↗. Iberley explica que su asistente «utiliza tecnología GPT especializada en Derecho», desde 129 euros al mes Fuente primaria ↗. Thomson Reuters ha construido su nuevo CoCounsel Legal sobre el kit de agentes de Anthropic, la empresa de Claude Fuente primaria ↗.
Los grandes, además, están haciendo lo contrario de abandonar la especialización. Thomson Reuters ha entrenado un modelo propio partiendo de un modelo base de código abierto, en el que dice haber invertido 40 millones de dólares, y lo ha entrenado con el contenido de Westlaw, Practical Law y otras fuentes propias Fuente primaria ↗. Harvey ha presentado Tenet: parte de Kimi K3, un modelo de pesos abiertos, postentrenado para trabajo jurídico y presentado todavía como versión de investigación Fuente primaria ↗. Y el 9 de septiembre levantó 550 millones de dólares con una valoración de 15.500 millones Fuente primaria ↗.
No digo que sea un engaño. Hay mucha ingeniería encima del modelo. Digo que buena parte de esa inteligencia la alquilan a los mismos laboratorios a los que tú le alquilas ChatGPT o Claude.
Lo que sí pagas: la estantería
Entonces, ¿qué se paga? Según el mismo estudio de Vals, la cita. Las herramientas jurídicas sacaron de media 6 puntos más que ChatGPT en autoridad de las fuentes, que es respaldar la respuesta con citas pertinentes y válidas. Vals lo resume en una frase con fecha de caducidad incluida: las fuentes y las citas son lo que diferencia a la IA jurídica, «for now». Por ahora Fuente primaria ↗.
En España hay además un foso jurídico, no técnico. Las sentencias no tienen propiedad intelectual: el artículo 13 de la Ley de Propiedad Intelectual las excluye expresamente. Pero quien fabrica una base de datos con una inversión sustancial para obtener, verificar o presentar su contenido tiene un derecho propio, el «sui generis» del artículo 133, que le permite prohibir la extracción y la reutilización de la totalidad o de una parte sustancial de ese contenido Fuente primaria ↗. El texto de la sentencia no tiene dueño. La estantería donde está ordenada, anotada y cruzada con la doctrina, si detrás hay una inversión sustancial, sí.
Así que pagas la estantería. No el bibliotecario.
Inventan menos. Tergiversan igual.
Hace dos años, algunos fabricantes prometían eliminar o evitar las alucinaciones. Un equipo de Stanford puso esas promesas a prueba en 2024: Lexis+ AI, Westlaw AI-Assisted Research y Ask Practical Law AI dieron respuestas incorrectas o mal fundamentadas entre el 17 y el 33 % de las veces Fuente primaria ↗. Aquello es prehistoria. Los modelos de hoy inventan mucho menos: en la prueba de HAQQ, GPT-5.5 tuvo un 3 % de citas inventadas Fuente primaria ↗.
Pero el dato que importa es otro. En esa misma prueba, de 3.000 respuestas de diez modelos generales de primera línea, el 24 % citaba o aplicaba derecho que no dice lo que el modelo afirmaba: casos inventados, normas mal aplicadas, doctrina correcta en la jurisdicción equivocada Fuente primaria ↗. Mi lectura: la cita inventada va a menos. La cita que no dice lo que se afirma sigue ahí.
Y en los tribunales el problema no baja. La base de datos de resoluciones judiciales con alucinaciones de IA que mantiene el investigador Damien Charlotin recogía el 12 de septiembre 2.039 casos en todo el mundo, 8 de ellos en España Fuente primaria ↗. Los de abogados pasaron de 25 en 2024 a 352 en 2025, y a 431 en 2026 hasta esa fecha, según mi recuento sobre sus datos públicos. En casi nueve de cada diez casos la resolución no identifica qué herramienta se usó, así que esa base no permite saber si fallan más las generalistas o las especializadas.
Lo que no hace ninguna: leer la sentencia
En Canarias, el recurso sancionado tenía 52 citas. Solo 4 eran correctas, y porque copiaban las de la sentencia recurrida. Pero lo que me quita el sueño es otro dato del mismo auto: en seis de las citas falsas, el número y la fecha coincidían con una sentencia real. Y ninguna de esas seis contenía el pasaje citado ni trataba el tema Fuente primaria ↗.
Esa es la frontera. Una máquina puede comprobar que una sentencia existe y que un texto entrecomillado aparece en ella. Comprobar que la sentencia dice lo que tú sostienes que dice es otra cosa. Los autores de Stanford lo explican en una nota: en su estudio, saber si una fuente respalda de verdad una afirmación no se prestaba a una evaluación automática, porque depende de un juicio jurídico sobre el peso del texto y porque a veces el error ni siquiera está en el documento citado. Por eso lo revisaron a mano Fuente primaria ↗.
El TSJ de Canarias creyó que una IA jurídica «habría evitado con casi total seguridad el resultado» Fuente primaria ↗. Para las citas inventadas, probablemente reduce el riesgo; el propio auto, al fijar la multa, se queda en «probablemente». Para las reales que no dicen lo que se les atribuye, Stanford no lo tiene tan claro. Yo tampoco.
El que revisa también falla
El abogado sancionado en Galicia alegó que el sistema de supervisión de su despacho «somete toda versión final a varios filtros de control», incluida «la verificación de la jurisprudencia citada» Fuente primaria ↗. Es una alegación de parte, no un hecho probado: la Sala concluyó que las citas no se comprobaron. Pero si ese circuito existía, por él pasaron 24 citas falsas.
Y no son solo abogados. La misma base de datos recoge una 32 casos en los que atribuye el error a un juez Fuente primaria ↗. En el expediente 18 escribí que el escrito lo firmas tú, y las citas también. Añado lo que no dije entonces: firmar no es lo mismo que haber leído.
Lo que queda abierto
Queda abierto quién mide esto en España. No he encontrado ningún estudio publicado que evalúe las herramientas jurídicas españolas con derecho español. Y de los productos que he revisado, casi ninguno publica su precio.
Queda abierto si los tribunales convertirán la herramienta de pago en el estándar de diligencia. Dos salas ya calculan sus multas con ese precio. Una de ellas recuerda, entre paréntesis, que existe una alternativa gratuita.
Y queda abierta la pregunta que no he visto contestada por ningún proveedor: cuánto tarda un profesional en comprobar lo que la máquina le devuelve, y quién paga ese tiempo.
Pagas la estantería. El que lee la sentencia sigues siendo tú.
Lo que me preguntan cuando cierro el portátil.
¿Una IA jurídica es mejor que ChatGPT para abogados?
En exactitud, las comparaciones publicadas no les dan una ventaja clara. En la evaluación de Vals AI de julio de 2025, ChatGPT puntuó el 80 % y tres herramientas jurídicas entre el 78 y el 81 %, aunque estas sacaron 6 puntos más en autoridad de las fuentes. En junio de 2026, una tabla publicada por HAQQ, un fabricante que se sitúa primero, colocó a Claude Fable 5 y Claude Opus 4.7 por encima de Harvey, CoCounsel y Lexis+ AI. No he encontrado un estudio equivalente con herramientas españolas y derecho español.
¿La IA jurídica sigue alucinando?
Menos que antes, pero el problema no ha desaparecido. Un estudio de Stanford midió en 2024 entre un 17 y un 33 % de respuestas incorrectas o mal fundamentadas en Lexis+ AI, Westlaw AI-Assisted Research y Ask Practical Law AI. En 2026, en una prueba publicada por HAQQ, el modelo general más exacto, GPT-5.5, tuvo un 3 % de citas inventadas, pero el 24 % de las 3.000 respuestas de diez modelos citaba o aplicaba derecho que no dice lo que el modelo afirmaba.
¿Qué pasa si un abogado presenta citas falsas generadas con IA en España?
Puede ser multado por vulnerar las reglas de la buena fe procesal. El TSJ de Canarias impuso en febrero de 2026 una multa de 420 euros por un recurso con 52 citas de las que solo 4 eran correctas. El TSXG de Galicia impuso en julio de 2026 una de 1.800 euros por 24 citas falsas. En ambos casos el tribunal calculó la cuantía tomando como referencia el precio de una herramienta de IA jurídica, y remitió el asunto al colegio de abogados correspondiente.
El expediente detrás del artículo.
Sentencia del TSJ de Galicia 2408/2026, de 26 de mayo, ROJ STSJ GAL 3351/2026 ↗CENDOJ · Sala de lo Social, recurso de suplicación 5472/2025 · 2026Resolución judicialAuto del TSJ de Galicia 61/2026, de 7 de julio, pieza de multa del recurso de suplicación 5472/2025 ↗Sala de lo Social · copia anonimizada publicada en la base AI Hallucination Cases · 2026
Resolución judicial; sin ROJ en CENDOJ a 13 de septiembreVals Legal AI Report: Legal Research ↗Vals AI · 14 de octubre; respuestas recogidas en julio de 2025 · 2025
Evaluación independiente; derecho de EE. UU.Best AI for legal work: 3,000 answers graded (legal AI leaderboard 2026) ↗HAQQ Research · 5 de junio; tabla publicada por un fabricante que se sitúa primero · 2026
Evaluación de un fabricanteExpanding Harvey’s Model Offerings ↗Harvey · 13 de mayo · 2025
Información del fabricanteBenchmarking Legal RAG: The Promise and Limits of AI Statutory Surveys ↗Stanford RegLab · Symposium on Computer Science and Law, mayo · 2026
Estudio académicoAranzadi Allegra: inteligencia artificial jurídica ↗Aranzadi LA LEY · página del producto · 2026
Información del fabricanteIberley IA ↗Iberley · página del producto y preguntas frecuentes · 2026
Información del fabricanteThomson Reuters launches next generation of CoCounsel Legal ↗Thomson Reuters · nota de prensa de agosto · 2026
Información del fabricanteThomson Reuters leverages its world-class data assets to launch its own frontier model ↗Thomson Reuters · nota de prensa de agosto · 2026
Información del fabricanteIntroducing Harvey Tenet, our first post-trained open-weight model ↗Harvey · blog técnico, Research Preview · 2026
Información del fabricanteHarvey Raises $550M at a $15.5B Valuation ↗Harvey · 9 de septiembre · 2026
Información del fabricanteLey de Propiedad Intelectual ↗BOE · texto consolidado; artículos citados en cada expediente · 1996
Texto consolidado; comprobar redacción aplicableHallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools ↗Magesh, Surani, Dahl, Suzgun, Manning y Ho · Stanford · Journal of Empirical Legal Studies · 2025
Estudio empírico preregistrado; herramientas probadas en 2024AI Hallucination Cases ↗Damien Charlotin · base de datos actualizada a 12 de septiembre · 2026
Base de datos de resoluciones; licencia CC BY 4.0Auto del TSJ de Canarias de 10 de febrero de 2026, ROJ ATSJ ICAN 1/2026 ↗CENDOJ · Consejo General del Poder Judicial · 2026
Resolución judicial
Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.
Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.