FundadorSupremo.
EL CUADERNO INCÓMODO DE LA IA PROFESIONAL
HECHO EN CASTELLANO, A PROPÓSITOEN CASTELLANO
Volver al archivo
EXPEDIENTE 42/Prueba · RAG fiscal/ANÁLISIS + FUENTES

Contextualizar 37.081 fragmentos me costó 43 dólares y me dejó el buscador peor.

El contextual retrieval de Anthropic prometía recuperar mejor los fragmentos. Lo medí sobre mi corpus fiscal completo y el resultado fue negativo. Lo que sí movía la aguja era aburrido, y la frontera de verdad está en otro sitio: recuperar fragmentos plausibles no es verificar pasajes.

El contextual retrieval que Anthropic presentó en septiembre de 2024 promete encontrar mejor los fragmentos: anteponer a cada uno un contexto breve generado por un modelo. Sus autores la midieron sobre sus conjuntos y publicaron mejoras grandes. Pagué por aplicarla a mi corpus fiscal completo. El buscador empeoró. Esta es la cuenta, con factura.

El sistema lleva tiempo en producción: buscador híbrido sobre 37.081 fragmentos de normativa, doctrina y consultas vinculantes, con un golden propio a nivel documento construido desde casos reales del despacho. No es un benchmark público. Es la herramienta con la que se contesta a Hacienda, y sus errores no se cuentan en puntos de métrica sino en requerimientos.

Lo que prometía

El método es sencillo de contar: antes de indexar, un modelo escribe un par de frases que sitúan cada fragmento en su documento y esas frases viajan con el fragmento. Combinado con búsqueda léxica, los autores reportaron un 49% menos de casos en que el fragmento pertinente no aparecía entre los 20 primeros; con reordenamiento encima, un 67% menos Fuente primaria ↗. Números de sus conjuntos, medidos por ellos y presentados como eso.

Lo que un anuncio no puede prometer es la transferencia. Una mejora medida en los conjuntos de Anthropic no garantiza una mejora en mi corpus jurídico.

Lo que medí

Contextualicé el corpus completo. La factura: 42,94 dólares en llamadas al modelo y unas cinco horas y media de generación, más 81 minutos de re-embebido. Después, el golden entero. El recall a nivel documento bajó un 2,3%. La técnica me costó dinero, tardanza, y me dejó el buscador peor de lo que estaba.

No he aislado la causa, y esta prueba no demuestra el mecanismo. Mi hipótesis: los fragmentos de normativa ya se identifican solos. Un trozo de la Ley del IRPF llega con artículo, apartado y rango; una consulta vinculante, con número y fecha. El contexto generado podría estar diluyendo la señal que esos identificadores ya traían en vez de añadir información nueva. Queda dicho como hipótesis, no como conclusión.

El reordenador tampoco era gratis

El siguiente adorno fue un reranker neuronal encima del híbrido. Re-medido con la rama semántica arreglada y el mismo golden: un 7,6% más de MRR y un 9% más de recall@10. Aceptable, con dos peros. Primero, estropeó cuatro consultas que el híbrido ya resolvía perfecto, de 1,000 a 0,500: cuando el documento correcto ya está arriba, reordenar solo puede estropear. Segundo, probé un router que decidiera por la confianza del top-1 cuándo activarlo, y no separaba los casos buenos de los malos. El reranker se quedó, con presupuesto acotado. Como empleado, no como oráculo.

Lo que sí movía la aguja

Todo lo que mejoró el sistema era aburrido: trocear siguiendo la estructura del documento normativo en vez de un tamaño fijo, y reforzar la capa léxica. AI21 mostró que el tamaño óptimo de fragmento depende de la pregunta, no del corpus Fuente primaria ↗. Su prueba no valida mi troceado por estructura: su método combina varios tamaños y fusiona los resultados. Lo mío es más sencillo y no lo he medido contra el suyo.

La frontera que ningún adorno cruza

Stanford, midiendo las herramientas jurídicas de los grandes proveedores, chocó con el mismo muro que yo: comprobar que una fuente respalda de verdad una afirmación no se dejó a evaluación automática, porque depende de un juicio sobre el peso del texto. Lo revisaron a mano Fuente primaria ↗.

Desde entonces mi regla es otra. El modelo no redacta sobre «resultados relevantes»: redacta sobre un pasaje exacto, citado con página y hash, que cualquiera puede volver a abrir. Eso permite comprobar el texto. No demuestra que respalde la conclusión, y el golden documental mide recuperación, no respaldo jurídico. Recuperar fragmentos plausibles es búsqueda. Verificar pasajes es otra profesión. Mi medición demuestra un fallo de recuperación; la consecuencia fiscal la firma el criterio, no el experimento.

Mide el adorno sobre tu corpus entero antes de pagarlo. Y no llames verificación a tu búsqueda.

Lo que me preguntan cuando cierro el portátil.

¿Qué es el contextual retrieval y qué prometía?

Es un método de indexado publicado por Anthropic en 2024: antes de guardar cada fragmento, un modelo le anteponía dos o tres frases que lo sitúan en su documento, y esas frases se embebían junto al fragmento. Combinado con búsqueda léxica, sus autores reportaron un 49% menos de fallos de recuperación y un 67% menos añadiendo reordenamiento. Medido sobre su corpus, no sobre el tuyo.

¿Por qué a ti te empeoró si a ellos les mejoró?

No he aislado la causa. Mi hipótesis es que el contexto añadido diluye identificadores que mis fragmentos ya llevan: artículo, número y fecha. La prueba no demuestra ese mecanismo. La cifra exacta: 42,94 dólares y casi siete horas de proceso para un 2,3% menos de recall a nivel documento.

¿Sirve de algo el reranker entonces?

En mi caso, un 7,6% más de MRR y un 9% más de recall@10, con cuatro consultas empeoradas que el híbrido ya resolvía perfecto. Lo mantengo con presupuesto acotado; lo que no encontré es una señal fiable que diga cuándo activarlo y cuándo callarse.

¿Qué es recuperar y qué es verificar?

Recuperar es que el fragmento pertinente aparezca en la lista de resultados. Verificar es comprobar que el pasaje respalda la afirmación que vas a firmar. El estudio de Stanford sobre herramientas jurídicas dejó la segunda fuera de la evaluación automática y la revisó a mano. Mi regla: el modelo solo redacta sobre pasaje exacto con página y hash, que permite comprobar el texto. No demuestra que respalde la conclusión.

El expediente detrás del artículo.

Introducing Contextual Retrieval ↗Anthropic · Engineering, 19 de septiembre · 2024
Publicación técnica
Chunk size is query-dependent: a simple multi-scale approach to RAG retrieval ↗Niv Granot, AI21 Labs · blog técnico, 29 de enero · 2026
Publicación de investigación aplicada
Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools ↗Magesh, Surani, Dahl, Suzgun, Manning y Ho · Stanford · Journal of Empirical Legal Studies · 2025
Estudio empírico preregistrado; herramientas probadas en 2024

Fuentes consultadas el 9 de septiembre de 2026. Las recomendaciones y ejemplos son elaboración editorial: no se atribuyen íntegramente a estas fuentes. Comprueba versión y ámbito antes de aplicar una norma.

Divulgación general. Ninguna herramienta de esta web certifica la revisión, seguridad o conformidad de un proceso.

Busca una idea. O una grieta.

BUSCA EN EL TEXTO COMPLETO · ↑ ↓ PARA MOVERTE · ESC PARA CERRAR

El cuaderno.

Kenyi & el criterio

Copia con contexto.

Tu navegador no permite copiar automáticamente. Selecciona este texto y cópialo.