Person-Place Relation Extraction in Historical Texts: A Dual Approach With Fine-Tuned NLI Encoders and SLMs at HIPE-2026

  • Inicio /
  • Publicaciones /
  • Person-Place Relation Extraction in Historical Texts: A Dual Approach with Fine-Tuned NLI Encoders and SLMs at HIPE-2026

Autores: Anderson Morillo, Edwin Puertas, Juan Carlos Martinez-Santos

Venue: CLEF 2026 Working Notes, CEUR Workshop Proceedings, Vol. 4283. HIPE-2026, Jena, Alemania. Publicado el 4 de octubre de 2026.

Enlaces: PDF · Volumen CEUR-WS · Código · Modelos

Resumen

Bajo el nombre de equipo VerbaNexAI II, este artículo compara dos sistemas para HIPE-2026: clasificar relaciones temporales entre menciones de persona y lugar en documentos históricos multilingües. Uno es un encoder NLI multilingüe afinado (run1). El otro es un modelo de lenguaje compacto, autodestilado, entrenado con predicciones del profesor filtradas por la etiqueta gold (run3). El modelo de lenguaje también escribe una justificación breve de cada predicción.

Problema

Las humanidades digitales necesitan saber quién aparece dónde, y cuándo, en colecciones de archivo. HIPE-2026 lo plantea como clasificación por par sobre texto con ruido de OCR en inglés, francés y alemán. Cada par candidato recibe una etiqueta at de tres clases (si la persona estuvo en el lugar en algún momento antes de la publicación: TRUE, PROBABLE o FALSE) y una etiqueta binaria isAt en un horizonte corto alrededor de la publicación. El ranking usa macro recall promediado sobre ambas relaciones, de modo que predecir siempre FALSE, la clase mayoritaria, no alcanza.

Método

Enfoque A (encoder NLI). Los documentos se reparan de OCR y se traducen al inglés con un reescritor local destilado (LFM2.5). Cada par persona–lugar se convierte en un ejemplo premisa–hipótesis para mDeBERTa-v3. TRUE corresponde a entailment, PROBABLE a neutral y FALSE a contradiction. Las dos relaciones se afinan por separado.

Enfoque B (SLM autodestilado). Un programa chain-of-thought en DSPy sobre Nemotron-3-Nano-4B se evoluciona con GEPA en Gold Train A. El programa optimizado genera completaciones del profesor; solo se conservan aquellas cuya etiqueta predicha coincide con la anotación gold. El mismo backbone se afina después con LoRA sobre ese corpus filtrado. En inferencia el estudiante usa un prompt evolucionado con GPT-OSS-20B, y las salidas mal formadas caen a FALSE.

Resultados

Con las etiquetas gold oficiales, el modelo autodestilado supera al encoder NLI en todos los splits. Macro recall global del SLM enviado:

  • Test A inglés: 0.581
  • Test A francés: 0.588
  • Test A alemán: 0.570
  • Test B (sorpresa literaria en francés): 0.534

La mayor diferencia frente al encoder está en el Test A francés (+0.128 de macro recall); la menor, en inglés (+0.020).

En el leaderboard oficial (17 equipos, 45 runs), VerbaNexAI II run3 quedó 18.º en Accuracy (0.58) y en Generalization (0.57), y 12.º en Accuracy–Efficiency. El run1 (encoder NLI) quedó 28.º en Accuracy (0.50) y en Generalization (0.44), y 17.º en Accuracy–Efficiency.

Por qué importa

  • Un modelo local de 4B, entrenado solo con sus propios trazos de razonamiento correctos, puede superar a un encoder NLI afinado en texto histórico ruidoso
  • Las justificaciones del SLM dan a quien cura archivos una razón auditable de cada decisión persona–lugar
  • El ranking de eficiencia muestra que estas configuraciones locales y compactas siguen siendo competitivas cuando cuentan el número de parámetros y el tamaño desplegado, no solo la accuracy