Análisis de Documentos mediante IA para Detección de Anomalías en Compras Públicas
Cliente: Dirección de Compras y Contratación Pública (DCCP / ChileCompra)
Tipo de proyecto: Sistema basado en LLM para análisis de documentos no estructurados, sobre Google Cloud Platform
El desafío
El proyecto anterior de X-Consulting con el Observatorio ChileCompra automatizó 15 reglas sobre datos estructurados. Pero buena parte de las irregularidades en compras públicas no viven en tablas: viven en los documentos PDF adjuntos a licitaciones y órdenes de compra ( bases, resoluciones aprobatorias, anexos técnicos). Hoy, solo 5 analistas revisan manualmente esos adjuntos, cubriendo menos del 0,5% de los procesos relevantes de un universo de ~200.000 procesos anuales.
El objetivo fue desarrollar un sistema automatizado basado en grandes modelos de lenguaje (LLM) capaz de leer esos documentos y detectar anomalías e incumplimientos a la normativa de compras públicas (Ley 19.886 y su reglamento), aplicando 20 reglas de incumplimiento (de un universo de 76 reglas identificadas por el Observatorio) que hoy requieren interpretación humana de texto no estructurado.
Qué se hizo
El pipeline se construyó en dos grandes etapas, una base genérica de documentos tipificados, y la aplicación de reglas mediante LLM , con los siguientes componentes:
Tipificación y almacenamiento de documentos: clasificación automática de cada PDF adjunto por tipo (bases, resoluciones, anexos técnicos, etc.), etapa previa obligatoria ya que los archivos no llegaban categorizados.
Pipeline OCR / extracción de texto: extracción vía OCR (Tesseract, Google Cloud Vision AI o Document AI), con estructuración básica de secciones, tablas y encabezados, y output en formato Markdown.
Chunking y generación de metadatos: división semántica del contenido en unidades significativas, enriquecidas con metadatos, apoyada en LLM para inferir contexto.
Generación de embeddings: representación vectorial de cada chunk para habilitar búsqueda semántica, como componente reutilizable para futuras aplicaciones del Observatorio.
Motor LLM de detección de anomalías: modelo configurado con prompts basados en la normativa de compras públicas, evaluando si cada segmento de texto cumple o incumple las 20 reglas priorizadas. Reglas que el propio Observatorio entrega al adjudicatario, seleccionadas por tener verificación simple, pocas excepciones y consulta a un solo tipo de documento.
Categorización de resultados y base de datos de resultados: clasificación de hallazgos según nivel de fiabilidad, con tablas SQL marcadas por regla incumplida, habilitando notificaciones automatizadas al Observatorio.
Monitoreo y alertas: Seguimiento proactivo del pipeline.
El desarrollo siguió una metodología híbrida ágil/cascada, con entregas en sprints bimensuales organizados en 5 informes: propuesta metodológica y priorización de reglas (mes 2), pipeline OCR/ETL operativo (mes 4), y tres tandas de implementación de reglas por etapas (meses 6, 8 y 10), cubriendo primero 5, luego 7 y finalmente 8 reglas adicionales.
Requerimientos técnicos
Arquitectura y stack
Desarrollo íntegro sobre Google Cloud Platform (créditos ya disponibles en ChileCompra); cualquier tecnología fuera de GCP requiere justificación técnica y aprobación institucional.
OCR / visión: Tesseract, Google Cloud Vision AI o Document AI.
LLM: modelos de la familia Gemini u otros (GPT, etc.), con fine-tuning o prompt engineering orientado a las reglas normativas.
Herramientas de entorno: Git para versionamiento, MS Project para cronograma, Jira/Trello para seguimiento.
Compatibilidad obligatoria con el entorno de la DCCP.
Integraciones
Repositorio cloud de ChileCompra (adjuntos de licitaciones y OC) en PDF, PNG, JPEG.
Portal Mercado Público, consumiendo adjuntos publicados diariamente.
Modelo de datos actual de ChileCompra, como salida complementaria en SQL.
Notificaciones y consulta de resultados hacia el Observatorio.
No funcionales
Procesamiento diario de la totalidad de nuevos adjuntos, escalable hasta 200.000 documentos anuales (~380 GB/mes).
Ingesta incremental sin reprocesar el corpus existente; escalado horizontal en GCP.
Disclaimer: esta descripción fue elaborada exclusivamente en base a la información pública disponible en las bases de licitación (Resolución Exenta N°352 B, ID 869591-2-LP25, DCCP / ChileCompra). No incluye detalles confidenciales, resultados específicos del modelo ni información contractual reservada entre ChileCompra y X-Consulting.



Comments