Saltar al contenido
Sakir Sathe

Navegación

Trabajo

W-04Caso de estudio · RAG · Búsqueda · Datos estructurados

Búsqueda empresarial y acceso a datos con IA

Arquitectura de recuperación que combina documentos empresariales, búsqueda semántica y vectorial, y datos estructurados gobernados para que los asistentes de IA respondan con información confiable.

  1. 01

    Resumen del sistema

    Esta arquitectura de recuperación conectó dos tipos distintos de información: documentos empresariales y datos estructurados gobernados. La búsqueda semántica y vectorial ofrecía acceso al contenido no estructurado, mientras que las interfaces de datos permitían consultar información operativa que no debía obtenerse únicamente de la memoria del modelo.

  2. 02

    Mi contribución

    Trabajé en ingestión, embeddings, recuperación, acceso a datos estructurados, integración de API, acceso a herramientas de estilo MCP, fundamentación y validación.

  3. 03

    Reto de ingeniería

    Las preguntas empresariales suelen requerir tanto documentos como datos de negocio estructurados. Los documentos son adecuados para la recuperación semántica o vectorial; los datos operativos suelen requerir APIs gobernadas o consultas estructuradas. Tratar todas las fuentes como el mismo problema de búsqueda puede ocultar diferencias de frescura, límites de acceso y evidencia necesaria para responder.

  4. 04

    Arquitectura y enfoque

    La ruta documental pasa por ingestión, fragmentación y embeddings hacia un índice vectorial o de búsqueda. Una ruta separada de datos estructurados utiliza APIs gobernadas, REST, GraphQL o interfaces de herramientas de estilo MCP. Ambas convergen en la orquestación, que proporciona información pertinente al modelo de lenguaje para una respuesta fundamentada. Son rutas genéricas, no esquemas de datos ni definiciones de herramientas internas.

    Flujo genérico · solo ilustrativo
    1. Documentos → ingestión → fragmentación / embeddings → índice vectorial / búsqueda
    2. Datos estructurados → APIs gobernadas / REST / GraphQL / MCP
    3. Ambas rutas → orquestación → modelo de lenguaje → respuesta fundamentada
  5. 05

    Prioridades de ingeniería

    La calidad de recuperación no consiste únicamente en encontrar texto parecido. También implica elegir la fuente adecuada, validar la información obtenida y respetar los límites de cada interfaz de datos. El uso de herramientas debe hacer explícito el acceso, no convertir el modelo de lenguaje en un cliente de base de datos sin restricciones.

  6. 06

    Aprendizajes

    La información estructurada y no estructurada se complementa, pero debe conservar sus patrones de acceso distintos. Es más fácil evaluar una respuesta fundamentada cuando la ruta de recuperación y el contrato de acceso a datos son claros. La validación corresponde tanto alrededor de esas interfaces como alrededor de la respuesta generada.