IA generativa

Sistema RAG con LangChain

Python
LangChain
ChromaDB
LLM
Asistente que responde preguntas sobre tus propios PDF citando la fuente: archivo, autor y página.
Fecha de publicación

21 de septiembre de 2026

El problema

Un modelo de lenguaje solo conoce los datos con los que se entrenó. La generación aumentada por recuperación (RAG) resuelve esa limitación: antes de responder, el sistema busca los fragmentos relevantes en tus documentos y se los pasa al modelo como contexto.

Qué hace

  • Procesa PDF y los divide en fragmentos.
  • Genera embeddings y los guarda en una base de datos vectorial ChromaDB.
  • Responde con atribución de fuentes: nombre del archivo, autor y número de página.
  • Las respuestas se basan en tus documentos y no solo en lo que el modelo aprendió durante el entrenamiento.

Stack

  • LangChain como framework de orquestación.
  • API de Anthropic como modelo de lenguaje, configurable para usar otros LLM.
  • ChromaDB como almacén vectorial y Poetry para gestionar dependencias.