IA generativa
Sistema RAG con LangChain
Python
LangChain
ChromaDB
LLM
Asistente que responde preguntas sobre tus propios PDF citando la fuente: archivo, autor y página.
El problema
Un modelo de lenguaje solo conoce los datos con los que se entrenó. La generación aumentada por recuperación (RAG) resuelve esa limitación: antes de responder, el sistema busca los fragmentos relevantes en tus documentos y se los pasa al modelo como contexto.
Qué hace
- Procesa PDF y los divide en fragmentos.
- Genera embeddings y los guarda en una base de datos vectorial ChromaDB.
- Responde con atribución de fuentes: nombre del archivo, autor y número de página.
- Las respuestas se basan en tus documentos y no solo en lo que el modelo aprendió durante el entrenamiento.
Stack
- LangChain como framework de orquestación.
- API de Anthropic como modelo de lenguaje, configurable para usar otros LLM.
- ChromaDB como almacén vectorial y Poetry para gestionar dependencias.