Qué es RAG
Generación aumentada por recuperación — aumentando LLM con datos externos
RAG (Generación Aumentada por Recuperación) — arquitectura que aumenta las respuestas del LLM con información relevante de una base de conocimiento externa.
Cómo Funciona RAG
- Consulta — usuario hace una pregunta
- Recuperación — sistema encuentra documentos relevantes en base de conocimiento
- Contexto — documentos encontrados se agregan al prompt
- Generación — LLM genera respuesta considerando contexto
Componentes del Sistema RAG
- Modelo de embedding — convierte texto en vectores
- DB vectorial — almacena y busca embeddings
- Chunking — división de documentos en fragmentos
- Ranking — ordenar resultados por relevancia
- LLM — genera respuesta final
Técnicas Avanzadas
- Búsqueda híbrida — combinación de búsqueda vectorial y por palabras clave
- Re-ranking — reordenar resultados
- Expansión de consulta — expandir consulta con sinónimos
- RAG multi-salto — cadena de búsquedas para preguntas complejas
Aplicaciones Empresariales
- Asistentes corporativos — respuestas de documentación interna
- Soporte técnico — base de conocimiento para bots de soporte
- Sistemas legales — búsqueda de leyes y precedentes
- Salud — información sobre síntomas y protocolos