O que é RAG
Geração aumentada por recuperação — aumentando LLM com dados externos
RAG (Geração Aumentada por Recuperação) — arquitetura que aumenta as respostas do LLM com informações relevantes de uma base de conhecimento externa.
Como RAG Funciona
- Consulta — usuário faz uma pergunta
- Recuperação — sistema encontra documentos relevantes na base de conhecimento
- Contexto — documentos encontrados são adicionados ao prompt
- Geração — LLM gera resposta considerando contexto
Componentes do Sistema RAG
- Modelo de embedding — converte texto em vetores
- BD vetorial — armazena e pesquisa embeddings
- Chunking — divisão de documentos em fragmentos
- Ranking — ordenar resultados por relevância
- LLM — gera resposta final
Técnicas Avançadas
- Busca híbrida — combinação de busca vetorial e por palavras-chave
- Re-ranking — reordenar resultados
- Expansão de consulta — expandir consulta com sinônimos
- RAG multi-hop — cadeia de buscas para perguntas complexas
Aplicações Empresariais
- Assistentes corporativos — respostas de documentação interna
- Suporte técnico — base de conhecimento para bots de suporte
- Sistemas legais — busca de leis e precedentes
- Saúde — informações sobre sintomas e protocolos