← Voltar ao glossário

RAG (Geração Aumentada por Recuperação)

Técnica que busca informações nos seus documentos e as entrega ao LLM junto com a pergunta, para que ele responda com base em dados reais e atualizados, reduzindo alucinações.

RAG (Retrieval-Augmented Generation, geração aumentada por recuperação) é a técnica que conecta um LLM a uma base de conhecimento própria. Em vez de o modelo responder só com o que aprendeu no treinamento, o sistema primeiro recupera os trechos mais relevantes dos seus documentos e os inclui no prompt; o modelo então gera a resposta apoiado nesse contexto.

O fluxo típico: os documentos são divididos em trechos e convertidos em embeddings (vetores numéricos que capturam significado), armazenados num banco vetorial (como Pinecone). Quando chega uma pergunta, ela também vira embedding, o sistema busca os trechos mais parecidos e monta o prompt com eles. Resultado: respostas ancoradas em fontes, com possibilidade de citar de onde veio cada informação.

Quando usar: sempre que o LLM precisa responder sobre conteúdo que ele não conhece (documentação interna, catálogos, contratos, dados recentes) sem o custo de um fine-tuning. Exemplo concreto: um chatbot de suporte com RAG sobre o manual do produto responde "como reseto minha senha?" citando o passo a passo exato da versão atual do manual, em vez de inventar um procedimento genérico.

Logo de Chatbase

Atendimento ao Cliente

Chatbase

Plataforma de experiência do cliente com IA: agentes que resolvem dúvidas complexas e reduzem tickets em todos os canais, com 10 mil+ empresas.

Não disponível

Categorias

Veja também