IA que responde a partir dos seus documentos: o RAG explicado

RAG (geração com recuperação, em inglês retrieval-augmented generation) é a técnica por trás de quase todos os assistentes que «respondem com base nos nossos documentos». Em vez de treinar um modelo com os seus textos, o sistema procura os excertos relevantes e entrega-os ao modelo junto com a pergunta. O modelo responde a partir deles. Reduz as respostas inventadas, mas não as elimina.

Como funciona, em cinco passos

1 Reúnem-se os documentos: as perguntas frequentes, as páginas do site, os manuais, os contratos-tipo.
2 Cortam-se em pedaços pequenos, de modo que cada um trate de uma coisa.
3 Cada pedaço é transformado em números (um «embedding») que representam o seu sentido, por um modelo próprio para isso. Textos com significado parecido ficam com números parecidos.
4 Guardam-se numa base de dados própria para pesquisa por sentido (uma base vectorial). Algumas bases comuns têm uma extensão para isto.
5 Quando alguém pergunta, a pergunta também vira números, o sistema vai buscar os pedaços mais próximos e entrega-os ao modelo com a instrução «responde só com base nisto».

RAG ou outra coisa

Abordagem Serve para Limite
Colar o texto na conversa Um documento, uma vez Não escala, e paga-se o texto inteiro em cada pedido
RAG Muitos documentos, que mudam, e perguntas variadas Só é tão bom como os documentos e a forma de os cortar
Afinar um modelo (fine-tuning) Ensinar um estilo ou um formato Não é uma boa maneira de lhe ensinar factos que mudam

O que precisa para o montar

1 Os documentos, limpos e actuais. Se a política mudou e o documento antigo continua lá, o assistente cita-o.
2 Um modelo de embeddings e um modelo de resposta, de um fornecedor ou corridos por si. Veja obter uma chave de API.
3 Um sítio onde guardar os vectores. Um serviço pronto, ou uma base de dados sua com a extensão adequada. Se a instalar num VPS, veja instalar o PostgreSQL num VPS e confirme se a versão suporta a extensão que escolher.
4 A cola entre tudo. Uma aplicação sua ou um fluxo numa ferramenta como o n8n. Veja o que é o n8n.
Cuidado com quem pode ver o quê. Se pôr no mesmo índice documentos públicos e internos, o assistente pode citar os internos a qualquer pessoa. Separe os índices ou controle o acesso por utilizador.
Ainda pode inventar. Se os excertos não trazem a resposta, um modelo mal instruído completa com o que «sabe». Mande-o dizer «não encontrei» e mostre sempre de que documento veio a resposta. Veja alucinações de IA.
Comece com poucos documentos e uma lista de perguntas de teste que conhece a resposta. Se não acerta nessas, não está pronto para os clientes.

Quer pôr um assistente destes num VPS seu? Veja os planos e escolha o tamanho.

Ver planos de VPS

VEJA TAMBÉM

Pôr um assistente de IA a conversar no seu site

Tokens explicados: como se contam as APIs de IA

Instalar o PostgreSQL num VPS

Um agente de IA precisa de um VPS, não de hospedagem partilhada

PRODUTO RECOMENDADO

Alojamento de sites com cPanel

Domínio e SSL incluídos, cópias diárias e o painel que já conhece. desde 5.940,00 Kz/mês (plano de 3 anos, com cupão)

Ver planos
  • 0 Utilizadores acharam útil
Esta resposta foi útil?