Nesta aula
O modelo não conhece a sua empresa. E não precisa conhecer: basta conseguir consultar.
Todo mundo que instala uma IA local faz a mesma pergunta em seguida: "e como ela aprende sobre o meu negócio?". A resposta que a maioria espera é "treinando". A resposta que funciona é outra: dar ao modelo os seus documentos na hora da pergunta, para ele responder com base neles e dizer de onde tirou. O nome técnico é RAG. Nesta aula você entende o mecanismo, monta uma coleção de documentos com ferramentas prontas, e faz a IA responder cinco perguntas citando a fonte. Sem código, sem nada saindo da empresa.
- Ao final, você vai explicar o que é RAG e por que ele é diferente de treinar um modelo.
- Vai saber onde o RAG funciona bem, onde falha e como perguntar para ter resposta com fonte.
- Vai sair com um entregável: 10 documentos indexados e 5 perguntas respondidas com a fonte conferida.
O problema, e as duas soluções erradas
Um modelo é treinado até uma data, com texto público. Ele não sabe o seu regulamento interno, a sua tabela de prazos, o seu catálogo. Se você perguntar "qual é o prazo de troca da loja?", ele vai inventar um prazo com cara de certo. Esse é o problema.
A primeira solução errada é colar tudo toda vez. Funciona para um documento curto e cansa no segundo dia. Além disso, a janela de contexto tem limite, e quanto mais texto você cola, mais o modelo se perde.
A segunda solução errada é "treinar o modelo com os meus dados". Treinar (o ajuste fino da aula 9) é caro, lento, exige gente, e serve para mudar o jeito do modelo, não para colocar fatos que mudam toda semana. Quem tenta ensinar a tabela de preços por treino descobre que precisa treinar de novo a cada reajuste.
A solução que funciona: buscar, depois gerar
Pense em dois estagiários. O primeiro decorou o manual da empresa há seis meses. O segundo não decorou nada, mas tem o manual aberto na mesa e sabe procurar. Quando você pergunta sobre uma regra que mudou mês passado, o primeiro responde errado com confiança. O segundo abre a página certa e lê. RAG é o segundo estagiário. A sigla vem do inglês e quer dizer "geração aumentada por busca": antes de responder, o sistema busca nos seus documentos os trechos mais parecidos com a pergunta e os entrega ao modelo junto com ela.
Dica
Quando alguém disser "vamos treinar a IA com os documentos da empresa", pergunte: "você quer que ela mude de jeito ou que ela consulte os documentos?". Em nove de dez casos, a pessoa quer consulta. Isso é RAG, e é muito mais simples.
Como funciona por dentro, em quatro passos
Você não precisa programar nada disso, mas precisa entender para saber onde mexer quando der errado.
- Dividir. Cada documento é cortado em trechos de algumas centenas de palavras. Um regulamento de vinte páginas vira dezenas de pedaços.
- Indexar. Cada trecho passa por um modelo pequeno, chamado modelo de embedding, que o transforma numa espécie de endereço numérico baseado no significado. Trechos que falam de coisas parecidas ganham endereços próximos. Tudo isso fica guardado num índice, na sua máquina. O Ollama tem modelos de embedding na biblioteca, e as ferramentas prontas escolhem um por você.
- Buscar. Quando alguém pergunta, a pergunta passa pelo mesmo modelo de embedding e o sistema procura no índice os trechos com endereço mais próximo. Costuma trazer três a cinco trechos.
- Gerar. Os trechos encontrados e a pergunta vão juntos para o modelo de linguagem, com uma instrução do tipo "responda só com base nestes trechos e diga de qual documento veio". O modelo escreve a resposta, e a fonte é o nome do arquivo e o pedaço usado.
Três coisas ficam claras quando você olha os passos. Primeiro, o modelo não aprendeu nada: se você trocar o documento, a próxima resposta já usa o novo. Segundo, a qualidade depende da busca: se o trecho certo não for encontrado, a resposta sai errada ou vazia, mesmo com um modelo excelente. Terceiro, tudo roda na sua máquina: o índice, o modelo de embedding e o modelo de linguagem.
Exemplo real
Um escritório contábil colocou dez documentos numa coleção: regulamento interno, tabela de prazos de obrigações, roteiro de abertura de empresa, FAQ de clientes e seis modelos de ofício. A pergunta "qual documento o cliente precisa trazer para abrir uma empresa de serviços?" voltou com a lista certa e a fonte: "roteiro de abertura, seção 2". A estagiária conferiu abrindo a seção 2. Levou dez segundos. Antes, ela perguntava para o contador, que estava em reunião.
Ferramentas prontas: sem código
Você não vai escrever o sistema de RAG. Vai usar o que já vem pronto na interface da aula 5. O Open WebUI faz os quatro passos por você, com dois recursos:
Anexar na conversa
Você anexa um ou mais arquivos numa conversa e pergunta sobre eles. Serve para uso pontual: "o que este contrato diz sobre rescisão?". O arquivo fica disponível naquela conversa.
Coleção de conhecimento
Você cria uma coleção (base de conhecimento), envia os documentos uma vez, e qualquer conversa pode consultar a coleção. É o que serve para a equipe: o regulamento, a tabela de prazos, o FAQ, sempre à mão.
Os formatos aceitos costumam incluir PDF com texto, documentos de editor de texto e arquivos de texto simples. O procedimento exato para criar a coleção e associá-la a um modelo ou a uma conversa está na documentação oficial e muda um pouco entre versões; a lógica é sempre: criar a coleção, enviar os arquivos, esperar a indexação, referenciar a coleção na conversa.
Outras ferramentas de mesa fazem o mesmo. O critério para escolher qualquer uma delas é um só: o índice e os modelos rodam na sua máquina? Se a ferramenta manda os documentos para um serviço na internet para "processar", ela desfaz o motivo de você ter IA local.
A instrução fixa para conversas com documentos
As instruções fixas da aula 5 ganham três linhas quando o modelo vai consultar documentos:
A última frase parece exagero até o dia em que duas versões da mesma política estão na coleção e o modelo escolhe a velha. Com essa instrução, ele te avisa. Sem ela, ele decide sozinho.
Perguntar bem e conferir sempre
RAG responde bem a pergunta específica: "qual é o prazo?", "o que diz a seção sobre férias?", "quais documentos o cliente traz?". Responde mal a pergunta ampla: "resuma tudo", "quais são todas as regras?", "compare todos os contratos". A busca traz alguns trechos; um resumo de tudo precisaria de todos.
Onde o RAG falha, e o que fazer
| Sintoma | Causa provável | O que fazer |
|---|---|---|
| "Não encontrei" para algo que está no documento | PDF escaneado sem texto pesquisável, ou informação numa tabela mal extraída | Passar OCR; converter tabela em texto ou planilha limpa (aula 8) |
| Resposta certa, fonte errada | Dois documentos parecidos; o índice trouxe o vizinho | Nomes de arquivo claros; remover duplicatas e versões velhas |
| Resposta com regra antiga | Versão antiga ainda na coleção | Uma versão por documento, com data no título |
| Resposta incompleta em pergunta ampla | Busca trouxe poucos trechos | Quebrar em perguntas específicas |
| Resposta inventada apesar da instrução | Modelo pequeno demais ou instrução fixa não aplicada | Conferir a instrução; testar outro modelo na bateria da aula 6 |
A regra de ouro é a mesma para toda IA: resposta com fonte se confere; resposta sem fonte se desconfia. Peça a fonte sempre e abra o trecho nas primeiras semanas, até a equipe ter uma noção real da taxa de acerto para cada tipo de pergunta.
Cuidado
Colocar um documento na coleção é o mesmo que deixá-lo em cima da mesa de quem tem acesso àquela coleção. O modelo não guarda segredo: se o trecho estiver no índice, ele pode aparecer na resposta. Antes de indexar a folha de pagamento ou um contrato em disputa, leia a aula 8 sobre o que entra, o que não entra e quem vê o quê.
Prática · 10 min
Indexe 10 documentos e responda 5 perguntas com fonte
- Separe 10 documentos internos de baixa sensibilidade e que a equipe inteira já pode ler: regulamento, FAQ, roteiros de procedimento, catálogo, políticas de troca ou de atendimento. Nada de dado pessoal por enquanto.
- Confira que cada um tem texto pesquisável (abra e tente selecionar uma palavra). Se for escaneado, deixe de fora hoje.
- No Open WebUI, crie uma coleção de conhecimento, envie os 10 arquivos e espere a indexação terminar.
- Cole a instrução fixa desta aula nas instruções do modelo ou no início da conversa.
- Faça 5 perguntas específicas cuja resposta você sabe onde está. Inclua uma cuja resposta não está em nenhum documento.
- Para cada resposta, abra o documento e o trecho citado e marque: correta com fonte certa, correta com fonte errada, incorreta, ou "não encontrei" quando devia encontrar.
Resumo da aula
- RAG = buscar nos seus documentos e depois gerar a resposta com base nos trechos encontrados. Nada é treinado.
- Quatro passos: dividir, indexar (embedding), buscar, gerar. Tudo na sua máquina.
- Ferramentas prontas: anexar na conversa (pontual) e coleção de conhecimento (equipe), no Open WebUI.
- Instrução fixa: só com base nos trechos, sempre com fonte, "não encontrei" quando não houver, apontar contradição.
- Funciona bem em pergunta específica; falha em pergunta ampla, PDF escaneado, tabela mal extraída e versão antiga.
- Documento na coleção é documento em cima da mesa: quem acessa a coleção acessa o conteúdo.
Quiz da aula
Quatro perguntas para fixar. A melhor nota fica guardada para o certificado.
Isaque Victor cursos gratuitos