RAG em produção com Azure AI Search e embeddings
Chunking, reranking e latência: o que muda entre o notebook e o cluster.
RAG no notebook é retrieval + prompt. Em produção no Azure AI Search, latência, custo e qualidade dependem de decisões de infra — não só do modelo.
Chunking e índice
Chunks pequenos demais perdem contexto; grandes demais diluem o embedding. Indexe metadados (slug, seção, idioma) para filtrar antes do rerank.
Reranking e latência
Um segundo estágio de rerank melhora precisão, mas adiciona dezenas de ms. Meça p95 end-to-end: embedding da query + busca + rerank + geração. Cache de queries frequentes no Redis ou no próprio índice.
Observabilidade
Logue queryId, chunks recuperados e score — sem gravar PII. Compare respostas com ground truth offline antes de mudar o chunk size em produção.
Escrito por Luis Soares — arquiteto de software, rumo ao Microsoft MVP.