Luis Soares
← Voltar aos artigos
IA aplicada22 abr 2026·14 min

RAG em produção com Azure AI Search e embeddings

Chunking, reranking e latência: o que muda entre o notebook e o cluster.

LS
Luis Soares
Arquiteto de software — .NET · Azure · IA
[ IA aplicada ]

RAG no notebook é retrieval + prompt. Em produção no Azure AI Search, latência, custo e qualidade dependem de decisões de infra — não só do modelo.

Chunking e índice

Chunks pequenos demais perdem contexto; grandes demais diluem o embedding. Indexe metadados (slug, seção, idioma) para filtrar antes do rerank.

Reranking e latência

Um segundo estágio de rerank melhora precisão, mas adiciona dezenas de ms. Meça p95 end-to-end: embedding da query + busca + rerank + geração. Cache de queries frequentes no Redis ou no próprio índice.

Observabilidade

Logue queryId, chunks recuperados e score — sem gravar PII. Compare respostas com ground truth offline antes de mudar o chunk size em produção.

LS

Escrito por Luis Soares — arquiteto de software, rumo ao Microsoft MVP.