RAG pipeline interview
Walk through a production RAG architecture end-to-end and name two failure modes.
Answers use simple, clear English.
Quick interview answer
Ingest documents → clean/chunk (structure-aware) → embed → index in vector DB (+ BM25 hybrid) → at query time retrieve top-k → optional rerank → build prompt with citations → LLM answer → log/eval. Failure modes: wrong/missed chunks, conflicting sources, context overflow, doc-based prompt injection, stale index. Mitigate with hybrid search, metadata filters, abstain rules, ACLs, and separate eval for retrieval vs answer faithfulness.
Detailed answer
Ingest documents → clean/chunk (structure-aware) → embed → index in vector DB (+ BM25 hybrid) → at query time retrieve top-k → optional rerank → build prompt with citations → LLM answer → log/eval. Failure modes: wrong/missed chunks, conflicting sources, context overflow, doc-based prompt injection, stale index. Mitigate with hybrid search, metadata filters, abstain rules, ACLs, and separate eval for retrieval vs answer faithfulness.
Real example & use case
Customer support RAG over Zendesk + product docs with citation links.
Pros & cons
Pros: updatable knowledge. Cons: ops + eval complexity.