Chunking Strategies and Embeddings
What common mistakes do candidates make around Chunking Strategies and Embeddings, and how do you avoid them?
Answers use simple, clear English.
Quick interview answer
Common mistakes: Splitting mid-sentence randomly; mixing embedding models in one index. Best practices: Keep embedding model versioned; store metadata (source, date).
Detailed answer
Common mistakes: Splitting mid-sentence randomly; mixing embedding models in one index. Best practices: Keep embedding model versioned; store metadata (source, date). Core: Chunk by tokens with overlap, headings, or semantic splits. Embedding model maps text to vectors; must match query/doc language. Dimension and MTEB quality matter. Real-time example: Markdown by ## headers; 512-token chunks with 64 overlap; bge/e5 embeddings. Pros: Better recall when structure preserved. Cons: Tables/code need special handling. Common mistakes: Splitting mid-sentence randomly; mixing embedding models in one index. Best practices: Keep embedding model versioned; store metadata (source, date). Audience level: Architect.
Full explanation
Chunk by tokens with overlap, headings, or semantic splits. Embedding model maps text to vectors; must match query/doc language. Dimension and MTEB quality matter.
Real example & use case
Markdown by ## headers; 512-token chunks with 64 overlap; bge/e5 embeddings.
Pros & cons
Pros: Better recall when structure preserved. Cons: Tables/code need special handling.
Common mistakes
Splitting mid-sentence randomly; mixing embedding models in one index.
Best practices
Keep embedding model versioned; store metadata (source, date).
Follow-up questions
Open one as its own read / solve / listen card