What problem does it solve?
RAG Architect helps architects and engineers design retrieval-augmented generation systems that reliably ground LLM outputs in source documents while balancing latency, accuracy, and cost. It reduces ambiguity in selecting vector stores, embedding models, chunking strategies, and retrieval pipelines so teams can deploy factual, auditable assistants. It codifies production best practices to avoid common pitfalls like poor chunking, weak reranking, and unversioned embeddings.
Core Features & Use Cases
- Vector database selection and trade-off analysis (Pinecone, Weaviate, Qdrant, Chroma, pgvector).
- Document ingestion, chunking strategies (fixed, recursive, semantic, markdown-aware, late chunking), and metadata enrichment.
- Embedding model guidance, hybrid search design (vector + keyword), reranking, HyDE, and evaluation (precision@k, MRR, NDCG).
- Use Case: Build a scalable knowledge-grounded chatbot for an enterprise knowledge base with multi-tenant filtering, reranking, and continuous monitoring.
Quick Start
Use the rag-architect skill to design a vector store, chunking strategy, and retrieval pipeline for a customer support knowledge base.