rag-architect

Design retrieval-augmented generation systems with vector databases, chunking, and reranking pipelines.

Updated Mar 17, 2026
One-click install
npx skills add https://github.com/Estom/aiflex --skill rag-architect-estom
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: rag-architect
Source: https://github.com/Estom/aiflex/tree/main/skills-repo/Jeffallan-skills/rag-architect
Command: npx skills add https://github.com/Estom/aiflex --skill rag-architect-estom

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

RAG Architect helps architects and engineers design retrieval-augmented generation systems that reliably ground LLM outputs in source documents while balancing latency, accuracy, and cost. It reduces ambiguity in selecting vector stores, embedding models, chunking strategies, and retrieval pipelines so teams can deploy factual, auditable assistants. It codifies production best practices to avoid common pitfalls like poor chunking, weak reranking, and unversioned embeddings.

Core Features & Use Cases

  • Vector database selection and trade-off analysis (Pinecone, Weaviate, Qdrant, Chroma, pgvector).
  • Document ingestion, chunking strategies (fixed, recursive, semantic, markdown-aware, late chunking), and metadata enrichment.
  • Embedding model guidance, hybrid search design (vector + keyword), reranking, HyDE, and evaluation (precision@k, MRR, NDCG).
  • Use Case: Build a scalable knowledge-grounded chatbot for an enterprise knowledge base with multi-tenant filtering, reranking, and continuous monitoring.

Quick Start

Use the rag-architect skill to design a vector store, chunking strategy, and retrieval pipeline for a customer support knowledge base.

Frequently Asked Questions about rag-architect

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I design a production-ready RAG system for an enterprise knowledge base?

Design production-ready RAG systems by codifying vector database selection, chunking strategies, and hybrid retrieval pipelines to ground LLM outputs in factual sources with low-latency deployment.

What is the best chunking strategy for retrieval-augmented generation pipelines?

Optimal RAG chunking strategies include fixed, recursive, semantic, markdown-aware, and late chunking, selected based on document structure to balance retrieval precision and context preservation.

How do I choose a vector database for a multi-tenant RAG chatbot?

Compare vector databases like Pinecone, Weaviate, Qdrant, Chroma, and pgvector by analyzing scalability, metadata filtering, and tenant isolation requirements for your retrieval workloads.

How does hybrid search and reranking improve RAG retrieval accuracy?

Hybrid search combines vector and keyword retrieval to cast a wider net, while reranking models reorder candidates using precision@k, MRR, and NDCG metrics to maximize answer relevance.

Do I need embedding versioning and idempotent ingestion for RAG systems?

Yes, embedding versioning tracks model updates to avoid mismatched vectors, while idempotent ingestion with deduplication prevents duplicate document chunks from corrupting retrieval results.

Can I use HyDE and late chunking to optimize semantic search in RAG?

Use HyDE to generate hypothetical document embeddings for better query matching, and apply late chunking to preserve full document context during semantic search embedding generation.