rag-architect

Design retrieval-augmented generation architectures with hybrid search and reranking.

14|Updated Feb 5, 2026
One-click install
npx skills add https://github.com/alexander-danilenko/ai-skills --skill rag-architect-alexander-danilenko
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: rag-architect
Source: https://github.com/alexander-danilenko/ai-skills/tree/main/skills/rag-architect
Command: npx skills add https://github.com/alexander-danilenko/ai-skills --skill rag-architect-alexander-danilenko

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Provides expert design guidance and operational workflows to build retrieval-augmented generation systems that ground LLM outputs in factual documents while balancing latency, cost, and relevance.

Core Features & Use Cases

  • Vector store and index design: recommendations for Pinecone, Weaviate, Qdrant, Chroma, and pgvector with trade-offs.
  • Chunking & ingestion pipelines: strategies for fixed, recursive, sentence, semantic, document-aware, and late chunking plus idempotent ingestion and metadata enrichment.
  • Retrieval optimization & evaluation: hybrid search, reranking, HyDE, query expansion, monitoring, and metrics (precision@k, recall@k, MRR, NDCG) for chatbots, Q&A, and knowledge-grounded apps.

Quick Start

Design a RAG architecture for a customer support chatbot that includes document ingestion, semantic chunking, embedding selection, a vector database choice, hybrid retrieval with reranking, and an evaluation plan.

Frequently Asked Questions about rag-architect

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I design a production-grade RAG architecture for a chatbot?

To design a production-grade RAG architecture, define document ingestion, semantic chunking, embedding selection, vector database indexing, hybrid retrieval with reranking, and metrics tracking. This grounds LLM outputs in factual documents while balancing latency, cost, and relevance.

What chunking strategies work best for retrieval-augmented generation pipelines?

Chunking strategies for retrieval-augmented generation include fixed, recursive, sentence, semantic, document-aware, and late chunking. Selecting the right strategy ensures accurate document ingestion and metadata enrichment for downstream vector search retrieval.

How do I choose between Pinecone, Weaviate, Qdrant, Chroma, and pgvector for vector search?

Choosing a vector database like Pinecone, Weaviate, Qdrant, Chroma, or pgvector requires analyzing trade-offs in index design, hybrid vector+keyword retrieval support, metadata filtering, and embedding versioning to meet your specific scale requirements.

What evaluation metrics should I track for RAG system retrieval optimization?

RAG system retrieval optimization requires tracking evaluation metrics including precision@k, recall@k, MRR, and NDCG. Monitoring these metrics alongside query expansion and HyDE techniques ensures relevant knowledge retrieval at scale.

Does this RAG design approach support idempotent ingestion and embedding versioning?

Yes, this RAG design approach explicitly supports idempotent ingestion and embedding versioning. These features are required alongside metadata filtering and hybrid search to maintain production-grade document retrieval accuracy and consistency.