rag-architect

Design, implement and optimize Retrieval Augmented Generation pipelines.

Updated Mar 12, 2026
One-click install
npx skills add https://github.com/Fantasia1999/claude-skills-zh --skill rag-architect-fantasia1999
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: rag-architect
Source: https://github.com/Fantasia1999/claude-skills-zh/tree/main/translations/engineering/rag-architect
Command: npx skills add https://github.com/Fantasia1999/claude-skills-zh --skill rag-architect-fantasia1999

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill provides a comprehensive toolkit and knowledge base for designing, implementing, and optimizing production-grade Retrieval Augmented Generation (RAG) pipelines, enabling the creation of scalable, efficient, and accurate retrieval systems.

Core Features & Use Cases

  • Document Processing & Chunking: Strategies for splitting documents into manageable pieces (fixed-size, sentence-based, semantic, etc.).
  • Embedding Model Selection: Guidance on choosing embedding models based on dimensionality, speed, quality, and domain.
  • Vector Database Options: Overview of popular vector databases like Pinecone, Weaviate, Qdrant, Chroma, and pgvector.
  • Retrieval Strategies: Explores dense, sparse, and hybrid retrieval methods, along with reranking techniques.
  • Query Transformation: Techniques like HyDE, Multi-Query Generation, and Step-Back Prompting to improve retrieval.
  • Context Window Optimization: Methods for dynamic context assembly and compression.
  • Evaluation Frameworks: Metrics and tools for assessing RAG system performance (faithfulness, relevance, RAGAS).
  • Production Best Practices: Strategies for caching, streaming, graceful degradation, and cost optimization.
  • Guardrails & Safety: Content filtering, query security, and response safety measures.
  • Use Case: A developer needs to build a RAG system for customer support documentation. This Skill guides them through selecting the right chunking strategy, embedding model, vector database, and evaluation metrics to ensure accurate and relevant responses.

Quick Start

Use the rag-architect skill to explore strategies for optimizing document chunking in RAG pipelines.

Frequently Asked Questions about rag-architect

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
What is the best way to chunk documents for a RAG pipeline?

Document chunking strategies for RAG pipelines include fixed-size, sentence-based, and semantic splitting to balance context retention and retrieval precision. Choosing the right method ensures your embedding model receives manageable text pieces for accurate vector search.

How do I choose a vector database for my retrieval augmented generation system?

Choosing a vector database for retrieval augmented generation involves evaluating options like Pinecone, Weaviate, Qdrant, Chroma, and pgvector based on scalability and latency. Your selection directly dictates the retrieval speed and filtering capabilities of your production RAG system.

Can query transformation techniques like HyDE improve RAG retrieval?

Query transformation techniques like HyDE, Multi-Query Generation, and Step-Back Prompting improve RAG retrieval by reformulating user queries. These methods bridge the semantic gap between the query and indexed documents, yielding higher search relevance.

How do I evaluate RAG pipeline performance in production?

Evaluating RAG pipeline performance requires frameworks measuring faithfulness and relevance using metrics like RAGAS. By systematically assessing retrieval precision and generation quality, you can validate that your retrieval augmented generation system meets production standards.

What are the best practices for RAG cost management and deployment?

RAG cost management and deployment best practices involve implementing caching, streaming, and graceful degradation to optimize operational expenses. Applying these production strategies ensures your retrieval augmented generation pipeline remains scalable and efficient under heavy query loads.