embedding-strategies

Select embedding models and tune chunking for semantic search and RAG pipelines.

Updated Aug 23, 2026
One-click install
npx skills add https://github.com/Maykesantos98/Fiap-Totvs --skill embedding-strategies-maykesantos98
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: embedding-strategies
Source: https://github.com/Maykesantos98/Fiap-Totvs/tree/main/.claude/skills/embedding-strategies
Command: npx skills add https://github.com/Maykesantos98/Fiap-Totvs --skill embedding-strategies-maykesantos98

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Embedding models and chunking choices often lead to poor semantic search and weak RAG results, causing irrelevant retrieval, wasted API calls, and slow iteration.

Core Features & Use Cases

  • Embedding model selection & comparison: pick the best model for prose, code search, finance, legal, or multilingual domains based on dimensions and token limits.
  • Embedding pipeline optimization: design chunking, preprocessing, normalization, batching, and dimension reduction to improve retrieval quality.
  • Quality evaluation & benchmarking: compare models using precision@k, recall@k, MRR, and nDCG, then tune decisions from evidence.

Quick Start

Tell the AI which language(s) and document type you have (e.g., English sales calls, Portuguese manuals, or code), what vector database/retriever you use, and your desired latency/cost target, then ask it to recommend an embedding model plus chunking parameters and an evaluation plan.

Frequently Asked Questions about embedding-strategies

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I choose the best embeddings for RAG?

To choose the best embeddings for RAG, compare domain-specific models using precision@k, recall@k, MRR, and nDCG. Evaluate prose, code, finance, or legal models based on token limits and dimensions to optimize semantic search relevance.

What is the best way to chunk documents for semantic search?

The best way to chunk documents for semantic search is applying overlap-aware chunk sizing alongside text preprocessing and normalization. This optimizes the embedding pipeline to improve retrieval quality and prevent missing context during vector search.

How do I benchmark vector search quality for multilingual content?

Benchmark vector search quality for multilingual content by iteratively comparing embedding models using retrieval metrics like MRR and nDCG. Select models designed for multilingual domains and evaluate them against your specific document types and target latency.

Does vector dimension reduction improve RAG relevance?

Vector dimension reduction can improve RAG relevance by optimizing storage and retrieval latency. Evaluate dimension reduction options during embedding pipeline optimization to balance retrieval speed against semantic search accuracy using benchmarking metrics.

Why does my RAG retrieval return irrelevant results?

RAG retrieval returns irrelevant results due to poor embedding model selection and improper chunking. Fix this by tuning overlap-aware chunk sizing, applying text normalization, and benchmarking new models using precision@k and recall@k metrics.