What problem does it solve?
This Skill helps you turn raw, noisy web-scale data into high-quality training datasets for language and multimodal models by removing duplicates, filtering low-value content, and redacting sensitive information.
Core Features & Use Cases
- Quality filtering: Apply 30+ heuristics to remove short, repetitive, noisy, or low-signal documents before training.
- Deduplication: Use exact, fuzzy, or semantic deduplication to eliminate repeated and near-repeated samples efficiently on GPU.
- Privacy and safety cleanup: Redact PII and filter unsafe content such as NSFW material during dataset preparation.
- Multimodal curation: Support text, image, video, and audio pipelines for broader dataset preparation workflows.
- Use case: Prepare a Common Crawl or internal corpus for LLM training by cleaning it, deduplicating it, and exporting a curated Parquet dataset.
Quick Start
Ask the skill to curate your dataset by filtering low-quality records, deduplicating near-duplicates, and redacting PII before exporting the cleaned output.