What problem does it solve?
This Skill streamlines the preparation of high-quality training data for LLMs, automating data curation tasks like deduplication, filtering, and redaction.
Core Features & Use Cases
- GPU-accelerated Processing: Leverages GPUs for fast data curation, significantly reducing processing time.
- Multimodal Support: Works with text, images, video, and audio data.
- Use Case: Prepare a comprehensive dataset for LLM training by cleaning, deduplicating, and filtering web data using this Skill.
Quick Start
Use nemo-curator to prepare a dataset by running the following commands:
uv pip install "nemo-curator[all_cuda12]"
from nemo_curator import ScoreFilter, Modify
from nemo_curator.datasets import DocumentDataset
df = pd.DataFrame({"text": ["Example text", "Another example"]})
dataset = DocumentDataset(df)
filtered = ScoreFilter(lambda doc: len(doc["text"].split()) > 5)(dataset)
filtered.to_parquet("curated_data/")