What problem does it solve?
This Skill helps you analyze and transform large CSV, Parquet, and JSON datasets efficiently using DuckDB, avoiding slow loading and memory issues common with traditional tooling.
Core Features & Use Cases
- Direct File Query (SQL on files): Run complex SQL directly against CSV/Parquet/JSON (including wildcards and remote URLs via extensions).
- Scalable Data Profiling & Quality Checks: Generate schema, statistics (optionally sampled), NULL/completeness metrics, duplicates, and sample rows for rapid understanding.
- ETL Pipeline Template: Build extract-transform-load workflows with optional column selection, filtering, partitioning, compression, and retry-based loading.
- Performance Optimization Guidance: Use DuckDB-specific tactics like predicate pushdown, column pruning, parallelism, and EXPLAIN/PRAGMA profiling.
Quick Start
Run the profiling script on a dataset (for example, data/*.parquet) to produce a Markdown data profile report with schema, statistics, and data quality metrics.