dev-data

Guide data pipeline design covering ingestion, ETL/ELT, and quality validation.

5|Updated Feb 26, 2026
One-click install
npx skills add https://github.com/lidge-jun/cli-jaw-skills --skill dev-data
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: dev-data
Source: https://github.com/lidge-jun/cli-jaw-skills/tree/main/dev-data
Command: npx skills add https://github.com/lidge-jun/cli-jaw-skills --skill dev-data

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This Skill provides a comprehensive guide to building robust and scalable data engineering pipelines, ensuring data quality and efficient processing.

Core Features & Use Cases

  • Data Processing Principles: Learn essential rules for pipeline thinking, schema-first design, defensive parsing, idempotency, and fail-fast error handling.
  • Ingestion Patterns: Guidance on handling various formats (CSV, JSON, Parquet, Excel, Database) and implementing incremental loading with schema validation.
  • ETL/ELT Design: Understand layered architecture, error handling strategies, and orchestration basics for complex data workflows.
  • Data Quality: Implement validation checks and data contracts to maintain data integrity.
  • Analysis & Reporting: Best practices for summary statistics, output formats, and statistical reporting.
  • Architecture Decisions: Insights into choosing between batch vs. streaming, storage solutions, and relevant tools.
  • Use Case: You need to build a daily pipeline to ingest sales data from multiple sources, clean and transform it, and load it into a data warehouse for business intelligence reporting.

Quick Start

Follow the principles outlined in this guide to design a new data pipeline.

Frequently Asked Questions about dev-data

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build a reliable data pipeline for multiple formats?

Build a reliable data pipeline by applying schema-first design, defensive parsing, and idempotency. This Skill guides ingestion patterns for CSV, JSON, and Parquet, ensuring data integrity through fail-fast error handling and validation checks.

What is the best way to implement incremental loads in ETL workflows?

Implement incremental loads in ETL workflows using schema validation and defensive parsing. This Skill provides ingestion patterns to process only new or changed data, reducing overhead while maintaining data quality and integrity across pipeline runs.

How do I ensure data quality when ingesting sales data into a warehouse?

Ensure data quality when ingesting sales data by enforcing data contracts and validation checks. This Skill outlines defensive parsing and fail-fast error handling strategies to catch anomalies early and maintain data integrity during transformation.

When should I choose batch processing vs streaming for data engineering?

Choose batch processing vs streaming based on your architectural decisions and latency requirements. This Skill provides insights into selecting between batch and streaming architectures, guiding you to the appropriate storage solutions and orchestration tools.

How does schema-first design prevent data pipeline failures?

Schema-first design prevents data pipeline failures by validating formats like JSON and Parquet before processing. This Skill explains how defensive parsing and idempotency principles create robust ETL workflows that handle schema variations gracefully.

Can I use this guide for ELT workflows and database ingestion?

Yes, you can use this guide for ELT workflows and database ingestion. It covers layered architecture, ingestion patterns for databases, and orchestration basics, helping you design complex data workflows with proper error handling.