data-quality-auditor

Audit CSV and Parquet datasets for quality and generate remediation plans.

Updated Apr 9, 2026
One-click install
npx skills add https://github.com/Patasse97/claude-skills --skill data-quality-auditor-patasse97
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: data-quality-auditor
Source: https://github.com/Patasse97/claude-skills/tree/main/engineering/data-quality-auditor
Command: npx skills add https://github.com/Patasse97/claude-skills --skill data-quality-auditor-patasse97

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes scripts (resource) and references (resource) components.

What problem does it solve?

Audit datasets for quality across completeness, consistency, accuracy, and validity, surfacing actionable remediation.

Core Features & Use Cases

  • Profile datasets to compute a Data Quality Score (DQS) with per-column details.
  • Analyze missing values, classify missingness mechanisms (MCAR/MAR/MNAR), and propose strategies.
  • Detect outliers using multiple methods and produce risk assessments for columns.
  • Use cases: data onboarding, pipeline quality checks, model readiness evaluation.

Quick Start

Run the data-quality-auditor on a CSV file to obtain a full DQS report and targeted remediation recommendations.

Frequently Asked Questions about data-quality-auditor

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I audit CSV and Parquet datasets for completeness and consistency?

Profile CSV and Parquet datasets for completeness and consistency by computing a Data Quality Score with per-column details, surfacing issues and generating a prioritized remediation plan.

What is a Data Quality Score and how does it evaluate model readiness?

A Data Quality Score (DQS) evaluates model readiness by profiling full datasets to measure completeness, consistency, accuracy, and validity, producing targeted remediation recommendations for analytics pipelines.

How do I analyze missing values and classify missingness mechanisms in my data?

Analyze missing values and classify missingness mechanisms (MCAR, MAR, MNAR) during data profiling to identify missingness patterns and propose targeted remediation strategies for your datasets.

What is the best way to detect outliers across multiple methods in analytics pipelines?

Detect outliers across analytics pipelines using multi-method outlier detection to produce risk assessments for columns, evaluating data accuracy and validity for modeling and onboarding tasks.

Can I run data quality checks on CSV and Parquet files without external dependencies?

Yes, you can run data quality checks on CSV and Parquet files without external dependencies, using the included Python tooling to profile datasets and compute a Data Quality Score directly.