auditing-data-quality

Audit tabular datasets for data quality issues before modeling.

2|Updated May 23, 2026
One-click install
npx skills add https://github.com/rocklambros/rcs --skill auditing-data-quality
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: auditing-data-quality
Source: https://github.com/rocklambros/rcs/tree/main/skills/workflow/auditing-data-quality
Command: npx skills add https://github.com/rocklambros/rcs --skill auditing-data-quality

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This Skill audits a new tabular dataset before modeling so you can catch missingness, bad ranges, mislabeled columns, duplicates, and conflicting facts before they contaminate analysis or training.

Core Features & Use Cases

  • Per-column audit: Reports null counts, null percentages, distinct counts, and summary statistics for each field.
  • Semantic typing: Infers whether a column is an ID, categorical, continuous, ordinal, text, datetime, or boolean so downstream handling matches the data.
  • Risk detection: Flags outliers, suspicious cardinality, range violations, exact duplicates, same-content-different-ID duplicates, and conflicting fact pairs.
  • Use case: A team receives a new patient CSV and needs a go or no-go verdict before fitting any model.

Quick Start

Use the auditing-data-quality skill to inspect the attached dataset and return a full audit with shape, per-column stats, semantic classes, range checks, outlier flags, cardinality alarms, and row-level integrity findings.

Frequently Asked Questions about auditing-data-quality

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I audit tabular data for quality issues before model training?

To audit tabular data before modeling, run a dataset audit to generate per-column null counts, summary statistics, semantic typing, and outlier flags. This process catches missingness, bad ranges, and duplicates before they contaminate analysis or training.

What is semantic typing and how does it detect dataset anomalies?

Semantic typing infers whether a column is an ID, categorical, continuous, or datetime to match downstream handling with the data. It detects dataset anomalies by flagging suspicious cardinality, range violations, and conflicting fact pairs during the audit.

Can I use this dataset audit on CSV and Parquet files?

Yes, you can use this dataset audit on newly received CSV, Parquet, or DataFrame inputs. It processes bounded datasets to produce a go or no-go verdict by checking schema-shape changes and row-level integrity before fitting any model.

How do I find duplicate rows and conflicting facts in a DataFrame?

To find duplicate rows and conflicting facts in a DataFrame, apply row-level integrity checks. This identifies exact duplicates, same-content-different-ID duplicates, and conflicting fact pairs to prevent bad data from contaminating your analysis.

What's the best way to check for sudden metric regressions in a dataset?

The best way to check for sudden metric regressions is to run a pre-training audit on bounded datasets. This flags outliers, range violations, and cardinality alarms, providing a comprehensive shape and per-column statistics report.