analyze-data-quality

Identify data quality issues across datasets, tables, files, or dataframes.

488|76|Updated Jun 2, 2026
One-click install
npx skills add https://github.com/openai/role-specific-plugins --skill analyze-data-quality
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: analyze-data-quality
Source: https://github.com/openai/role-specific-plugins/tree/main/plugins/data-analytics/skills/analyze-data-quality
Command: npx skills add https://github.com/openai/role-specific-plugins --skill analyze-data-quality

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Assess data quality and trustworthiness of datasets, tables, files, or dataframes to prevent flawed analyses and decisions.

Core Features & Use Cases

  • Quality checks: completeness, uniqueness, validity, and integrity across datasets.
  • Contextual diagnostics: identify grain, freshness, null rates, duplicates, schema drift, leakage, and backfills with actionable evidence.
  • Operational guidance: provide concrete remediation steps for dashboards, experiments, pipelines, and models.

Quick Start

Run a preflight check on your dataset to identify quality risks and suggested fixes.

Frequently Asked Questions about analyze-data-quality

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I check data quality issues like nulls and duplicates before analysis?

Data profiling identifies quality risks like nulls, duplicates, and schema drift across datasets to prevent flawed analysis. It provides concise evidence, likely causes, and actionable remediation steps to ensure trustworthiness before modeling.

What is data quality assurance for dashboards and pipelines?

Data quality assurance for dashboards and pipelines involves verifying completeness, uniqueness, validity, and referential integrity. It identifies grain mismatches, freshness issues, and backfills, providing concrete remediation steps to prevent flawed decisions.

How do I detect schema drift and referential integrity issues in a dataframe?

Detecting schema drift and referential integrity issues in a dataframe requires applying contextual diagnostics across the dataset. This identifies structural mismatches and broken relationships, delivering risk assessments and recommended tests for your pipelines.

Can I use data profiling to identify data leakage and backfills in experiments?

Yes, you can use data profiling to identify data leakage and backfills in experiments. The assessment checks for source mismatches and freshness issues, providing actionable evidence and remediation steps to protect experimental validity.

What is the best way to assess dataset trustworthiness for modeling workflows?

The best way to assess dataset trustworthiness for modeling workflows is running a preflight quality check. This evaluates completeness, uniqueness, and source mismatches, yielding a clear risk assessment and recommended fixes.