results-analysis

Analyze ML experiment outputs and generate validated statistics, figures, and Results drafts.

2|Updated Apr 12, 2026
One-click install
npx skills add https://github.com/Clay-HHK/claude-config --skill results-analysis-clay-hhk
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: results-analysis
Source: https://github.com/Clay-HHK/claude-config/tree/main/skills/results-analysis
Command: npx skills add https://github.com/Clay-HHK/claude-config --skill results-analysis-clay-hhk

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

This skill closes the gap between raw ML/AI experiment outputs and publication-quality Results sections by transforming disparate experiment logs into validated statistics, clear visualizations, and ready-to-use Results text that meet common conference standards.

Core Features & Use Cases

  • Experimental Data Analysis: Load and validate CSV, JSON, TensorBoard logs, and pickled results; detect missing values, outliers, and reproducibility metadata.
  • Statistical Validation: Compute means, standard deviation/standard error, confidence intervals, run Shapiro-Wilk/Levene pre-checks, perform t-tests, ANOVA, Wilcoxon, and apply multiple-comparison corrections while reporting p-values and effect sizes.
  • Visualization & Reporting: Specify publication-quality figure requirements (vector formats, colorblind palettes, error bars), generate visualization specs, and assemble analysis-report.md and results-draft.md for direct inclusion in papers.
  • Use Cases: Model performance comparisons, ablation studies, hyperparameter sensitivity analysis, multi-dataset evaluation, and preparing the Results section of academic papers.

Quick Start

Analyze the experiment folder and produce an analysis-report.md, publication-quality figure files, and a results-draft.md that summarizes statistical tests, effect sizes, and figure captions.

Frequently Asked Questions about results-analysis

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I convert ML experiment data into a paper-ready Results section?

You can convert ML experiment data into a paper-ready Results section by loading CSV, JSON, TensorBoard logs, or pickled outputs to automatically compute validated statistics, generate publication-quality figures, and draft a results-draft.md file.

What statistical tests should I run for machine learning model comparison?

For machine learning model comparison, standard practice involves running t-tests, ANOVA, and Wilcoxon tests with multiple-comparison corrections, preceded by Shapiro-Wilk and Levene pre-checks, to compute p-values and effect sizes.

Can I use TensorBoard logs for significance testing and ablation study analysis?

Yes, TensorBoard logs can be used for significance testing and ablation study analysis by loading them to detect missing values, compute means and confidence intervals, and generate an analysis-report.md with validated statistics.

Does this tool support hyperparameter sensitivity analysis with multiple datasets?

Yes, this tool supports hyperparameter sensitivity analysis with multiple datasets by ingesting disparate experiment outputs, performing data validation, computing statistical summaries, and specifying publication-quality visualization requirements.

What is the best way to generate publication-quality figures from CSV experiment results?

The best way to generate publication-quality figures from CSV experiment results is to process the data to specify vector formats, colorblind palettes, and error bars, outputting visualization files alongside an analysis report.

Why does my ablation study analysis report missing values and reproducibility metadata?

Your ablation study analysis report flags missing values and reproducibility metadata because the data validation process detects these issues during the loading of CSV, JSON, TensorBoard logs, and pickled experiment outputs.