datafusion-query-advisor

Analyze DataFusion queries and DataFrame operations for optimization opportunities.

2|1|Updated Oct 31, 2025
One-click install
npx skills add https://github.com/EmilLindfors/claude-marketplace --skill datafusion-query-advisor
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: datafusion-query-advisor
Source: https://github.com/EmilLindfors/claude-marketplace/tree/main/plugins/rust-data-engineering/skills/datafusion-query-advisor
Command: npx skills add https://github.com/EmilLindfors/claude-marketplace --skill datafusion-query-advisor

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill analyzes DataFusion SQL queries and DataFrame operations to identify optimization opportunities such as predicate pushdown, partition pruning, column projection, and join ordering, helping you improve performance.

Core Features & Use Cases

  • Predicate pushdown optimization: Move filters to storage layers to reduce data scanned.
  • Partition pruning: Ensure filters target partition columns to prune scans.
  • Column projection: Read only needed columns to minimize I/O.
  • Join ordering & plan analysis: Evaluate and suggest efficient join strategies.

Quick Start

Provide a DataFusion query with a WHERE filter and a JOIN, then receive rewritten, optimized query guidance.

Frequently Asked Questions about datafusion-query-advisor

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I optimize DataFusion queries for better performance?

Optimize DataFusion queries by applying predicate pushdown to move filters to storage layers, enabling partition pruning on partition columns, projecting only needed columns, and evaluating join ordering. This Skill analyzes your queries and DataFrame operations to identify these bottlenecks and provide rewritten code examples with EXPLAIN plan verification.

What is predicate pushdown and why does it matter for DataFusion?

Predicate pushdown moves WHERE clause filters down to the storage layer, reducing the amount of data scanned. For DataFusion queries, this technique dramatically improves performance by filtering data earlier in the execution plan rather than after scanning full datasets.

How do I use partition pruning to speed up DataFusion queries?

Partition pruning skips unnecessary partitions during scans by filtering on partition columns. This Skill detects when your filters target partition columns and suggests how to structure queries to enable pruning, reducing I/O and query execution time.

Why is column projection important in DataFusion queries?

Column projection reads only the columns your query needs, minimizing I/O overhead. This Skill identifies SELECT * statements on wide tables and recommends explicit column selection to reduce data movement and improve query speed.

Can I use this to analyze join order efficiency in DataFusion?

Yes. This Skill evaluates join strategies and ordering in DataFusion queries, analyzes execution plans via EXPLAIN, and suggests more efficient join sequences to reduce intermediate data shuffling and improve overall query performance.

What patterns does this Skill detect as inefficient in DataFusion?

This Skill identifies non-pushed filters, SELECT * on wide tables, improper join ordering, and missing partition column filters. It provides actionable rewrite suggestions with example code blocks and EXPLAIN plan verification for each optimization.