databricks-spark-structured-streaming

Design and operate Spark Structured Streaming pipelines with Kafka, Delta Lake, and multi-sink architectures.

1|Updated Dec 15, 2025
One-click install
npx skills add https://github.com/lucaslessachaves/default --skill databricks-spark-structured-streaming-lucaslessachaves
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: databricks-spark-structured-streaming
Source: https://github.com/lucaslessachaves/default/tree/main/.claude/skills/databricks-spark-structured-streaming
Command: npx skills add https://github.com/lucaslessachaves/default --skill databricks-spark-structured-streaming-lucaslessachaves

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Patterns and best practices to design, implement, and optimize Spark Structured Streaming pipelines for production-grade workloads.

Core Features & Use Cases

  • Comprehensive patterns for Kafka streaming, stream-stream joins, stream-static joins, and multi-sink writes.
  • Guidance on production readiness including RTM, triggers, watermarks, state stores, monitoring, and cost optimization.
  • Real-world use cases across Bronze/Silver/Gold medallion architectures and CDC scenarios.

Quick Start

Apply a basic Kafka-to-Delta streaming example using the included patterns to validate end-to-end behavior.

Frequently Asked Questions about databricks-spark-structured-streaming

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build production-ready Spark Structured Streaming pipelines with Kafka and Delta Lake?

Production-ready Spark Structured Streaming pipelines use patterns for Kafka ingestion, Delta Lake sinks, multi-sink writes, watermarks, and state management to ensure reliable streaming workloads.

What's the best way to optimize costs in Spark Structured Streaming workloads?

Cost optimization in Spark Structured Streaming involves configuring triggers, managing state stores efficiently, and applying watermark strategies to control resource consumption during processing.

How do I implement triggers and watermarks for state management in Spark Streaming?

Triggers and watermarks in Spark Streaming define processing time boundaries and handle late data, which configures state management for reliable event-time processing across pipelines.

Can I use Spark Structured Streaming for CDC scenarios and medallion architectures?

Spark Structured Streaming supports Change Data Capture scenarios and Bronze/Silver/Gold medallion architectures through stream-static joins and multi-sink write patterns.

Does Spark Structured Streaming support stream-stream joins and multi-sink writes?

Spark Structured Streaming supports stream-stream joins and multi-sink writes, providing comprehensive patterns to route and aggregate data across multiple downstream targets.

Why do I need checkpoints when designing Kafka to Delta Lake streaming pipelines?

Checkpoints in Kafka to Delta Lake streaming pipelines maintain state and recovery information, preventing data loss and duplication during job restarts or failures.