databricks-spark-structured-streaming

Build Spark Structured Streaming pipelines with Kafka ingestion and watermarking.

Updated Mar 19, 2026
One-click install
npx skills add https://github.com/Blackkadder/databricks-apps-and-agents-workshop --skill databricks-spark-structured-streaming-blackkadder
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: databricks-spark-structured-streaming
Source: https://github.com/Blackkadder/databricks-apps-and-agents-workshop/tree/main/.claude/skills/databricks-spark-structured-streaming
Command: npx skills add https://github.com/Blackkadder/databricks-apps-and-agents-workshop --skill databricks-spark-structured-streaming-blackkadder

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Spark Structured Streaming can be complex to implement robust, production-grade pipelines; this guide consolidates patterns, best practices, and practical examples to help data teams build reliable streaming workloads.

Core Features & Use Cases

  • Production-ready patterns for Kafka ingestion, RTM, triggers, watermarks, checkpointing, and stateful joins
  • Guidance for multi-sink writes, stream-static and stream-stream joins, and cost-aware tuning of latency and resources
  • Reference implementations and best practices across Delta, Kafka, and Spark

Quick Start

Provide a minimal end-to-end Spark Structured Streaming example that reads from a streaming source, applies a small transformation, and writes to a Delta sink with a checkpoint and a trigger.

Frequently Asked Questions about databricks-spark-structured-streaming

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build a production-grade Spark Structured Streaming pipeline from Kafka to Delta?

Build a Spark Structured Streaming pipeline by configuring Kafka ingestion, applying watermarks for late data, setting checkpointing, and writing to a Delta sink with tuned triggers. This guide provides reference implementations for reliable real-time processing.

What's the best way to handle stateful stream-stream joins in Spark Structured Streaming?

Stateful stream-stream joins in Spark Structured Streaming require watermarking both input streams to bound state size and manage late data. This skill details patterns for stream-static and stream-stream joins to ensure correct aggregation.

How does checkpointing work in Spark Structured Streaming and why do I need it?

Checkpointing in Spark Structured Streaming persists state and offsets to durable storage, enabling fault recovery and exactly-once processing. You need it to prevent data loss and duplicate writes during pipeline failures.

Can I write a single Spark Structured Streaming query to multiple sinks?

Yes, Spark Structured Streaming supports multi-sink writes by splitting a streaming DataFrame into multiple output paths. This skill covers patterns for distributing real-time data to different downstream systems concurrently.

How do I tune Spark Structured Streaming triggers for low latency?

Tune Spark Structured Streaming triggers by adjusting processing time intervals or using continuous mode for sub-millisecond latency. This guide offers cost-aware tuning strategies to balance resource allocation and real-time processing latency.

Does Spark Structured Streaming work with Delta Lake for real-time mode operations?

Yes, Spark Structured Streaming integrates natively with Delta Lake for real-time mode operations, supporting exactly-once writes and schema enforcement. The skill provides quick start examples for Delta sink configurations.