databricks-spark-structured-streaming

Guide Spark Structured Streaming pipelines with Kafka, joins, and Delta optimizations.

Updated Sep 9, 2017
One-click install
npx skills add https://github.com/mirakui/dotfiles --skill databricks-spark-structured-streaming-mirakui
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: databricks-spark-structured-streaming
Source: https://github.com/mirakui/dotfiles/tree/main/claude/skills/databricks-spark-structured-streaming
Command: npx skills add https://github.com/mirakui/dotfiles --skill databricks-spark-structured-streaming-mirakui

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

Provide production-ready guidance and patterns to build reliable Spark Structured Streaming pipelines with best practices for ingestion, stateful processing, and performance optimization.

Core Features & Use Cases

  • Kafka-to-Delta streaming for real-time ingestion
  • Stream-static and stream-stream joins with watermarking and state management
  • Multi-sink writes and MERGE-based upserts for medallion architectures

Quick Start

Start with a basic Kafka-to-Delta streaming pipeline: read from Kafka, parse JSON, and write to Delta with a checkpoint.

Frequently Asked Questions about databricks-spark-structured-streaming

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build a Spark Structured Streaming pipeline for Kafka to Delta Lake ingestion?

To build a Spark Structured Streaming pipeline for Kafka to Delta Lake ingestion, you read from Kafka, parse the JSON payloads, and write to Delta with a configured checkpoint. This pattern provides reliable, real-time data ingestion in Databricks environments.

What's the best way to handle stateful processing and watermarking in Spark Structured Streaming?

The best way to handle stateful processing and watermarking is configuring the state store with RocksDB and applying watermarking to manage late data. This ensures reliable stream-stream and stream-static joins without unbounded state growth.

How do I perform MERGE-based upserts in a Spark Structured Streaming medallion architecture?

To perform MERGE-based upserts in a medallion architecture, you use Delta MERGE optimizations within your streaming pipeline to update and insert records. This supports multi-sink writes for continuous data reconciliation.

Does Spark Structured Streaming work with stream-static and stream-stream joins in Databricks?

Yes, Spark Structured Streaming works with both stream-static and stream-stream joins in Databricks. It applies watermarking and state management to ensure deterministic processing patterns and robust data merging.

How do I tune Spark Structured Streaming performance using Liquid Clustering?

You tune Spark Structured Streaming performance using Liquid Clustering and Delta MERGE optimizations to optimize file layout and query speed. These features reduce small file problems and accelerate downstream read performance.

Why do I need checkpointing in Spark Structured Streaming pipelines?

You need checkpointing in Spark Structured Streaming pipelines to provide fault tolerance and exactly-once processing guarantees. It tracks the streaming query's progress and state information to recover seamlessly from failures.