databricks-spark-structured-streaming

Develop Spark Structured Streaming pipelines on Databricks with Kafka ingestion and Delta writes.

38|12|Updated Apr 24, 2026
One-click install
npx skills add https://github.com/databrickslabs/coding-agents-databricks-apps --skill databricks-spark-structured-streaming-databrickslabs
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: databricks-spark-structured-streaming
Source: https://github.com/databrickslabs/coding-agents-databricks-apps/tree/main/.claude/skills/databricks-spark-structured-streaming
Command: npx skills add https://github.com/databrickslabs/coding-agents-databricks-apps --skill databricks-spark-structured-streaming-databrickslabs

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

This Skill eliminates the fragmented, error-prone process of building production Spark Structured Streaming pipelines on Databricks by providing consolidated, production-proven patterns for common streaming workloads, reducing debugging time and preventing costly pipeline failures.

Core Features & Use Cases

  • End-to-End Streaming Patterns: Pre-built implementations for Kafka ingestion, stream-stream and stream-static joins, multi-sink medallion architectures, and Delta MERGE operations for upserts and CDC.
  • Production Hardening: Best practices for checkpoint management, state store configuration, watermark tuning, and exactly-once semantics to ensure pipeline reliability and fault tolerance.
  • Cost & Performance Optimization: Guidance on trigger selection, Real-Time Mode configuration, cluster right-sizing, and storage optimization to balance latency requirements with infrastructure costs. Use case example: For instance, use this Skill to implement a Kafka-to-Delta ingestion pipeline with stateful deduplication, parallel writes to bronze/silver/gold tables, and automated checkpoint backup, all configured to meet production SLAs.

Quick Start

Use the databricks-spark-structured-streaming skill to build a production-ready Kafka to Delta streaming pipeline with checkpointing, stateful deduplication, and multi-sink writes to medallion tables.

Frequently Asked Questions about databricks-spark-structured-streaming

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I build a production-grade Spark Structured Streaming pipeline on Databricks?

Build production-grade Spark Structured Streaming pipelines on Databricks by applying pre-built patterns for Kafka ingestion, stream joins, stateful operations, and multi-sink writes. Use checkpoint management and watermark tuning to ensure exactly-once semantics and pipeline reliability.

What is the best way to ingest Kafka data into Delta Lake using Spark Structured Streaming?

Ingest Kafka data into Delta Lake using Spark Structured Streaming by implementing stateful deduplication, parallel writes to medallion architecture tables, and automated checkpoint backups. This approach balances latency requirements with infrastructure costs for production workloads.

How does checkpoint management work for Spark Structured Streaming stateful operations?

Checkpoint management for Spark Structured Streaming stateful operations ensures fault tolerance and exactly-once semantics by reliably storing state and progress. Proper state store configuration and checkpoint backup prevent data loss and costly pipeline failures during recovery.

Can I perform stream-stream and stream-static joins in Databricks Spark Structured Streaming?

Perform stream-stream and stream-static joins in Databricks Spark Structured Streaming using pre-built implementation patterns. Watermark tuning and state store configuration are essential to manage state scalability and prevent unbounded state growth during continuous workloads.

How do I optimize Spark Structured Streaming costs and latency for continuous workloads on Databricks?

Optimize Spark Structured Streaming costs and latency on Databricks by selecting appropriate triggers, configuring Real-Time Mode, and right-sizing clusters. Storage optimization and trigger tuning balance infrastructure costs with strict production SLA latency requirements.

Why do my Spark Structured Streaming pipelines fail during Delta MERGE operations for upserts and CDC?

Spark Structured Streaming pipelines fail during Delta MERGE operations for upserts and CDC due to improper checkpoint management or state store misconfiguration. Applying production-proven merge optimization patterns reduces debugging time and prevents costly pipeline failures.