PyMC Data Handling

Manage mutable PyMC data containers with pm.Data and pm.Minibatch APIs.

Updated Mar 19, 2026
One-click install
npx skills add https://github.com/benmaier/decision-agent-placeholder --skill pymc-data-handling
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: PyMC Data Handling
Source: https://github.com/benmaier/decision-agent-placeholder/tree/main/decision-packs/mmm/opencode/skills/data
Command: npx skills add https://github.com/benmaier/decision-agent-placeholder --skill pymc-data-handling

SYSTEM DOCUMENTATION & REQUIREMENTS

What problem does it solve?

PyMC users often struggle to manage changing datasets within a single model, needing reliable data containers that can be updated between fits and predictions.

Core Features & Use Cases

  • Data container creation and updates with pm.Data to reflect new inputs during training and forecasting.
  • Mini-batch support with pm.Minibatch for scalable stochastic optimization on larger datasets.
  • Real-world workflow examples include train/test splits, cross-validation, and updating coordinates for predictions.

Quick Start

Provide a minimal PyMC model that uses Data and Minibatch to demonstrate updating data containers and running a small posterior sample.

Frequently Asked Questions about PyMC Data Handling

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I update data inside a PyMC model for predictions without redefining the graph?

You can update mutable data inside PyMC models by using pm.Data containers, which allow swapping inputs during training and forecasting without rebuilding the underlying probabilistic graph.

Can I use mini-batch stochastic optimization on large datasets in PyMC?

Yes, scalable stochastic optimization on larger datasets is supported using the pm.Minibatch API, which requires optional likelihood scaling to ensure accurate posterior inference during training.

What is the best way to handle train and test splits for Bayesian models in PyMC?

Handling train and test splits in PyMC is best achieved using pm.Data containers, enabling robust data updates and coordinate handling to seamlessly transition between fitting and validation workflows.

How do you manage coordinates when updating PyMC data containers for new predictions?

Managing coordinates during prediction involves updating pm.Data container mappings to reflect new dataset shapes, ensuring dimension alignment remains consistent across varying inputs during inference.

Does PyMC support dynamic data shapes for cross-validation workflows?

PyMC supports dynamic dataset shapes for cross-validation through pm.Data containers, allowing robust updates to varying data sizes and shapes between iterative training and validation steps.

Why do I need to scale the likelihood when using pm.Minibatch in PyMC?

Scaling the likelihood is required when using pm.Minibatch because it corrects the probabilistic inference scale, ensuring posterior samples accurately reflect the full dataset rather than the mini-batch subset.