What problem does it solve?
Provides standardized, AI-ready therapeutics datasets and benchmarks so you can evaluate drug discovery and therapeutic ML models with correct splits, consistent formats, and reproducible protocols.
Core Features & Use Cases
- Curated therapeutic datasets across the pipeline: Supports single-instance prediction (molecular/protein properties), multi-instance prediction (DTI/DDI/PPI-like interactions), and generation tasks (molecule generation and retrosynthesis).
- Meaningful dataset splits: Enables scaffold splits for chemical diversity and cold splits for DTI/DDI generalization scenarios (unseen drugs and/or targets).
- Unified evaluation workflow: Works with standardized evaluators and benchmark-group evaluation across multiple seeds for robust comparison.
- Molecular property oracles for optimization: Provides oracles for property prediction and goal-directed optimization to score candidate molecules.
Quick Start
Use the pytdc skill to load the ADME dataset Caco2_Wang and obtain scaffold-based train/valid/test splits for model evaluation.