What problem does it solve?
PyTDC provides AI-ready datasets and benchmarks for drug discovery and development, offering curated ADME, toxicity, and drug-target datasets with standardized splits and evaluation metrics to accelerate model benchmarking and reproducibility.
Core Features & Use Cases
- Comprehensive data categories: Single-Instance tasks (ADME, Toxicity, HTS, QM), Multi-Instance tasks (DTI, DDI, PPI, etc), and Generation tasks (MolGen, RetroSyn, PairMolGen).
- Benchmarking infrastructure: scaffold, cold, temporal splits, and built-in evaluation routines with example workflows and utility scripts.
- Operational workflows: load data, split, evaluate, and compare models; access generation oracles and molecular utilities for end-to-end drug discovery experiments.
Quick Start
Install PyTDC and load a dataset such as ADME(name='Caco2_Wang') and call get_split to obtain train/valid/test partitions.