What problem does it solve?
It removes friction in finding, loading, cleaning, harmonizing, and preparing Chinese social science data so you can move from raw files to analysis-ready datasets quickly.
Core Features & Use Cases
- Survey dataset access & loading: Handles common Chinese survey microdata formats (Stata/SPSS/SAS) and typical encoding issues.
- Cleaning & harmonization workflows: Converts survey-specific missing-value codes to standard missing values and harmonizes variables across waves (e.g., CGSS).
- China-specific administrative and text workflows: Supports administrative division code parsing (GB/T 2260) and Chinese text preprocessing (jieba segmentation, stopwords, term dictionary).
- Social media collection & privacy guardrails: Provides a research-oriented approach for collecting and cleaning social media text while emphasizing PIPL compliance and de-identification.
Quick Start
Load your CGSS or CFPS dataset file, clean its missing-value codes, harmonize key variables across waves, and output an analysis-ready pandas DataFrame for downstream modeling.