What problem does it solve?
Genomic interval analysis is slow and hard to search because BED files and peak regions lack compact, comparable representations for ML and similarity queries, especially across experiments and single cells.
Core Features & Use Cases
- Region2Vec embeddings for BED similarity: Learn unsupervised vector representations of genomic regions suitable for clustering, dimensionality reduction, and downstream ML features.
- BEDspace joint embeddings for regions and metadata: Train shared embeddings that support metadata-aware queries across region sets and labels using a StarSpace-style workflow.
- scEmbed for single-cell ATAC-seq: Produce cell-level embeddings from scATAC-seq peak coordinates for clustering and visualization in scanpy-compatible formats.
- Consensus peak “universe” building: Create standardized peak vocabularies from BED collections using CC/CCF/ML/HMM methods to improve tokenization consistency.
- Utilities for tokenization, caching, evaluation, and null models: Support practical ML workflows via tokenization helpers, BED caching, randomization (BEDshift), and embedding quality evaluation.
Quick Start
Use geniml to build a consensus universe from your combined BED files and then train Region2Vec embeddings for region similarity search.