geniml

Learn unsupervised embeddings from genomic interval data for region-level similarity and clustering.

18|1|Updated Dec 27, 2025
One-click install
npx skills add https://github.com/LogauaEngstrom/claude-scientific-skills --skill geniml-logauaengstrom
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: geniml
Source: https://github.com/LogauaEngstrom/claude-scientific-skills/tree/main/scientific-skills/geniml
Command: npx skills add https://github.com/LogauaEngstrom/claude-scientific-skills --skill geniml-logauaengstrom

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill includes references (resource) components.

What problem does it solve?

Geniml provides a flexible framework to learn unsupervised embeddings from genomic interval data (BED files), enabling region- and cell-level representations for similarity search, clustering, and downstream machine learning.

Core Features & Use Cases

  • Region2Vec: Train region embeddings from BED data for dimensionality reduction and feature vectors.
  • BEDspace: Joint region and metadata embeddings for metadata-aware queries.
  • scEmbed: Single-cell chromatin accessibility embeddings for scATAC-seq analysis and clustering.
  • Universe-building: Construct consensus universes to standardize tokenization across datasets and improve tokenization quality.
  • Utilities: Supporting tools for caching, tokenization, evaluation, and search.

Quick Start

Install geniml, prepare a universe BED file, tokenize BED files, and train a Region2Vec model to generate embeddings.

Frequently Asked Questions about geniml

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I generate genomic embeddings from BED files for clustering?

To generate genomic embeddings from BED files, you can use unsupervised learning methods like Region2Vec to transform interval data into region-level feature vectors for similarity search and clustering. This requires tokenizing BED files against a predefined universe.

What is scEmbed used for in scATAC-seq analysis?

scEmbed is used for single-cell chromatin accessibility embeddings in scATAC-seq analysis to generate cell-level representations. These embeddings enable downstream clustering and similarity retrieval directly from sparse single-cell genomic interval data.

Can I integrate metadata into genomic interval embeddings?

Yes, you can integrate metadata into genomic interval embeddings using the BEDspace method. BEDspace creates joint region and metadata embeddings, enabling metadata-aware queries and downstream machine learning tasks on BED collections.

How do I standardize tokenization across multiple genomic datasets?

To standardize tokenization across multiple genomic datasets, construct a consensus universe BED file. Universe-building workflows standardize tokenization across datasets, improving region-level embedding quality and ensuring consistent feature vector generation.

Does geniml require any external dependencies to process genomic intervals?

No, geniml does not require external dependencies to process genomic intervals and generate embeddings. It provides a self-contained Python API and CLI interface supporting tokenization, caching, evaluation, and search utilities.

What is the best way to retrieve similar genomic regions from a BED collection?

The best way to retrieve similar genomic regions from a BED collection is by training unsupervised region embeddings using Region2Vec. These learned feature vectors enable direct region-level similarity search and retrieval.