kermt-add-cmim-pretrain

Convert grover_base checkpoints into hybrid cMIM-enabled models for continued pretraining.

413|62|Updated Jun 23, 2026
One-click install
npx skills add https://github.com/NVIDIA-BioNeMo/bionemo-agent-toolkit --skill kermt-add-cmim-pretrain
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: kermt-add-cmim-pretrain
Source: https://github.com/NVIDIA-BioNeMo/bionemo-agent-toolkit/tree/main/plugins/bionemo-agent-toolkit/skills/kermt-add-cmim-pretrain
Command: npx skills add https://github.com/NVIDIA-BioNeMo/bionemo-agent-toolkit --skill kermt-add-cmim-pretrain

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires docker, nvidia-container-toolkit, and includes scripts (resource) components.

What problem does it solve?

This skill addresses the challenge of extending existing grover_base checkpoints into hybrid models by adding a cMIM decoder and latent distribution, avoiding the need for costly from-scratch pretraining.

Core Features & Use Cases

  • Checkpoint Conversion: Seamlessly upgrades legacy encoder-only or encoder-plus-vocab checkpoints to a hybrid architecture.
  • Hybrid Pretraining: Enables continued pretraining on custom corpora using both vocabulary and contrastive objectives.
  • Use Case: A researcher has a pretrained grover_base model and wants to incorporate SMILES-reconstruction contrastive learning without spending days retraining the entire model from random initialization.

Quick Start

Use the kermt-add-cmim-pretrain skill to upgrade my grover_base checkpoint located at /path/to/ckpt.pt using the corpus provided in /path/to/corpus.csv.

Frequently Asked Questions about kermt-add-cmim-pretrain

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I upgrade a GROVER checkpoint to a hybrid cMIM model for continued pretraining?

To upgrade a GROVER checkpoint to a hybrid cMIM model, convert the legacy grover_base checkpoint by adding a cMIM decoder and latent distribution. This enables continued pretraining on custom corpora using both vocabulary and contrastive objectives without retraining from scratch.

What is the benefit of adding a contrastive objective to an existing biomolecular language model?

Adding a contrastive objective to a biomolecular language model allows you to integrate SMILES-reconstruction contrastive learning. This avoids the need for costly from-scratch pretraining while extending existing encoder-only checkpoints into hybrid architectures.

Do I need an NVIDIA GPU environment to convert legacy grover_base checkpoints?

Yes, converting legacy grover_base checkpoints requires a CUDA-capable NVIDIA GPU environment. You must also have the nvidia-container-toolkit installed and pre-configured kermt repository dependencies to execute the conversion scripts.

Can I use a custom corpus for hybrid pretraining after checkpoint conversion?

Yes, you can use a custom corpus for hybrid pretraining after checkpoint conversion. The upgraded hybrid cMIM model supports continued pretraining on custom corpora using both vocabulary and contrastive objectives simultaneously.

What is the best way to avoid costly from-scratch pretraining when integrating contrastive learning?

The best way to avoid costly from-scratch pretraining is upgrading existing grover_base checkpoints to a hybrid architecture. This approach adds a cMIM decoder and latent distribution directly, enabling SMILES-reconstruction contrastive learning without days of retraining from random initialization.