similarity-searching

Search molecular structures for analogs using similarity coefficients and RDKit fingerprints.

6|2|Updated Jun 11, 2026
One-click install
npx skills add https://github.com/pradyumnasagar/open-research-skills --skill similarity-searching
Or copy as Structured Prompt for Agent
Please help me install this Agent Skill.
Skill: similarity-searching
Source: https://github.com/pradyumnasagar/open-research-skills/tree/main/skills/chemoinformatics/similarity-searching
Command: npx skills add https://github.com/pradyumnasagar/open-research-skills --skill similarity-searching

SYSTEM DOCUMENTATION & REQUIREMENTS

💡 This Skill requires rdkit, scikit-learn, annoy, mhfp, molfeat, and includes scripts (resource) and references (resource) components.

What problem does it solve?

This Skill simplifies the search for molecular analogs and helps diagnose activity cliffs in drug discovery, by performing similarity searching on molecular structures using various coefficients and methodologies.

Core Features & Use Cases

  • Molecular Similarity Searching: Perform searches based on Tanimoto, Tversky, Dice, and cosine coefficients on molecular fingerprints.
  • Scaffold-Hopping and Lead Optimization: Offers symmetric and asymmetric measures for searching, as well as methods for activity cliff diagnosis and large-library nearest neighbor methods.
  • Use Case: Identify potential drug-like molecules that share similar structural features with a given query molecule, aiding in lead optimization and drug discovery.

Quick Start

Load the similarity-searching skill to find analogs of a query molecule 'query.smi' in your library 'library.smi'.

Frequently Asked Questions about similarity-searching

High-intent search queries and answers about installing and using this skill.

FAQPage Schema
How do I find molecular analogs in a large library for drug discovery?

Molecular similarity searching identifies drug-like molecules sharing structural features with a query molecule using coefficients like Tanimoto, Dice, Tversky, and cosine. It processes large molecular libraries using RDKit fingerprints to find analogs for lead optimization.

What is an activity cliff and how do I diagnose it during lead optimization?

An activity cliff is a significant difference in biological activity between structurally similar molecules. You diagnose activity cliffs during lead optimization by applying similarity searching methodologies that compare molecular structures and highlight abrupt activity changes across analogs.

Does molecular similarity searching support scaffold-hopping?

Yes, molecular similarity searching supports scaffold-hopping by offering symmetric and asymmetric measures. These methods identify diverse molecular structures with similar properties, enabling scaffold transitions while maintaining desired activity profiles during lead optimization.

Do I need RDKit to calculate molecular fingerprints and similarity?

Yes, RDKit is required for molecular fingerprinting and similarity calculations. The similarity searching process depends on RDKit alongside scikit-learn, annoy, and mhfp to process molecular libraries and compute similarity coefficients accurately.

What's the best way to search a large molecular library for nearest neighbors?

The best way to search large molecular libraries for nearest neighbors is using approximate nearest neighbor methods like annoy. Combined with molecular fingerprints and similarity coefficients, this efficiently identifies structurally similar drug-like molecules across extensive datasets.

Can I use different similarity coefficients for molecular analog searches?

Yes, you can use Tanimoto, Tversky, Dice, and cosine similarity coefficients for molecular analog searches. These symmetric and asymmetric measures offer flexibility for various drug discovery applications, including scaffold-hopping and activity cliff diagnosis.