simpo-training
Optimize LLM preference alignment without a reference model using beta and gamma margins.
npx skills add https://github.com/gqf2008/hermez-ai --skill simpo-training-gqf2008
Or copy as Structured Prompt for Agent▼
Please help me install this Agent Skill. Skill: simpo-training Source: https://github.com/gqf2008/hermez-ai/tree/main/skills/mlops/simpo Command: npx skills add https://github.com/gqf2008/hermez-ai --skill simpo-training-gqf2008