用于大语言模型对齐的简单偏好优化。DPO的无参考替代方案,性能更优(在AlpacaEval 2.0上提升6.4个百分点)。无需参考模型…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training