用於大型語言模型對齊的簡化偏好優化。無需參考模型的DPO替代方案,效能更佳(在AlpacaEval 2.0上提升6.4個百分點)。無需參考模型…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training