LLMアライメントのためのシンプルな選好最適化。DPOに代わるリファレンスフリーの手法で、より優れたパフォーマンス(AlpacaEval 2.0で+6.4ポイント)を実現。リファレンスモデル不要…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training