LLM 정렬을 위한 간단한 선호도 최적화. DPO의 참조 모델 없는 대안으로 더 나은 성능 제공(AlpacaEval 2.0에서 +6.4포인트). 참조 모델 불필요…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training