simpo-training
oleh firecrawl
Optimasi Preferensi Sederhana untuk penyelarasan LLM. Alternatif bebas referensi untuk DPO dengan performa lebih baik (+6,4 poin pada AlpacaEval 2.0). Tidak ada model referensi…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training