simpo-training
par firecrawl
Optimisation simple des préférences pour l'alignement des LLM. Alternative sans référence au DPO avec de meilleures performances (+6,4 points sur AlpacaEval 2.0). Aucun modèle de référence…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training