simpo-training
от firecrawl
Простая оптимизация предпочтений для выравнивания LLM. Бесреференсная альтернатива DPO с лучшей производительностью (+6,4 балла на AlpacaEval 2.0). Без референсной модели…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training