simpo-training
por firecrawl
Otimização Simples de Preferência para alinhamento de LLM. Alternativa livre de referência ao DPO com melhor desempenho (+6,4 pontos no AlpacaEval 2.0). Sem modelo de referência…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training