simpo-training
por firecrawl
Optimización simple de preferencias para la alineación de LLM. Alternativa sin referencia a DPO con mejor rendimiento (+6.4 puntos en AlpacaEval 2.0). Sin modelo de referencia…
npx skills add https://github.com/firecrawl/ai-research-skills --skill simpo-training