evaluating-code-models
oleh firecrawl
Mengevaluasi model pembuatan kode di seluruh HumanEval, MBPP, MultiPL-E, dan 15+ tolok ukur dengan metrik pass@k. Gunakan saat melakukan benchmarking model kode, membandingkan pengkodean…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models