evaluating-code-models

作者: firecrawl

在HumanEval、MBPP、MultiPL-E及15+基准测试中,使用pass@k指标评估代码生成模型。适用于对代码模型进行基准测试、比较编码能力等场景。

npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models