evaluating-code-models

作者: firecrawl

在HumanEval、MBPP、MultiPL-E及15個以上基準測試中,使用pass@k指標評估程式碼生成模型。適用於對程式碼模型進行基準測試、比較編碼能力…

npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models

來自 firecrawl 的更多技能