HumanEval, MBPP, MultiPL-E 및 15개 이상의 벤치마크에서 pass@k 메트릭을 사용하여 코드 생성 모델을 평가합니다. 코드 모델을 벤치마킹하거나 코딩 성능을 비교할 때 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models