evaluating-code-models
bởi firecrawl
Đánh giá các mô hình sinh mã trên HumanEval, MBPP, MultiPL-E và hơn 15 điểm chuẩn với chỉ số pass@k. Sử dụng khi kiểm chuẩn mô hình mã, so sánh khả năng lập trình…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models