evaluating-code-models
โดย firecrawl
ประเมินโมเดลสร้างโค้ดผ่าน HumanEval, MBPP, MultiPL-E และเกณฑ์มาตรฐานมากกว่า 15 รายการด้วยเมตริก pass@k ใช้เมื่อต้องการวัดประสิทธิภาพโมเดลโค้ด เปรียบเทียบการเขียนโค้ด…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models