evaluating-code-models
द्वारा firecrawl
मानव मूल्यांकन, MBPP, MultiPL-E और 15+ बेंचमार्क पर pass@k मीट्रिक्स के साथ कोड जनरेशन मॉडल का मूल्यांकन करता है। कोड मॉडल की बेंचमार्किंग, कोडिंग की तुलना करते समय उपयोग करें...
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models