evaluating-llms-harness
โดย firecrawl
ประเมิน LLMs ผ่านเกณฑ์มาตรฐานทางวิชาการมากกว่า 60 รายการ (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag) ใช้เมื่อต้องการวัดคุณภาพโมเดล เปรียบเทียบโมเดล รายงานผล...
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness