評估60多項學術基準(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)的LLM表現。用於模型品質基準測試、模型比較、報告撰寫等場景。
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness