evaluating-llms-harness

作者: firecrawl

評估60多項學術基準(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)的LLM表現。用於模型品質基準測試、模型比較、報告撰寫等場景。

npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness

來自 firecrawl 的更多技能