60以上の学術ベンチマーク(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)でLLMを評価します。モデルの品質をベンチマークする際、モデルを比較する際、レポート作成時などに使用します。
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness