60개 이상의 학술 벤치마크(MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag)에서 LLM을 평가합니다. 모델 품질 벤치마킹, 모델 비교, 보고 시 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness