100개 이상의 벤치마크(MMLU, HumanEval, GSM8K, 안전, VLM)를 18개 이상의 하네스에서 다중 백엔드 실행으로 LLM을 평가합니다. 확장 가능한 평가가 필요할 때 사용하세요.
npx skills add https://github.com/firecrawl/ai-research-skills --skill nemo-evaluator-sdk