evaluating-llms-harness
от firecrawl
Оценивает LLM по 60+ академическим бенчмаркам (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Используйте при бенчмаркинге качества модели, сравнении моделей, отчетности…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness