Hugging Face AI模型与数据集社区,全球最大的开源AI模型托管平台
CMMLU中文多任务语言理解评测,评估AI模型的中文综合能力
HumanEval代码生成能力评测基准,评估AI模型的功能代码编写与理解能力
GSM8K小学数学推理评测集,用于评估AI模型的多步推理能力
MATH数学推理基准数据集,用于评估AI模型在数学问题上的推理能力
SuperGLUE is a new benchmark styled after original GLUE benchmark with a set of more difficult language understanding tasks, improved resources, and a new public leaderboard..
BIG-bench - AI人工智能领域的技术与服务提供商