FlagEval
这里是中文大模型能力对比的权威平台,为您提供全面、客观的大模型性能评估和排行榜单。SuperCLUE是独立、领先的中文通用大模型综合性测评基准,涵盖通用、文本、多模态、推理、Agent、AI应用及性能系列,为产业与学术研究提供重要参考。
LMSYS Chatbot Arena大模型竞技场,通过用户投票排名评估AI对话模型
聚合 ARC-AGI-2、HLE、AIME 2025、SWE-bench Verified、τ²-Bench 等主流基准的实时排名,覆盖综合榜与数学、编程、Agent 分类排行榜。
Hugging Face AI模型与数据集社区,全球最大的开源AI模型托管平台
2026年最新AI大模型排行榜,基于公开benchmark数据,覆盖30+主流大模型综合评分、编程能力、推理能力、API价格等多维度对比,助您快速选择最适合的大模型。