美团LongCat发布General 365评测集:最强模型Gemini 3 Pro推理准确率仅62.8%

2026年6月21日,美团LongCat团队正式发布General 365推理评测基准,对包括Gemini 3 Pro、GPT-5.5、Claude Opus 4.8在内的26款主流大模型进行系统性实测。

评测结果令人意外

测试结果显示,表现最强的Gemini 3 Pro准确率仅为62.8%,绝大多数参测模型未能达到60分及格线。这一结果揭示了当前大模型在复杂推理任务上的普遍短板。

General 365的设计理念

General 365专注于评估大模型的通用推理能力,涵盖逻辑推理、数学运算、常识理解等多个维度。与传统的MMLU等基准相比,General 365更注重模型在真实场景中的推理表现,而非单纯的知识记忆能力。

行业意义

美团LongCat团队此举被视为中国科技企业在大模型评测领域发出的重要声音。长期以来,国际主流评测基准多由欧美机构主导,General 365的发布为中国AI研究在社区治理中争取了更多话语权。

上一篇 具身智能公司Generalist AI完成4亿美元融资,英伟达李飞飞联合参投
下一篇 Forward Deployment Engineer成硅谷最抢手新岗位,AI落地战争全面打响