2026年高考期间,12款国内外顶尖人工智能大模型同时参加了语文和数学两门科目的真题测试,以评估其在传统应试科目中的综合表现。此次测试不仅涵盖了主流的旗舰级AI模型,还邀请了多位有阅卷经验的高中教师参与评分,以保证评价的专业性和公正性。

测试背景及参与模型介绍

每年高考季都会引发关于AI考试能力的广泛关注。受众多朋友询问,今年我们决定继续组织AI大模型参与高考题测评,但将范围扩大,包括语文和数学两门科目,全面考察各模型的语言理解与逻辑推理能力。

本次参与测试的AI主要为市面上备受关注的顶尖模型:

  • 国外代表:Claude Opus 4.8、GPT-5.5、Gemini 3.1 Pro
  • 国内代表:千问3.7 max、文心Ernie 5.1、星火Spark X2、智谱GLM5.1、Kimi k2.6、MiniMax M3、DeepSeek V4 Pro、小米MiMo v2.5 Pro、混元3

评分流程与试题选取

由于语文阅卷具有一定的主观性,并且并不具备官方的细化评分标准,测试团队特别邀请了3位有经验的语文老师和1位数学老师共同参与评分,最终以语文教师平均分为准,确保评分的公平和科学。

测试试题方面,数学部分使用了完整的高考试卷,而语文部分因正式试卷完整版发布时间延后,仅采用了官方公布的部分试题和参考答案。语文满分约为100分,之后按比例换算至150分制。

测试过程与教师贡献

测试过程中,教师们不辞辛苦,夜以继日地完成了所有12套试卷的认真批改,充分体现了对这项跨界研究的支持与严谨态度。此次评测不仅体现AI模型的学科能力,也为教育领域提供了宝贵的数据参考。

后续关注点

随着人工智能技术的发展,AI在教育评测领域的应用与潜力值得持续关注。未来,如何结合AI优势改进教学与评价体系,以及提升AI语文和数学等综合能力,将是关键方向。此次测评结果也有助于相关研发团队更精准地优化模型性能,推动教育智能化进程。

文章来源:https://finance.sina.com.cn/cj/2026-06-08/doc-iniasfpu5655196.shtml

所属栏目:{typename type="name"/}