当 AI 高分通过修能考试,谁都不是赢家
GPT-6 Astra 刚刚成为首个在韩国修能考试中每科均取得 450 分的 AI——包括全部四门选考科目。一个机器取得的完美分数揭示了考试的未来走向,而真正值得关注的并非分数本身。
分数背后并非全部真相
GPT-6 Astra 在韩国 Suneung(修能考试)中取得了 450 分满分——每一科、每一题,无一遗漏。这是首个横扫整场考试的 AI 模型,而非仅在特定优化领域表现优异的模型。
这个数字必将成为头条焦点。但真正重要的故事,藏在 Astra 如何获得这一分数的过程中,以及它揭示出的一个社会现实:在这个国家,一场考试足以决定升学、职业轨迹乃至社会地位。
满分是如何炼成的
Astra 的 450 分来自"2026 Suneung LLM 解题仪表盘",由顺天乡大学计算机软件工程专业的学生具宇谦搭建。该仪表盘于去年十一月开始追踪全球 AI 模型的表现,并在各大模型更新时同步刷新。
此前的领跑者——Gemini 3.1 Pro 和 GPT-5.4——同样拿下满分,但仅限于四门选科中的两门。它们在物理一和社会文化两科未能取得最高分。而 Astra 则全部攻克:物理一、化学一、生命科学一、社会文化,加上必修的韩国语、数学、英语和韩国史四个科目。
评估过程使用官方模型 API,不借助任何外部工具——无搜索、无计算器、无旨在规避考试的系统提示词。题目以文本形式呈现;图表、图形等视觉内容则以原始图片形式输入。这一设置的精妙之处,恰恰在于剥离了人们普遍假设的 AI"作弊外挂"。
令牌故事比分数更值得关注
Astra 仅用约 130,000 个输出令牌就完成了整场考试——仅为 Gemini 3.1 Pro 所用令牌的约八分之一,不到 Claude Opus 5.1 的一半。它还超越了 GPT-5.4 的非推理模式,而后者正是为了削减令牌输出而专门设计的。
以极低的令牌成本实现高水平推理,传递出工程师们远比考试分数更关心的信号:效率。一台能以极少算力消耗解决近乎不可能之难题的 AI,更接近于在真实产品中被大规模部署——无论是辅导平台、自动评分还是研究辅助——而不会让运营公司陷入财务困境。
此外,在仪表盘的高难度模式下,Astra 仍以 448.5 分之高居榜首,该模式要求将某一科目的所有题目一次性全部呈现,而非逐题展示。它在社会文化部分仅错一题,与 GPT-5.6 Sol Pro 在该条件下并列第一。
值得注意的是一个前提条件:Astra 的知识截止日期晚于实际 Suneung 考试日期。这并不影响结果的合理性——OpenAI 在考试举行前很可能已接触到泄露或练习题库——但这意味着,这一满分同样反映了数据可得性,而不仅是纯推理能力。
Astra 的改变
OpenAI 在发布 Astra 时将其定位为一种能够操作计算机而非仅回答问题的人机模型。它可以浏览网页、填写表单、生成并执行代码、在运行中途调试错误,并在跨领域完成多步骤任务。其网络安全评估被归入最高风险级别——“关键”——在受控内部测试中发现了两个此前未知的漏洞。
这项基准测试悄然印证了这一转变。竞争的核心早已不再是谁能给出最好的答案,而是谁能以更自主的方式完成更多工作。
Astra 在一次连续的工作流中审阅文档、测试软件、编写并修复代码、分析科学问题。Suneung 的分数是通用推理能力的代理指标——但 OpenAI 正在构建的产品远不止于此,它是更偏向实战的操作型智能体。
Suneung 从来不只是一场考试
在韩国,Suneung(大学修学能力测试)堪称全球风险最高的标准化考试。一个早晨便决定大学录取,而升学结果将在长达数十年的时间里塑造就业前景、婚恋市场和社会阶层。家庭在教育补习班投入数百万韩元,学生为此请假离校,全国因此放慢脚步整整两天。
一台 AI 在不作弊的前提下通过这场考试,向优绩主义本身的架构发出了令人不安的信号。如果用来筛选社会的工具可以被机器完美模拟,那么这一筛选机制的合法性便开始瓦解——即便实际考生依然诚实应考。
这并非抽象议题。韩国已面临生育率创历史新低的 demographic 危机,政府正艰难探索如何在人口萎缩背景下维持教育水准。能以任何人类或超人类水平解答任何问题的 AI 辅导,正被视作缓解师资短缺和学习差距的潜在方案。Astra 在 Suneung 上的表现,将这场讨论从理论推向了现实,仅用了数周时间。
AGI 命题再度浮现
Astra 的发布重新点燃了关于人工通用智能的争论。OpenAI 并未宣称实现了 AGI——该公司对此类措辞极为审慎——但展示出的能力确实跨越了许多研究者认为还需多年才能抵达的门槛。
Suneung 基准的价值,恰在于它强制要求通用型表现。你不能只专攻某一科目便靠刷题拿到满分,你必须同时运用语言推理、解析视觉数据、应用数学逻辑并调用历史知识。这比任何单一领域的能力测试都更接近通用智能。
当然,反方论点是:记忆与模式匹配仍然是 AI 表现优异的重要组成部分。韩国的 Suneung 奖励的某些思维方式,未必能直接转化为现实问题解决能力。但即便是批评者也难以否认这样一个事实:一台以近竞争对手八分之一令牌消耗完成考试的 AI,绝非简单的模式识别——那是效率、压缩与结构性理解。
赢家与输家
OpenAI 无疑是最大赢家。Astra 展示出的能力全面碾压 Gemini、Claude,以及仪表盘上列出的所有韩国本土模型,包括 Upstage 的 Solar、LG AI 研究的 K-Exaone、Motive Technologies 的 Motive 和 Kakao 的 Kanana。
韩国学生则面临更复杂的局面。他们为之备考的考试,天花板已被机器打破。这并不意味着他们的努力失去意义,但它确实改变了围绕这场考试所衡量的能力及其重要性的文化叙事。
辅导公司与 EdTech 平台是最快的受益者。Astra 的高效使其作为大规模个性化辅导工具在经济上成为可能——而此前没有任何模型能在计算成本上支撑这一愿景。
教育机构则是最大输家。依赖 Suneung 分数作为学生质量代理指标的大学,将面临重新设计招生制度的压力。若 AI 能产出满分,分数本身便丧失了区分力,机构必须寻找新的评估维度。
未来何方
短期内,Suneung 不会消失。但基准的焦点将从"AI 能答对什么"转向"AI 能完成什么"。未来的评估将更可能衡量自主任务完成度,而非多选题准确率。OpenAI 已将 Astra 定位为可工作的智能体,预计竞争对手将纷纷跟进。
韩国教育部将面临改革或替换 Suneung 架构的压力。日本的 Center Test 等效考试与中国的高考也将 sooner rather than later 面临相同压力。东亚整个高风险考试体系——这一地区社会流动性的基石——如今正与能在自身规则上超越最优秀学生机器的存在展开竞争。
450 分是一个时刻。而紧随其后的,将是清算。