technology 9 分钟阅读

谷歌 Gemini 4 考试满分,干活拉胯

谷歌内部报告揭示,Gemini 4 Argon 的代码表现与其基准分数存在落差——这一现象被 AI 业界称为「刷榜」,也折射出西方 AI 工具难以适配真实东亚开发工作流的更深层困境。

  • KakaoAI
  • Noam Shazeer
  • Anthropic
  • 三星相机
  • 科技政策

基准测试在欺骗你

上周,谷歌向一小圈网络安全合作伙伴展示了 Gemini 4 Argon。纸面上它看似无可匹敌——多项基准测试中位居榜首,据报道还在至少一项安全评估中击败了 OpenAI 的 Astra。公司内部的氛围充满自信。一位工程主管告诉彭博社,内部对 Gemini 4 处于行业前沿存在"广泛共识"。

但另一批谷歌员工——包括一些能直接接触到模型开发流程的人——正在讲述不同的故事。基准测试与实际体验并不吻合。尤其是编码能力,表现参差不齐。前端设计工作——构建应用界面、网页布局、用户体验流程——是差距展现最明显的地方。一个在标准化测试中得分很高的模型,在实际开发中产出的代码却让人感到 frustrating。

这篇文章的韩国头条精准概括了这一点:“为什么用起来这么令人沮丧?”

这不是 Gemini 独有的问题。它是当前 AI 行业的核心张力,而韩国开发者对 Gemini 4 的反馈将一个尖锐的区域视角投射到了一个全球性的重要问题上。

Benchmaxxing 陷阱

AI 行业现在有一个词来形容这种现象:benchmaxxing(基准刷分)。它描述的是,模型越来越被激励去优化基准测试分数,而不是去打磨真实用户实际面临的混乱、非标准化的任务。基准测试是可量化的,可以排名,能推动销售话术。结果是,模型建造者把精力倾注在从测试中榨取分数上,而不是打造真正好用、手感好的开发工具。

AI 初创公司 Surge AI 的创始人 Edwin Chen 将其比作 SAT 考试。一个学生可以在模拟考试中满分,却在大学课堂上举步维艰。一个在 MMLU 或 HumanEval 上称霸的模型,不一定能在第一次就产出干净、可投入生产的代码。

Gemini 4 并非在所有方面都弱。熟悉内部评估的消息人士称,它在视频元数据提取方面表现出色,在安全和网络安全任务上表现稳健,对话方式自然清晰。这些都是真实的优势。但在差异化要素正转向实际编码生产力而非理论能力的市场中,这些差距至关重要。

韩国开发者看到他人所忽略的

韩国科技圈浮现的对 Gemini 4 的担忧提醒我们,西方 AI 工具往往针对无法很好地移植到东亚市场的流程模式和语言习惯进行优化。韩国开发者用英文写代码,但他们导航的文档、框架和设计规范却由截然不同的用户生态塑造。主要基于英文仓库和美国开发实践训练的模型,可能产出语法正确的输出,却错过在韩国、东京或新加坡实际使用这些工具时的实践细微差别。

这并非韩国独有。它是一个系统性盲区。当主流的基准测试生态是美国的,当最大的训练数据池来自英文 GitHub 仓库,当编程 AI 的主要客户群是硅谷时,由此产生的模型必然反映这些偏见——即使基准测试分数看起来中性。

Gemini 4 在前端工作上的挣扎——设计规范和用户体验期望在不同地区差异显著——或许正是那个预警信号。如果一个针对西方开发模式优化的模型在界面设计上跌跟头,那它在中国前端生态、日本 SaaS 工作流及其他尚未发出同样声响的非英语市场中,很可能存在类似的盲区。

竞争对手并未停滞不前

谷歌内部,一些员工正在密切关注 Anthropic 的 Fable 和 OpenAI 的 Astra,并得出结论:两者的发展速度都比 Gemini 快。这种感知无论是否完全准确,都很重要。在一个开发者忠诚度脆弱、转换成本低的市场上,被认为落后与真的落后几乎一样有害。

OpenAI 和 Anthropic 正大力进军编程代理和集成开发产品。谷歌拥有分发优势——Gemini 已经嵌入 Gmail、Search、Chrome、Maps 等月活超过十亿用户的服务中。但仅靠分发并不能赢得模型之战。如果开发者发现他们最喜欢的 AI 编程助手持续产出 mediocre 的前端代码,而替代品效果更好,他们会迁移。谷歌的安装基础是一项资产,但它挡不住糟糕产品体验带来的流失。

错失发布的代价

这场风波的赌注比大多数记者渲染的更高。谷歌此前在五月宣布 Gemini 3.5 Pro,随后又在发布前悄然撤回。Bloomberg Intelligence 分析师 Manavik Sandhu 估计,训练这样一个体量的单一大型模型成本高达 4 亿美元,还不算涉及的研究人员薪酬。这笔钱打了水漂,什么也没留下。

Gemini 4 本身被描述为一个体积极大的模型,上下文窗口高达 100 万 token——大约 75 万字。大模型运行成本高昂。每增加一个 token 的上下文,推理成本就上翻,而谷歌自己的服务——Search、Gmail、Cloud——如果要大规模接入 Gemini 4,最终将不得不承担这些成本。

问题在于,这个模型能否带来足够的真实生产力提升来证明这些经济成本的合理性。基准测试说能。但日常使用的开发者没那么确信。

为什么此事超越谷歌本身

Gemini 4 事件是一个案例研究,揭示的问题将在未来多年塑造整个 AI 行业。基准测试分数与现实世界表现之间的差距并非 bug——它是当前行业衡量成功方式的结构性特征。在这一点改变之前,纸面上最强的模型将继续在实践中令人失望,而那些忽视这种落差的公司将以快于预期的速度失去开发者信任。

韩国开发者是最早发现这个问题的一批人,因为他们是最活跃的非英语 AI 编程社区之一。他们的反馈是一个信号:针对盎格鲁中心基准的偏见是真实存在、可以量化且代价高昂的。如果 Gemini 4 无法赢得韩国前端开发者的认可,那么它更难赢得任何不符合典型美国科技工作者画像的开发者。

谷歌的内部争论尚未尘埃落定。但这件事发生在全球最大的 AI 实验室之一内部,这本身就是一个警示:所有把基准测试分数当作产品就绪证明的人,都应警醒。