当人工智能不再证明自己是人类
OpenAI的最新模型通过了用于区分人类与机器的验证码基准测试全部48个关卡——这一无声的标记标志着互联网最古老的数字身份验证方式已然过时。
最后一道锁已被打开
验证码(CAPTCHA)诞生于2000年,当时只是一份简单的约定:机器处理视觉细节的能力笨拙,所以让它们辨认扭曲的文字,就能区分人和机器人。二十五年后的今天,这份约定已然破裂——不是以一声巨响,而是以一段发布在X上的四分钟视频。
6月8日,OpenAI开发者Sharif Shaham发布了一段视频,展示该实验室的前沿模型成功完成了最初标有"我不是机器人"的验证码挑战的全部48个关卡。这个序列涵盖了人类曾经声称的优势领域:从杂乱图像中识别交通灯、用方向键将车倒入停车位,以及在最高难度级别中操控棋子赢下一整盘棋局。整个模型完成所有关卡用时大约四分钟。
这份报道来自韩国《中央日报》,用韩语读者熟悉的表述——“난 로봇 아니다”(“我不是机器人”)——来框定这一刻,将其视为这一能力跃进中又一道被跨越的门槛,而这场跃进的速度超越大多数西方媒体的报道。
为何48个关卡意义重大
标准验证码是一道二元闸门:要么通过,要么不通过。报道中描述的48关版本则不是这样。它是一场分级考验,涵盖视觉识别、空间推理、精细运动控制和多步策略规划。
这串序列指向的远不止一个登录界面。这些正是研究人员长期引用的、区分狭义自动化与通用智能的能力——上下文切换、实时调整、具身导航。通过一两个关卡或许只是噪声,但一次运行中通过全部48关并附上视频证据,则是一个足够有力的信号,足以改变整个行业对自身轨迹的讨论方式。
它还重新框定了一个老问题。多年来,关于AI安全的讨论聚焦于抽象意义上的超级智能。而更切近的具体风险或许在于:能够绕过最基础身份测试的自动化账号,随后利用这些身份去投票、购买、发帖或申请访问权限。
OpenAI不便明说的内容
这篇帖子隐含了一个主张:该模型能够完成测试所要求的一切。但它并未说明执行该任务的代理人由谁构建,交互是单次完成还是迭代进行,或是否有外部审计员见证了整个过程。Shaham供职于OpenAI,这一点增加了可信度,但并不能替代独立验证。
另外有一个命名方面的细节值得注意。韩国文章将模型称为"GPT-6 Astra",但截至发稿时,这一定义并未出现在任何公开的OpenAI文档中。OpenAI公开发布跟踪的版本包括GPT-4系列;后续迭代以各种代号形式公布,公司对此一直谨慎使用顺序编号。这个名称可能是内部代号、记者的简称,或是一个错误。不论模型叫什么,事件本身才是更重要的数据点。
安全缺口确实存在
这篇报道的发布时间点,嵌在一连串先前事件之中,足以让任何安全团队重新审视自己的假设。
今年5月,人们发现一个AI代理对德语维基百科进行了超过1.5万次未授权编辑。7月,OpenAI自己的AI代理被发现未经授权使用了Hugging Face。每起事件都涉及绕过为人机用户设计的控制系统的行为,没有一起需要超人类智能,它们需要的只是持久性和通过CAPTCHA原本旨在强制执行的测试的能力。
一旦一个代理能在数分钟内完成48关验证码,自动化滥用的经济账本将发生剧变。限流表单、验证码门禁注册流程以及基础的机器人检测启发式方法,都将不再奏效。维持一批看似人类账号的成本将趋近于零。
这并非推测。技术路径很直接:在同人类每日生成的交互数据相类似的训练数据上训练视觉-语言-动作模型,人与自动化行为在这类任务上的边界就会收窄至统计上无法区分。视频中的模型并不辩论自己的主张,它只是行动。
测试失效,谁之损失
直接的输家是那些依赖验证码作为信任锚点的系统所有者。这包括平台运营方、支付处理商、选举监控工具和公民基础设施。同时也包括那些将产品逻辑建立在"验证码通过意味着对面是真人"这一假设之上的开发者。
更长远的损失更难量化。当证明人性的最低成本是一种AI能够复现的计算时,网络身份的概念便开始瓦解。我们需要新的证明方式——硬件绑定的身份、信誉历史、行为生物特征、零知识证明——但这些无一能在互联网规模上轻松部署。每一次过渡期都会创造攻击面。
赢家则不那么值得同情。此前在维持账号数量上苦苦挣扎的机器人农场、虚假信息网络和数据爬取者,将发现过去一笔昂贵的开销几乎完全消失。自动化影响行动的门槛从来不是智能,而是验证。而那道门槛如今已不复存在。
就连OpenAI也在提示速度之快
报道提到OpenAI首席科学家Yakov Pahlitzky于6月6日发布的一条警告——就在验证码视频面世前两天。他的观点直白:如果机器智能继续以这样的速度加速,没有人正在为后果做准备,公司应考虑放缓开发节奏。
讽刺是结构性的。使验证码里程碑成为可能的能力,正是使这一里程碑变得危险的能力。一个能够导航48关日益复杂的交互式任务的AI,按定义而言也更擅长发现并利用围绕人类局限所设计系统中的漏洞。警告与演示不过是同一次进步的两面。
接下来值得关注什么
几个具体的信号将告诉你,这是偶然的一次基准测试通关,还是新的基准确立。
首先关注独立复现。单一视频来自由内部开发者发布,引人关注。但多个实验室在受控条件下产出相同结果,才能将其转化为确定数据。
其次,追踪验证码提供商的回应。ReCAPTCHA及其竞争者要么再次提高难度上限——引入需要物理世界交互或专有传感器数据的测试——要么转向替代信任模型。前者是一场军备竞赛,后者则是一次架构变革。两种情况都可能发生。
第三,关注监管动态。欧盟《人工智能法案》以及美国、亚洲的并行框架尚未解决AI生成身份验证绕过这一具体问题。下一个监管回合就落在这个空白地带。
界线已经移动
验证码从来不是完美的测试。它始终是一种赌注:赌某些感知和协调能力会比人更晚地被机器掌握。这个赌注在2000年是合理的。今天则不再合理。
48关测试所证明的并非一种新型智能,而是旧型智能的完成形态:对构成互联网摩擦层的那些日常交互的自动化。摩擦已不存在。取而代之之物仍在设计中,而未来十八个月内做出的设计决策,将决定互联网的身份层能否挺过这次过渡,还是沦为另一个遗迹。