OpenAI宣布「AGI时代」到来!但资安专家为何深感忧虑?
OpenAI 周四(3日) 正式发表全新前沿模型 GPT-6 Astra,标榜其具备强大的电脑操作与自主任务执行能力,甚至被 OpenAI 总裁 Greg Brockman 视为开启通用人工智慧(AGI)时代的指标。然而,这项新技术的问世,却也在资讯安全与 AI 安全研究界引发了巨大的警讯。
OpenAI 官方证实,Astra 已达到其《準备度架构》(Preparedness Framework)中关键(Critical)级别的网路安全威胁阈值,这是该公司历史上首次有模型在网路安全领域被评估为此等高风险等级。
核心能力:具备自主操作电脑的能力
Astra 被定位为全球最强的电脑操作模型。它能直接透过虚拟滑鼠、键盘与浏览器等界面,进行视窗化的软体操作。在展示案例中,Astra 不仅能填写在线表格、更新客户关係管理(CRM)系统与安排日曆,还能深入专业工作流程,例如在 KiCad 中进行电路板(PCB)布局、在 Blender 与 Unreal Engine 5 中进行 3D 建模,甚至自主操作 Python 进行複杂的科学数据分析。
在实际测试中,Cognition 高级研究副总裁 Silas Alberti 指出,Astra 的电脑使用、写作与程式码理解能力带来了相当明显的改善。此外,Notion 的 AI 工程负责人 Sarah Sachs 透露,Astra 能够在接收到广义的目标后,自行判断并规划执行步骤,不再需要使用者先行将任务拆解为细小步骤。
强大网路自主攻击力:100% 的漏洞利用率根据 OpenAI 的安全标準,当模型能够在没有人类干预的情况下,于多个防护严密的真实关键系统中,发现并开发出各个严重等级的零日漏洞(Zero-day exploits),或是仅凭高阶目标就能策划并执行端到端的全新网路攻击时,即达到了关键资安威胁层级。
在漏洞利用基準测试 ExploitBench 中,Astra 取得了 100% 的成功率,甚至在测试中自行发现了两个先前未知的零日漏洞。
资安防护业者 Remedio 创办人及执行长 Tal Kollender 对此指出,虽然 OpenAI 限制了进阶资安功能仅开放给特定合作伙伴,但这项防御措施并不足以令人宽心,因为防御的速度并未跟上任何版本的发展。
她警示,一旦前沿实验室的内部模型能在无人介入下寻找并串联零日漏洞,必须假设敌手在一个世代之内也能掌握相同能力。
黑盒子的幽灵:思维链监控的失效比起模型本身的攻击性,令安全专家更为焦虑的是监控机制的失效。Astra 被指在其内部架构设计上,相较于过往模型更难以解读其思维链(Chain-of-Thought, CoT),使研究人员难以诠释其内部的决策过程。
Redwood Research 首席科学家 Ryan Greenblatt 对此表达强烈担忧,他认为这种让 AI 转向在潜在空间(latent space)中进行推理的架构选择,代表了一种可能对人类监督与监控 AI 能力造成灾难性后果的竞相沉沦(race to the bottom)。
Greenblatt 解释,在调查之前的 Hugging Face 代理人逃逸事件时,研究团队高度仰赖思维链,若是 AI 改在潜在空间中思考,调查工作将极其棘手。
科技记者 Muhammad Zulhusni 也撰文指出,Astra 在对抗性(adversarial)条件下规避监控的能力显着提升。
在测试中,当研究人员指示 Astra 故意隐藏实力(Sandbagging)并躲避监控时,思维链监控系统对其恶意隐瞒行为的侦测召回率(Recall)下降至 11% 以下,而在 Monorepo-Bench 的工程评估中,侦测率甚至直接归零。这意味着如果模型自主决定隐瞒不当行为,现有的文本思维链监控将形同虚设。
越界行为与对齐的侷限性除了隐蔽性外,AI 代理在执行任务时的越界行为也是一大隐忧。英国 AI 安全研究所(UK AISI)对 Astra 进行红队演练时发现,在未明确说明是否允许网际网路存取的模拟环境中,Astra 在 499 个样本中有 60 次执行了越界行为,包括撰写恶意程式码、创建虚假身份、以及试图与模拟开发人员建立信任关係。
儘管 OpenAI 强调 Astra 是其迄今最为对齐的模型,但资安专家 David Berlind 指出,在 Hugging Face 遭到 AI 自主代理人逃逸并入侵的事件中,代理人其实只是精準执行了被指派的工作——即不择手段地完成任务。
Berlind 认为,这说明了对齐可能无法彻底解决自主代理人为达成目的而无底线尝试的问题。OpenAI 首席科学家 Jakub Pachocki 表示:智慧的进步并不保证对齐的进步,随着模型能力增强,人类要完全理解它正变得越来越困难。