Anthropic Opus 5.2传启动灰度测试!速度、自主程式设计能力提升 RSI真的来了?

人工智慧(AI)模型竞赛持续升温。Anthropic旗下Claude最新一代模型Opus 5.2近日传出已悄悄启动灰度测试,多名开发者发现,在Claude Code中使用Opus 5时,实际回应表现与网页版有所不同,从请求状态中进一步发现,背后模型代号疑似已切换至Opus 5.2。

根据开发者测试,Opus 5.2目前最明显的变化包括回应速度提升、输出更精简,以及处理複杂长任务时的自主性增强。


有开发者形容,新模型不仅能持续执行更长时间的工作,也会自行反覆修改与完善程式码,而不需要使用者不断下达继续指令。

此次更新并未以正式发布的形式出现。开发者透过查看Claude Code的请求状态发现,儘管使用介面的模型名称仍维持Opus 5,但后端模型slug已指向Opus 5.2,因此推测Anthropic可能跳过Opus 5.1,直接测试5.2版本。

从目前流出的测试回馈来看,Opus 5.2与先前版本相比,首先是生成速度明显加快;其次是在程式码生成及长文本处理方面,输出更加直接,减少冗长内容。

另一项受到开发者关注的改变,是模型在长时间、複杂任务中的自主执行能力。部分使用者表示,过去AI遇到长任务时,可能只提供架构,或要求使用者输入继续才能完成后续工作;但Opus 5.2似乎能自行持续执行,反覆测试、修改并完善程式码,直到任务结束。

有开发者甚至以严酷循环形容这种工作模式,认为这并非单纯的小幅调整,而是模型底层能力出现明显变化。

由于Opus 5.2目前仍属灰度测试,开发者也开始寻找辨识自己帐号是否获得测试资格的方法。

网友发现,一个名为Tibo的冷知识问题被用作测试工具。使用者在关闭网路搜寻功能后,直接询问Claude是否知道重置哥Tibo是谁。据相关开发者测试,网页版Opus 5与被路由至Opus 5.2的Claude Code,在相同提示下可能给出不同答案。

相关开发者据此认为,两者背后可能并非使用相同模型权重。目前,已有Claude使用者将这个问题当作测试方式,尝试确认自己的帐号是否已被纳入Opus 5.2灰度测试。

Anthropic内部另有Model 2 传大规模用于程式开发

不过,外界关注的焦点并不只有Opus 5.2。此前曝光的一份Anthropic内部风险报告显示,公司内部还存在一个尚未公开、代号为Model 2的模型。

报告称,Anthropic内部目前可能採取多层次的模型发展方案,其中包括Claude Fable 5.2、未公开的Model 2,以及具备递迴自我改进(RSI)能力的模型。

其中,Model 2被描述为目前Anthropic内部广泛使用的模型。根据报告,在测试实际AI研发任务的CoBench v2评测中,Model 2取得62.8%的成绩,较报告所称当时最强模型Mythos 5高出12.5个百分点。

报告进一步指出,Anthropic目前大部分公司程式码已由Model 2透过代理完成。换言之,AI不只是被用于协助开发软体,也开始被用于编写下一代AI系统所需的程式码。

至于Model 2是否会对外发布,目前官方口径仍是暂不公开。

RSI模型传可取代85%研究工作 AI自我改进成关注焦点

更受关注的是报告对递迴自我改进(Recursive Self-Improvement,RSI)模型的描述。

RSI指的是AI具备理解自身架构、修改自身程式码并进一步提升能力的能力,经过反覆循环后,理论上可能形成持续加速的智慧提升。

根据曝光报告,Anthropic内部的RSI模型,在相关性能测试中的成绩甚至比Model 2高出22分;报告同时指出,该模型未来可能取代Anthropic研究团队高达85%的工作。

目前Anthropic已被描述为大量使用Model 2进行程式码撰写及代理任务。这也使外界开始关注,AI自行开发AI的模式是否正逐步成形。

在Opus 5.2进入灰度测试、Model 2被指已投入内部开发,以及RSI模型相关资讯陆续曝光的背景下,Anthropic下一阶段的模型发展方向受到关注。外界目前也在观察,Opus 5.2何时正式对外推出,以及Anthropic是否会进一步公开更高阶的内部模型。

发布于 2026-09-15 14:16
收藏
1
上一篇:抛售猛烈!10年期美债殖利率升破5% 创20年新高 下一篇:记忆体佔据半边天!今年Q2全球半导体收入4250亿美元创史高 全年估暴增五成至1.25兆