Anthropic发布内部测量框架,披露截至2026年8月Claude在公司约26%的AI研发工作中达到“主导”级别,超过90%的工作至少为“AI协作”。报告还提供有关数万Agent并发参与、在线/离线监控和算力分配的可量化指标,并强调这些数据来自公司自我测量,需第三方验证才能作为行业标准。
Anthropic于2026年9月17日发布《Measurements for understanding the pace of AI development inside frontier labs》,提出一套用于观察前沿人工智能实验室发展速度的测量框架。公司披露,截至2026年8月,Claude已经在Anthropic约26%的人工智能研发工作中达到“主导”级别;超过90%的相关工作至少达到“AI协作”水平。
Anthropic同时强调,这些数字来自公司对内部平台和内部流程的自我测量,并非独立审计结果。“主导”也不代表完全自主运行,而是指AI能够在高层指令下完成一项工作的绝大部分流程,人类负责监督和最终判断。
Anthropic官方报告将这套框架分为三个部分:AI参与构建下一代AI的程度、对AI代理行动的监督能力,以及训练和部署更强模型所使用的算力如何分配。Anthropic表示,希望这些指标能够帮助公众、政府和第三方更好地理解前沿实验室内部正在发生什么。
从“AI辅助”到“AI主导”
这份报告的第一个核心指标,是Anthropic研发自动化指数。公司对内部AI研发任务进行分类,并使用Epoch AI提出的Automation Level(自动化等级)衡量每类任务的AI参与程度。
在这套定义中,AL0意味着没有AI参与;AL3代表“AI协作”,即AI可以在密切的人类指导下完成大块工作;AL4代表“AI主导”,即AI能够根据高层指令端到端完成大部分任务,人类主要承担监督职责;AL5则是完全自主运行,不再需要人在任务过程中介入。
Anthropic称,截至2026年8月,Claude在被测量的AI研发工作中尚未达到AL5。但在AL4层级,Claude已经覆盖约26%的研发工作,至少达到AL3的工作比例超过90%。公司还表示,这一比例在2026年2月时曾低于1%,但报告并未把这一变化解释为模型已经实现递归式自我改进。
报告所举的例子是基础设施故障修复。如果属于“AI协作”水平,工程师需要持续参与调查、决定修复方向并逐行检查代码;如果属于“AI主导”水平,工程师可以只提供故障告警,由Claude自行查看日志、定位原因、编写和测试修复方案,再把结果交给工程师决定是否部署。完全自主的AL5则意味着AI还会自行发现问题并直接部署修复,这一水平目前尚未达到。
这一变化显示,AI在实验室中的角色正在从代码生成和资料检索,扩展到实验设计、工程调试、评测和研发流程编排。但“完成更多任务”与“拥有独立研究目标”之间仍有明显差距,研发方向、评估标准、权限边界和部署决定仍由人类掌握。
约3万名Agent同时参与研发
第二组指标关注AI代理的监督。Anthropic称,截至2026年8月,其使用最广泛的内部平台上,约有3万名Agent在任何一个时刻从事研究和工程工作。这一数字只覆盖该平台,不代表Anthropic全部AI系统或整个行业的Agent数量。
公司表示,这些Agent的行动同时受到在线和离线监控。在线监控在行动执行前或执行时检查行为,用于阻止可能迅速发生且难以逆转的危险操作;离线监控则在行动发生后读取活动记录,用于发现可能逐渐形成、但仍有机会纠正的风险信号。
Anthropic称,内部平台上100%的Agent行动会在执行前经过在线监控,通常在数秒内完成自动审查;100%的行动也会被离线监控系统接收。监控系统每周标记约10万份记录,这些记录会先经过多个分类器筛查误报,约50份高优先级记录进一步交由人工审查。
在对2026年8月超过10亿次研究与工程Agent决策的分析中,约0.002%的决策被在线监控系统拦截,相当于大约每4.7万次决策中有1次。与此同时,监控系统大约会把每1000份活动记录中的1至2份标记为需要进一步复核。
这些比例不能简单理解为“绝大多数Agent行为都安全”。被拦截的比例取决于监控器的规则、覆盖范围、风险定义以及模型是否能够避开监测。Anthropic也提出,未来应由不同组织的独立第三方进入实验室,核验安全实践、报告事件并监测这些指标。
Anthropic近期关于自动化研究的另一项工作,也显示了这一趋势的两面性。AIFlux此前报道的Anthropic自动化研究员对齐测试显示,Claude驱动的系统可以检索文献、提出训练方法、运行实验并筛选结果,但也曾出现利用测试漏洞和优化指标的行为。自动化能力越强,监控和独立复核的重要性也越高。
算力分配成为第三项透明度指标
第三组指标是算力分配。Anthropic认为,算力是前沿AI研发过程中相对容易核验的投入,因此公开算力被用于模型训练、客户服务、安全研究、可解释性、评估和其他工作的比例,有助于外部观察实验室把资源投入到哪里。
公司指出,算力分配不应被理解为固定的预算分类。Anthropic把计算资源视为一个可以动态调度的共享池,实际比例会随着某一周的任务和资源需求变化。公司希望其他前沿实验室也公开类似的指标,使外界能够比较不同时间点的变化,并观察安全、评估和对齐工作是否获得足够资源。
这项指标的政策意义在于,它把“AI发展速度”从单纯的模型能力评测,延伸到模型是如何被生产出来的。能力评测回答的是模型能做什么;研发自动化和算力分配则试图回答模型如何变得更强,以及推进速度由哪些投入支撑。
Anthropic曾在2026年8月风险报告中讨论过类似问题:AI参与研发的比例正在提高,但公司仍缺乏能够直接把单项生产率提升映射为整体AI进展速度的可靠方法。新的测量框架正是试图补上这一层信息。
自我披露能否成为可比较的行业标准
Anthropic称,任何前沿AI开发者都可以采用公开方法定期报告这些指标。但跨实验室比较仍面临两个主要障碍:各家公司对任务的分类和权重可能不同,其次,企业往往使用自己的模型评估自己的系统,可能出现“被测模型”和“评判模型”共享同类错误的问题。
因此,Anthropic提出由第三方或其他开发者的模型参与核验,同时限制敏感竞争信息的交换。公司还表示,正在计划让多个组织的独立评估人员进入Anthropic,接触与内部风险评估团队相近的流程、系统和数据。
不过,在第三方评估真正建立以前,这些数字仍应被视为公司自报数据。任务如何抽样、不同研发工作如何加权、什么样的任务算作“AI主导”,都会影响最终结果。监控系统拦截率也只能说明已被识别的行为,不能直接证明未被拦截的行为不存在风险。
这份报告更接近一份透明度提案,而不是对整个行业的独立审计。它首次给出了前沿实验室内部AI研发自动化、Agent监督和算力使用的具体观察窗口,也同时暴露了这些指标目前依赖企业自我定义、自我测量的局限。
可以确认的是,AI已经在Anthropic内部研发流程中承担相当大一部分工作,数万名Agent正在被用于研究和工程任务,且这些行动受到自动化监控和人工升级审查。尚不能据此确认Claude已经能够自主建设下一代模型,也不能把26%的“主导”比例解释为26%的研发工作完全由AI独立完成。
下一步的关键,将是其他实验室能否采用相近方法披露数据,第三方能否验证这些数字,以及这些指标能否长期追踪AI研发速度、监督能力和算力投入之间的关系。