模型与研究

Google Antigravity推出 Teamwork:多智能体开始协作解决数学与工程难题

Google Antigravity 推出 Teamwork 框架,允许多个 AI 代理在数小时到数天内分工、互相质疑并反复修正,用于解决数学与工程难题、构建周期精确的 RISC-V 模拟器并优化开源项目。Teamwork 强调编排、验证与长期迭代,并已在 Antigravity 的付费计划中逐步开放。

Google Antigravity推出 Teamwork:多智能体开始协作解决数学与工程难题

Google Antigravity 推出 Teamwork 框架,允许多个 AI 代理在数小时到数天内分工、互相质疑并反复修正,用于解决数学与工程难题、构建周期精确的 RISC-V 模拟器并优化开源项目。Teamwork 强调编排、验证与长期迭代,并已在 Antigravity 的付费计划中逐步开放。

Google正在把多智能体协作从产品演示推进到更长周期的研究与工程任务。Google Antigravity最新发布的Teamwork框架允许多个AI代理在数小时甚至数天内分工、互相批评并反复修正,官方称其已经用于解决7个理论计算机科学开放问题、构建能够启动操作系统的周期精确RISC-V处理器模拟器,并向Eigen和ParlayHash等开源项目提交性能优化。

这项更新的核心并不只是“同时运行更多模型”,而是让智能体之间形成一种带有反驳、验证和综合环节的工作流程。Google表示,Teamwork目前通过Antigravity中的/teamwork-preview提供,面向所有付费计划逐步开放;相关改进将在未来几周继续推出。

从单个代理到会互相质疑的团队

Google在官方博客中说,普通的多智能体系统在复杂任务上容易出现一种问题:代理很快接受早期错误,并在错误方向上继续建立看似合理的结论。Teamwork试图把“提出候选方案—寻找漏洞—综合改进—再次验证”变成框架内的固定循环。

系统并不使用一个固定规模的团队。用户调用/teamwork-preview后,Gemini会根据任务选择相应的工作模式,并在运行期间动态决定需要启动多少代理、进行多少轮协作。当前公布的模式包括:

  • Iterative Coding:针对难以拆分的问题,持续执行“代理—测试—修正”循环;
  • Distributed Coding:将可拆分的工程任务分发给并行工作者,再交由批评者审查;
  • Long Proof:面向开放数学和理论计算机科学问题;
  • Self-Verification:以更深的逐步推理和反复自检为重点;
  • Document Review:用于技术论文和文档的结构化分析。

Google的Teamwork文档显示,框架还设有协调、实施和验证等不同角色。验证环节包括独立代码审查、对抗性测试,以及检查测试证据是否来自真实执行,而不是来自模拟结果。

七个开放问题,但不能简单等同于“AI独立证明”

此次公布的研究结果主要来自Long Proof模式。Google称,团队处理了来自FOCS和JMLR等顶级会议相关问题,也处理了量化和向量嵌入等实际研究课题。7个结果包括:

研究问题 Google公布的结果 验证方式或材料
Lp子空间近似的coreset 改进p>2时的构造界 对应论文发布于arXiv
稀疏凸优化 为稀疏最小二乘目标建立条件数下界 对应论文发布于arXiv
最大内积嵌入 缩小Chamfer相似度在单向量和多向量嵌入中的复杂度差距 对应论文发布于arXiv
Hadamard量化 去除第二阶段量化,使领先常数降低约5.93倍 对应论文发布于arXiv
Erdős单位距离问题 在无互联网环境下独立重现早期突破 GitHub材料
Prefix-Matrix Factorizations 得到近乎最优的下界 对应论文发布于arXiv
Knuth循环猜想 为偶数情形中的两个较简单构造给出证明 一份40多页、一份70多页证明,并以Lean形式化验证

这里需要区分不同层次的说法。Google表示,除Knuth循环猜想外,其余结果已经由人类专家审阅并确认正确;Knuth相关结果则以Lean进行了形式化验证。与此同时,官方也说明,这7项结果并非全部由Gemini 3.7 Flash独立完成:相关实验主要使用Gemini 3.1 Pro,其中第1、3、4项又用Gemini 3.7 Flash复现。因而,更准确的描述是,多智能体编排框架在不同Gemini模型组合下产生了这些研究结果,而不是一个Flash模型单独完成了全部证明。

在Google内部的TCSBench测试中,Gemini 3.7 Flash与3.1 Pro结合Long Proof模式取得71%,高于论文中Gemini 3.6 Flash与3.1 Pro组合报告的67.7%。Google称这是其内部测试中的最高成绩,但该数据仍属于公司内部评测,不能直接视作公开、独立基准排名。

从数学证明延伸到芯片模拟和开源代码

Teamwork的另一个案例是从零构建周期级、乱序执行的RISC-V CPU模拟器。Google称,该模拟器能够启动xv6操作系统进入Shell,并运行100多个RISC-V标准基准测试;在未见过的测试工作负载上,与BOOM硬件执行结果相比,平均周期对齐误差为0.71%。

这类任务的难点在于,微架构状态可能在数百个周期内悄悄偏离,直到之后才表现为明显错误。Google称,Teamwork让模拟器与隔离的Spike参考模拟器持续锁步协同仿真,以缩小这种“静默执行差距”。这些结果仍应被理解为Google公布的案例,而不是对所有硬件模拟项目都有效的普遍结论。

在软件工程方面,Teamwork为Eigen的GeMV操作增加了针对单行或单列矩阵的快速路径,结合直接数据访问、SIMD操作和四路累加器展开;相关修改已按正常代码审查流程进入Eigen。它还推动ParlayHash的优化版本Swiss Parlay:Google称,在64线程初始插入测试中吞吐量提高约2倍,单线程整体吞吐量提高约1.5倍,同时每个元素的内存使用量比FlatHashMap低25%。

这条路径与Google此前为Gemini API Managed Agents增加模型、hooks与预算控制的方向相互呼应:代理要进入真实工作流,关键不仅是模型能力,还包括后台执行、权限边界、成本控制和工具调用审计。

真正的变化在编排和验证,而不只是模型变大

Google将Gemini 3.7 Flash描述为面向编码和代理任务的“workhorse”模型,并强调其速度、成本和工具调用能力。官方模型介绍称,该模型的初始价格为每百万输入Token 0.75美元、每百万输出Token 3.75美元,至少在今年年底前适用。对于需要长时间运行、反复试错的多智能体流程,较低的单轮成本确实有助于把实验从一次性演示变成可以重复执行的工程过程。

但这也意味着评估标准正在发生变化。单个模型的回答质量仍然重要,然而在长任务中,团队如何分工、何时反驳、怎样保留失败路径、如何判断一个结果已经足够可靠,可能同样决定最终表现。此前围绕科研软件的实践已经显示,AI能够降低迁移和维护成本,但科学计算进入agentic AI时代后,验证反而成为瓶颈;而在大型代码重写中,AI参与代码审查和并行迁移也没有消除人类对测试、审查和长期维护的责任。

因此,Teamwork的意义更接近一种新的研究与工程组织方式:把智能体当作能够并行探索、相互质疑和持续修正的工作单元,再由人类设定目标、选择验收标准并作最终接受决定。Google表示,未来几周将继续把这些能力推向Antigravity。它能否从少数由开发者精心准备的案例,扩展到更多真实的科研和生产环境,仍取决于结果复现、独立验证、成本控制以及责任归属能否同步建立。

来源: Google Antigravity官方博客《Teamwork: When AI Becomes a Research Partner》;Teamwork产品文档;Google《Gemini 3.7 Flash》介绍。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

相关阅读