应用与产品 · 深度报道

Perplexity使用GPT-6 Astra处理端到端系统任务:从写代码走向生产环境

OpenAI 的客户案例显示,Perplexity 已将 GPT-6 Astra 引入搜索产品的端到端软件流程,用于写通信、修改真实系统、监控线上软件并构建模拟测试。虽然团队表示人工检查频率下降,但公开资料未披露具体准确率或长期可靠性,仍需更多独立数据验证。

AIFluxNews AIFlux 编辑2026 年 9 月 14 日阅读约 5 分钟
Perplexity使用GPT-6 Astra处理端到端系统任务:从写代码走向生产环境

OpenAI 的客户案例显示,Perplexity 已将 GPT-6 Astra 引入搜索产品的端到端软件流程,用于写通信、修改真实系统、监控线上软件并构建模拟测试。虽然团队表示人工检查频率下降,但公开资料未披露具体准确率或长期可靠性,仍需更多独立数据验证。

OpenAI 9月14日发布的一篇客户案例显示,AI搜索公司Perplexity正在把GPT-6 Astra用于搜索产品相关的软件开发和生产系统工作,包括撰写通信内容、编辑真实系统、监控线上软件,以及围绕应用构建测试程序。

Perplexity联合创始人兼首席战略官Johnny Ho在OpenAI的案例文章中说,团队已经能够“让模型处理端到端系统”,并且相比早期模型减少人工检查频率。不过,这些说法来自OpenAI发布的客户案例和Perplexity高管的使用评价,并不是独立第三方评测。公开材料也没有披露具体准确率、故障率、成本节省幅度或无人监督运行时长。

原始来源:OpenAI:Perplexity trusts GPT-6 Astra with end-to-end systems

Astra被放进搜索产品的实际软件流程

根据OpenAI的介绍,Perplexity使用Astra完成的工作并不局限于生成代码。Johnny Ho表示,团队让模型撰写内部通信内容、修改现实中的软件系统,并监控生产环境中的软件。

对于一家依赖检索、信息处理和答案生成的AI搜索公司来说,软件工程能力直接影响产品本身。Ho称,模型越擅长编写程序,Perplexity的搜索引擎就越容易构建出能够搜索网络和内部信息、并将结果简洁汇总的程序。

这意味着Astra在Perplexity内部承担的角色更接近一个能够调用工具、修改系统并观察运行结果的工程代理,而不只是聊天式代码助手。AI代理开始参与生产软件后,问题也从“能否写出代码”延伸到了“能否在受控条件下完成一整套工作”。

用模拟服务测试应用的完整工作流

Perplexity还把Astra用于测试代码。按照OpenAI转述的案例,Johnny Ho会要求模型围绕一个应用构建小型测试程序,让模型模拟其他服务可能返回的响应,例如语言模型API或连接器的响应。

通过这种方式,Astra可以检查应用如何处理外部服务的不同反馈,并测试工作流从开始到结束的表现。与只运行几个单元测试相比,这类测试更接近对真实应用链路的模拟:应用需要发起请求、接收响应,再根据结果完成后续处理。

这种方法的价值在于,可以在不依赖所有真实外部服务的情况下,先验证应用的行为。但模拟响应是否覆盖了真实服务的关键边界情况,仍取决于测试设计和模型对服务行为的理解。测试通过也不能自动证明应用不存在安全漏洞、性能问题或业务逻辑错误。

在AI编程代理逐渐承担更多软件任务的背景下,验证本身正在成为产品能力的一部分。此前,AIFlux报道过OpenAI展示GPT-6 Astra如何帮助Devin测试并证明自身代码,其中的重点同样不是单纯生成更多代码,而是让代理提交测试结果和更容易审查的证据。Perplexity的案例把这一趋势延伸到了搜索产品和线上系统。

“减少人工检查”不等于完全自主运行

OpenAI文章引用Perplexity的说法称,团队对Astra处理端到端系统的信任度高于此前模型,因此人工检查频率下降。但这句话需要放在客户案例的语境中理解。

首先,公开材料没有说明人工检查从何种频率降到了何种水平,也没有说明哪些类型的任务可以减少检查。其次,Perplexity的使用经验不等于模型在所有代码库、组织流程或生产环境中的普遍表现。搜索系统的内部工具、权限设置、测试覆盖率和人工审批机制,都会影响最终结果。

更准确的表述是,Perplexity认为Astra在其特定工作流中提高了对端到端任务的可托付程度,而不是Astra已经能够在所有生产环境中自主运行。对于涉及真实系统的代理,人工审批、回滚机制、日志记录、权限隔离和异常告警仍然是必要的控制措施。

模型能力与执行基础设施正在合并

Astra的公开定位覆盖计算机操作、浏览、软件工程和专业工作。OpenAI在GPT-6 Astra的发布文章中介绍了该模型的相关能力,并在系统卡和部署安全说明中说明了模型能力提升带来的安全考量。

这类客户案例反映出一个更广泛的变化:模型提供商不再只销售文本生成能力,而是试图让模型进入包含工具调用、测试、部署和监控的完整执行链条。OpenAI近期发布的Agents API相关报道也显示,智能体的竞争正在从模型回答质量扩展到运行时、沙箱、上下文管理和任务恢复等基础设施。

对企业而言,真正需要观察的并不只是模型能否完成一次演示,而是它能否在长期运行中持续提供可追踪、可复核的结果。Perplexity的使用案例说明,Astra已经被放入搜索和生产软件的实际流程;但关于可靠性、成本和人工监督边界,还需要更多独立数据和更长时间的生产记录来验证。

不错过任何一条 AI 大事

订阅 AIFlux 早报,每天 3 分钟看懂产业动态。