Hark 发布浏览器操作 Agent Handoff:从“回答问题”走向替用户完成网页任务
Hark 于 2026 年发布 Handoff 研究预览,展示一种在无官方 API 的网站上代表用户操作浏览器、完成购物、点餐和预订等长流程的 Computer Use Agent。该产品仍处候补与研究预览阶段,演示与基准主要由公司自测,实际成功率、稳定性、权限与责任边界需进一步验证。
Hark 于 2026 年发布 Handoff 研究预览,展示一种在无官方 API 的网站上代表用户操作浏览器、完成购物、点餐和预订等长流程的 Computer Use Agent。该产品仍处候补与研究预览阶段,演示与基准主要由公司自测,实际成功率、稳定性、权限与责任边界需进一步验证。
Hark 于 2026 年 8 月 5 日发布浏览器操作 Agent Hark Handoff 的研究预览版,主打在没有官方 API 的网站上代表用户执行网页任务。公司称,Handoff 能通过浏览器理解页面结构和视觉信息,点击按钮、填写表单并完成一段较长的操作流程,覆盖购物、点餐、旅行预订、退货、餐厅预订和资料研究等场景。
这意味着 AI 助手的竞争重点,正在从“能否给出答案”进一步转向“能否在真实网站上把事情办完”。不过,Handoff 目前仍处于候补名单和研究预览阶段,演示视频没有展示完整任务流程,实际成功率、稳定性和开放范围仍需要独立验证。
Handoff 试图解决什么问题
Hark 将 Handoff 定义为 Computer Use Agent,即能够操作计算机界面的智能体。用户只需用自然语言描述目标,系统便会在一个专用的虚拟计算机中打开浏览器,逐步完成点击、输入和滚动等动作。
根据 Hark 的介绍,Handoff 的虚拟环境拥有独立的浏览器、文件系统和终端,也可以连接用户已有的账号。公司列举的任务包括在 DoorDash 和 Uber Eats 上点餐,在 United、Delta 和 American 等航空公司网站之间比较并预订航班,以及在 LinkedIn 上研究候选人、发送消息和开展招聘。
这一思路的关键在于,它并不依赖网站为机器提供结构化接口。Hark 认为,公开提供 API 的网站只占很小一部分,而大量日常服务——包括零售、餐饮、酒店和职业社交平台——仍然主要通过网页界面供用户操作。因此,能够像人一样理解并使用浏览器,可能比单纯连接少数 API 更接近“通用互联网助手”的目标。
Hark 还表示,用户在其内部调查覆盖的近 300 万个屏幕使用分钟中,有 74.9% 的时间发生在浏览器中。这个比例来自公司自己的研究,不能直接视为整个互联网用户群体的独立统计,但它说明了 Hark 选择浏览器作为切入口的商业逻辑。
从预测下一个 Token 到预测下一步动作
Hark 对 Handoff 的技术描述,集中在模型输出形式的变化上。传统大语言模型通常预测下一个 Token,而 Handoff 输出的是一系列直接影响浏览器状态的鼠标和键盘操作,例如在屏幕特定坐标点击、输入文字或滚动页面。
在 Hark 发布的研究预览中,公司称 Handoff 面向长期、自治的互联网任务,并在三个浏览器操作基准上展示了前沿水平的表现。Hark 声称,Handoff 在 Online-Mind2Web 人工评测排行榜上取得最高成绩,平均比 GPT-5.4 高约 8 个百分点、比 Opus 4.8 高约 2 个百分点。
这些结果目前主要来自 Hark 自己公布的评测和比较,比较对象也不是所有最新模型。VentureBeat 指出,Hark 提供的对照包括 GPT-5.5、GPT-5.4、Opus 4.8 和 Gemini 2.5 Pro,而较新的模型以及一些开放权重竞争者并未出现在这组比较中。因此,基准成绩可以说明 Hark 的技术路线具有竞争力,但还不足以证明它在所有真实网页任务中都领先。
Hark 同时强调,Handoff 的模型成本低于一些大型竞争模型,Business Wire 的公告则称其 Token 价格不到比较模型的十分之一。具体成本优势取决于计费口径、任务长度、失败重试次数以及浏览器基础设施费用,不能只根据 Token 单价推断最终使用成本。
预训练尚未完成,产品仍在候补阶段
Hark 表示,目前公开的 Handoff 使用的是后训练模型,公司已经进入中期训练阶段,并计划在 2026 年晚些时候进行预训练。公司解释说,先从后训练开始,可以更快完善数据管线、评测体系、训练基础设施和强化学习方法。
Hark 的研究预览称,网页环境具有动态界面、弹窗、广告和反自动化机制,任务过程也可能因为页面变化而中断。为此,公司使用监督微调和强化学习,让模型从真实任务的成功与失败中学习恢复策略。
但从演示本身来看,产品距离可以独立承担重要事务仍有距离。TechCrunch 观察到,演示中的花束订购流程只展示了部分过程,无法据此判断它是否能够稳定完成付款、地址确认、库存变化和异常处理等后续步骤。对于退货、订票和下单这类不可逆或涉及金钱的任务,系统是否会在关键节点要求用户确认,也将决定它能否被普通消费者放心使用。
浏览器代理进入更拥挤的竞争场
Hark 并不是唯一一家尝试让 AI 操作浏览器的公司。Google、OpenAI 和 Anthropic 都在推进 Computer Use 相关能力,Browser Use、Polar、Strawberry 和 Aside 等创业公司也在争夺网页自动化市场。
Google Maps 最近把 Ask Maps 扩展为代理式入口,新增对话点餐、酒店比价和预订、活动发现以及实时公共交通信息。与 Handoff 类似,Ask Maps 也在尝试把自然语言理解连接到现实世界中的下一步行动;但 Google 的方案目前仍依赖 Square、Toast 等合作平台承接部分订单和支付流程。这个变化在AIFlux 对 Google Maps 代理式更新的报道中已有体现:代理可以负责发现、筛选和加购,但最终付款仍需保留清晰的确认边界。
Hark 的差异化定位,一方面是直接操作开放网页,另一方面是试图以更低的推理成本处理长任务。公司创始人 Brett Adcock 过去曾创办机器人公司 Figure,Hark 则把浏览器 Agent 描述为其个人智能和 AI 原生硬件愿景的早期基础。
今年 5 月,Hark 宣布完成超过 7 亿美元 A 轮融资,投后估值达到 60 亿美元。投资方包括 Parkway Venture Capital、NVIDIA、AMD Ventures、Intel Capital、Qualcomm Ventures 和 Salesforce Ventures 等。公司此前表示,将先推出 AI 模型和软件平台,之后再开发与这些模型配套的原生硬件。
真正的难题是权限、准确性和责任边界
浏览器代理一旦从搜索和推荐进入下单、招聘、退货或预订,就会同时面对三个问题:它是否准确理解了用户意图,是否拥有完成任务所需的权限,以及发生错误时谁来承担后果。
网页内容会实时变化,价格、库存、菜单、营业时间和交通状态都可能在操作过程中发生改变。代理即使成功识别了页面,也可能因为自然语言中的模糊条件作出不符合用户预期的选择。对于“选一家评价不错的餐厅”“买一些店家推荐的花”这类开放指令,人类通常会在多个细节上进行临场判断,而模型是否能把这些判断转化为可审计的规则,仍然需要更多测试。
另一方面,Handoff 如果能够登录用户账号并使用保存的地址、偏好和历史记录,其能力也意味着更大的权限范围。正如 AIFlux 此前关于 Hush Security 身份治理融资的报道指出,企业正在重新审视 AI Agent 以谁的身份行动、能访问哪些资源,以及出错后能否及时停止的问题。对浏览器代理来说,临时权限、最小授权、操作审计和紧急中止机制,可能会和模型能力本身同样重要。
行业也开始尝试建立更系统的 Agent 安全经验共享机制。NVIDIA 牵头的 Open Secure AI Alliance 最近提出SAFE 草案,希望将 Agent 事故和险些发生的事件转化为可共享的检测规则、参考配置和事件响应经验。不过,这仍是一项公开讨论中的提案,并非已经生效的统一标准。
Hark 表示,Handoff 平台计划在 2026 年夏末开放,现阶段用户只能通过候补名单申请访问。对这款产品而言,接下来的关键并不是再展示一个能够点击网页的演示,而是证明它能否在不同网站、不同账号状态和意外中断下,稳定完成端到端任务,并在涉及付款、个人资料和其他高风险操作时保留足够明确的人类控制。
来源:Hark 官方研究预览、Hark / Business Wire 产品公告、TechCrunch 报道、Hark A 轮融资公告。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

