腾讯开源 Hy4 preview:7700亿参数与百万级上下文,瞄准生产力任务
腾讯于2026年8月发布 Hy4 preview 并开放权重,该模型采用 MoE 架构、总参数量7700亿、上下文超百万 token,面向软件工程、办公分析、游戏开发和科研等生产力场景。官方强调模型参与自身训练与系统优化并提供 API 与自托管路径,但性能与部署成本的实际表现仍需独立评测与社区验证。
腾讯于2026年8月发布 Hy4 preview 并开放权重,该模型采用 MoE 架构、总参数量7700亿、上下文超百万 token,面向软件工程、办公分析、游戏开发和科研等生产力场景。官方强调模型参与自身训练与系统优化并提供 API 与自托管路径,但性能与部署成本的实际表现仍需独立评测与社区验证。
腾讯于2026年8月28日发布并开放权重 Hy4 preview,这是混元团队面向软件工程、办公分析、游戏开发和科学研究等生产力场景推出的新一代模型。官方资料显示,Hy4 preview采用混合专家(Mixture-of-Experts,MoE)架构,总参数量为7700亿,每个 token 激活约490亿参数,上下文长度超过100万 token。
腾讯在官方公告中称,Hy4 preview可以通过 WorkBuddy、CodeBuddy、元宝、ima 等产品访问,也可经腾讯云 TokenHub 和 OpenRouter 调用。模型权重则同步发布在 Hugging Face、ModelScope、GitCode 和 CNB,并以 Apache License 2.0 发布。
这次发布的特点不只是模型规模。腾讯试图把 Hy4 preview 与实际工作流绑定起来:一方面扩大上下文和参数规模,另一方面通过内部工程、金融、安全和游戏开发专家共同构建训练数据,并让模型参与自身训练、评测和推理系统的部分优化。不过,Hy4 仍是 preview 版本,官方也承认它在复杂任务上可能花费过长时间推理,甚至对结果进行过度验证。
从大模型发布转向“能否完成工作”
根据 Hugging Face 模型卡,Hy4 preview 的骨干网络包含78层,使用 Gated DeepSeek Sparse Attention,并在 MoE 层中配置256个路由专家和1个共享专家。每个 token 会激活8个路由专家及共享专家;模型还内置一个用于推测解码的原生 MTP 层。
这些架构细节说明,7700亿参数并不意味着每次请求都要完整计算全部参数。MoE 的设计允许模型保留较大的总容量,同时只对部分专家进行计算。但这并不等于部署成本很低:权重存储、长上下文的 KV cache、专家并行和多卡通信仍然会构成明显的工程负担。
官方模型卡推荐使用 vLLM 或 SGLang 部署,并给出了采用8路张量并行的启动示例。也就是说,腾讯降低的是权重获取和二次开发的门槛,而不是把旗舰级模型变成一台普通消费级电脑即可运行的工具。对于希望自托管的团队而言,显存容量、卡间互联、推理框架兼容性和长上下文下的实际吞吐,都需要单独测量。
这也是开放权重模型竞争逐渐显现的一个方向:开发者获得了更多部署和修改选择,但模型规模越大,真正决定可用性的就越不只是参数数量,而是推理基础设施能否跟上。此前 Hugging Face 对 Transformers 后端接近原生 vLLM 性能的介绍,也反映出开源模型生态正在把更多注意力放到部署效率和工程复用上。
腾讯给出的能力证据仍主要来自内部测试
腾讯表示,Hy4 preview 面向的是需要长程执行的生产力任务。在软件工程方面,官方称模型加强了对长期开发任务的理解、规划、调试和验证,并改善了前端工作的视觉呈现与交互体验。办公和分析场景则重点覆盖跨文件信息处理、数据分析、金融模型,以及文档、表格和演示文稿的生成。
在游戏开发场景,腾讯称模型能够根据自然语言需求生成可运行原型,并通过多轮交互继续使用游戏引擎完善项目。科研方面,官方列举了人工智能研发、分子动力学、凝聚态物理和基础数学等方向。
但目前最具体的横向比较,来自腾讯自己的盲测。腾讯称,163名内部专家对203项工程任务进行评估,Hy4 preview 的平均得分为2.99分(满分4分),略高于 GLM-5.3 的2.92分和 Kimi K3 的2.94分。模型卡还披露,Hy4 preview 相较 GLM-5.3 的胜率为46.8%、平局率为12.8%、负率为40.4%;相较 Kimi K3 的胜率为51.2%、平局率为7.9%、负率为40.9%。
这些数据可以说明腾讯内部工作流中的测试结果,但不能直接等同于独立基准结论。测试任务由腾讯选择,评分者也是腾讯内部专家,外部研究者尚未在同一协议下完成充分复测。因此,Hy4 preview 是否在更广泛的代码库、工具链和真实企业任务中稳定超过其他模型,仍有待观察。
类似的开放权重竞争已经在中国模型市场持续展开。月之暗面公开 Kimi K3 权重时,同样把超长上下文和自托管能力作为重要卖点。模型之间的差异,因而不再只体现在榜单分数,也体现在权重是否可获得、许可证如何规定,以及开发者能否承担部署成本。
“参与自身优化”仍应被理解为工程流程的一部分
腾讯特别强调,Hy4 preview 首次参与了训练方法、数据策略、评测框架和底层算子等环节的自动化优化。按照官方说法,模型提出方案、运行实验,再根据结果进行迭代,相关代码、日志和反馈会进入后续探索,由此形成一个早期的递归自我改进闭环。
腾讯还称,Hy4 preview 能够分析推理系统瓶颈,并围绕算子融合和通信优化开展多轮优化,使端到端吞吐较基线提升31.8%。不过,这一数字属于厂商对自身基础设施的测试,不是独立机构对模型能力或通用推理效率的测量。它更准确地说明腾讯正在尝试让模型参与模型研发和服务基础设施优化,而不是证明模型已经能够脱离工程团队自主完成研发。
这一区分十分重要。模型参与实验、生成代码或提出优化方案,可以减少部分研发环节中的人工工作;但实验设计是否合理、结果是否可复现、优化是否损害稳定性,仍然需要外部评测和工程审查。对于被放进代码、金融分析或科研流程的模型来说,验证机制往往与生成能力同样关键。DeepSeek 近期把 Agent 能力、本地部署和工具调用放在更新中心也显示,前沿模型的竞争正逐渐从“回答得更好”延伸到“能否在工具链中持续完成任务”。
API 价格降低了试用门槛,但长上下文会改变实际账单
腾讯公布的 Hy4 preview API 价格为:每百万输入 token 0.834美元、每百万输出 token 2.501美元,缓存命中 token 每百万0.042美元。OpenRouter 的模型目录也列出相同的输入和输出价格,并将上下文窗口标为1,048,576 token,最大输出为64,000 token。
从单价看,Hy4 preview 试图以相对可控的 API 成本吸引开发者尝试。但百万级上下文并不意味着每次调用都应该塞入百万 token。长上下文会增加输入费用、缓存占用和延迟,模型在很长文档中能否准确找到并使用关键信息,也需要结合具体任务进行评估。对企业用户而言,真正的成本还包括工具调用、重复上下文、并发量和失败重试。
腾讯同时表示,Hy4 preview 在发布初期可通过 WorkBuddy 和 CodeBuddy 免费体验两周。免费体验有助于用户快速接触模型,但并不能替代对企业数据隔离、权限控制、输出审查和服务稳定性的验证。对于开发者来说,API 价格和开放权重只是选择模型的起点,实际决策还取决于模型在自己的代码库、文档和业务流程中的表现。
Preview 版本的意义,取决于后续迭代速度
Hy4 preview 的发布,显示腾讯正在把混元从通用聊天模型进一步推向生产力基础设施:模型被直接接入代码助手和办公产品,同时向开发者开放权重、部署脚本和微调管线。这种“产品与模型共同设计”的路径,有助于把模型能力放进具体任务,而不是停留在公开演示或单项基准上。
但“开放权重”与“正式稳定版”必须分开理解。Hy4 preview 仍处在早期阶段,腾讯自己列出的限制包括复杂问题上的过长推理和过度验证;其横向评测和吞吐提升数字也主要来自内部测试。模型能否在社区部署中保持稳定,是否会出现显存、并行推理或工具调用兼容问题,以及下一批 Hy4 系列模型何时发布,都是后续需要关注的问题。
如果这些问题能够得到解决,Hy4 preview 的价值可能不只在于7700亿参数这一规格,而在于它把一款大规模开放权重模型同时放进了三条路径:腾讯自有的办公和编程产品、面向全球开发者的 API,以及允许研究者自行部署和改造的模型生态。反过来,如果外部复测无法复现其能力优势,或者部署成本抵消了 API 和开放权重带来的便利,那么这次发布更可能被视为一次技术路线展示,而不是生产力模型市场格局的确定性转折。
目前可以确认的是,腾讯已完成 Hy4 preview 的发布与权重开放,相关规格、许可证、访问方式和已知限制均已写入腾讯官方公告与官方 Hugging Face 模型卡。至于这款 preview 模型能否在真实生产环境中兑现其定位,还需要更多独立评测、社区部署报告和长期使用数据来回答。
不错过任何一条 AI 大事
订阅 AIFlux 早报,每天 3 分钟看懂产业动态。

