DeepSeek于2026年9月10日推出DeepSeek-V4.1-Flash,采用混合专家架构,主干5520亿参数、支持最长100万tokens上下文并具备原生视觉能力。公司强调通过KV缓存压缩与稀疏激活降低长上下文和智能体任务的推理成本,同时将V4-Pro流量逐步路由至Flash并调整定价。
DeepSeek于2026年9月10日正式发布DeepSeek-V4.1-Flash,将一款拥有5520亿主干参数、支持最长100万tokens上下文并具备原生视觉理解能力的混合专家模型推向API和开放模型生态。
这次发布的重点不只是模型规模。DeepSeek试图通过新的架构压低长上下文和智能体任务的推理成本,并同步调整模型路由和价格。按照官方安排,V4-Pro的API请求将从9月14日开始逐步转由V4.1-Flash处理,直至V4.1-Pro发布。
新模型试图解决长上下文的成本问题
DeepSeek官方将V4.1-Flash称为新架构家族中规模最小的模型。它采用混合专家(MoE)架构,主干参数规模为5520亿,但并非每次计算都激活全部参数。官方模型卡显示,模型在预填充阶段每个token激活约80亿参数,在解码阶段激活约160亿参数。
模型采用因果编码器—解码器架构,由20层因果编码器和20层解码器组成。DeepSeek表示,这种设计可以让输入处理和输出生成使用不同的计算路径,更适合大量读取上下文、反复调用工具的智能体工作负载。模型支持最长100万tokens上下文,并可原生处理图像和文本。
真正值得关注的变化在KV缓存。模型在处理长文本或持续运行的Agent任务时,会保存此前计算结果,以避免重复计算;但这部分缓存也会占用昂贵的高带宽内存和存储空间。DeepSeek称,V4.1-Flash的全局KV缓存压缩到每个token约890字节,相当于上一代V4-Flash的四分之一;其持久化缓存所需的SSD空间约为上一代的八分之一。
官方模型卡还披露了FP4 KV缓存、跨层稀疏注意力复用、Engram条件记忆和DSpark推测解码等组件。其中Engram包含1960亿参数,但以稀疏查找方式使用。DeepSeek同时称,该模型从头开始在包含约45万亿tokens的多模态语料上训练,并在后训练阶段扩大了智能体任务和环境数据。
这些数据目前主要来自DeepSeek官方技术资料。模型卡中的基准结果尚未经过独立实验室在统一条件下全面复测,因此应理解为厂商披露的性能结果,而不是已经完成外部验证的结论。
API名称和旧模型路由发生变化
DeepSeek API文档目前将正式模型名称列为deepseek-flash。官方视觉指南称,该模型可以在同一请求中接收图片和文本,支持截图文字读取、图表分析以及其他视觉理解任务。开发者可以使用OpenAI兼容的Chat Completions或Responses API,也可以通过Anthropic兼容接口调用。
旧的deepseek-v4-flash和deepseek-v4-flash-vision-exp名称暂时仍然有效,但请求会转由最新的Flash模型处理。官方文档还显示,V4.1-Flash支持工具调用、JSON输出和1M上下文,最大输出长度为384K tokens。
这意味着,DeepSeek正在把此前的实验性视觉接口逐渐收拢到统一的Flash模型入口。此前的DeepSeek V4-Flash-Vision-Exp多模态API已经尝试把图像理解放进Agent和工具调用链,而V4.1-Flash则把原生视觉能力纳入正式模型路线。
对于图像输入,官方指南列出JPEG、PNG、GIF和WebP等格式,并支持Base64、外部图片URL以及Files API。图片会按照尺寸转换为输入tokens并计费;官方说明,单张图片最多消耗约1024个tokens,但实际费用仍取决于图片数量、文本上下文和输出长度。
V4-Pro将暂时让位于Flash
DeepSeek称,V4.1-Flash在部分能力、成本、速度和总运行时间指标上超过V4-Pro,因此公司将逐步淘汰V4-Pro。按照官方公告和API安排,北京时间9月14日12时起,所有deepseek-v4-pro请求将转由V4.1-Flash处理,并按照Flash价格计费,这一安排会持续到V4.1-Pro发布。
这并不意味着V4.1-Pro已经发布。DeepSeek尚未公布V4.1-Pro的正式发布时间、参数规模或定价。此次路由调整更像是一次过渡安排:一方面让V4.1-Flash迅速获得更大的真实流量,另一方面也减少旧模型和新模型并行运营带来的服务复杂度。
DeepSeek API的新定价于9月10日生效。官方定价页面显示,非高峰时段每百万tokens的缓存命中输入价格为0.007美元,缓存未命中输入为0.22美元,输出为0.66美元;高峰时段价格为非高峰时段的两倍。高峰时段为工作日UTC时间1时至4时、6时至10时,其余时间为非高峰。
这种定价结构与模型的缓存优化直接相关。对于需要反复读取相同系统提示、代码仓库或长文档的Agent,缓存命中率会显著影响最终账单。不过,百万级上下文并不意味着每次请求都应装入百万tokens;输入规模、重复上下文、工具调用次数和失败重试,仍会决定实际成本。
低价模型正在改变竞争方式
彭博社报道,DeepSeek将V4.1-Flash定位为低成本平台,并称其在部分性能指标上超过Moonshot的Kimi K3。消息公布后,MiniMax和智谱在香港的股价一度下跌超过8%,阿里巴巴股价也受到压力。相关市场反应显示,模型发布的影响已经从开发者工具扩展到中国AI公司的商业预期和资本市场估值。
The Next Web根据DeepSeek公布的测试表报道,V4.1-Flash在DeepSWE v1.1上的得分为74.2,高于表中Claude Opus 5的74.0和OpenAI GPT-5.6 Sol的73.0;在CyberGym上得分为88.1。但同一份表格也显示,模型在Humanity’s Last Exam等知识和推理测试中明显落后于部分闭源模型,在Terminal-Bench的部分版本中也存在差距。
因此,这次发布更准确的解读不是“一个模型在所有任务上全面取代旗舰模型”,而是DeepSeek将竞争重点放在智能体代码任务、长上下文运行和单位推理成本上。对于企业用户而言,能否以较低成本让Agent持续读取文档、调用工具并完成多步任务,可能比单一榜单上的最高分更具现实意义。
DeepSeek也表示,将与开源社区合作推进V4.1-Flash的推理支持和更多部署方式,并邀请拥有2000张GPU及存储集群的大规模部署方与其联系。模型权重已通过Hugging Face发布,采用MIT许可证。与此同时,腾讯此前发布的Hy4 preview百万级上下文开放权重模型也说明,中国模型厂商正在把超长上下文、生产力任务和开放部署放在同一竞争框架中。
独立复测和实际部署仍是关键问题
V4.1-Flash的官方规格相当庞大:5520亿主干参数、额外的Engram参数、100万tokens上下文和原生视觉能力,意味着模型即使通过稀疏激活降低单次计算量,权重存储、并行部署、卡间通信和缓存管理仍然需要较大规模的基础设施。
此外,DeepSeek发布的Agent和编码基准使用了特定的工具链、提示设置和推理配置。不同Agent框架、上下文长度和采样参数,都可能改变最终结果。模型的视觉能力能否在复杂截图、图表和真实软件界面任务中稳定工作,也需要第三方测试。
目前可以确认的是,DeepSeek已经完成V4.1-Flash的正式发布,统一了Flash模型的API入口,并把缓存压缩、长上下文和智能体成本作为核心卖点。尚待观察的是,官方基准能否被独立复现、低价策略能否持续,以及V4.1-Pro何时发布并如何重新定义DeepSeek的旗舰模型层级。
来源:DeepSeek官方公告、DeepSeek API文档、模型与定价、视觉指南、Hugging Face官方模型卡、彭博社报道、The Next Web报道。