DeepSeek发布V4.1 Flash多模态小模型:552B MoE架构、KV缓存压缩至1/4、全面替代V4 Pro
SmartHey9月10日消息,今日,DeepSeek正式推出全新一代轻量级多模态大模型——V4.1 Flash。作为DeepSeek V4系列中参数规模最小、推理效率最高的成员,该模型原生支持视觉理解能力,采用突破性的非对称Causal-Encoder-Decoder架构,旨在实现更高能力上限、更快推理速度、更大吞吐量,并为未来扩展至更大参数模型奠定基础。
非对称结构设计:小参数,高智能
DeepSeek V4.1 Flash为552B参数的混合专家(MoE)模型,输入激活仅8B、输出激活16B,在保持强大性能的同时显著降低计算开销,综合成本明显优于同量级现有模型。

依托创新预训练范式与大规模强化学习后训练,V4.1 Flash在多项权威基准测试中表现优异,智能水平已超越包括DeepSeek V4 Pro在内的多款旗舰模型。
极致缓存优化:大幅降本增效
新模型大幅压缩KV Cache体积——相比上代模型,HBM内存占用降至1/4,SSD存储需求减少至1/8。在Agent类应用场景中,缓存命中成本占比高,此项优化可显著降低长程交互与复杂任务的运行费用。
即刻可用:API全面上线
DeepSeek V4.1 Flash已同步接入DeepSeek官方API平台,原生支持文本+图像多模态输入。开发者只需将模型名切换为deepseek-flash,即可调用最新版本。

为保障平滑过渡,旧版模型V4 Flash与V4 Flash Vision Exp已正式下线;模型别名deepseek-v4-flash和deepseek-v4-flash-vision-exp将临时路由至V4.1 Flash,维持兼容性。

经多维度实测验证,V4.1 Flash在推理性能、单位成本、响应延迟及端到端任务总耗时等关键指标上均已全面超越V4 Pro。因此,DeepSeek将有序下线V4 Pro模型。

自北京时间2026年9月14日12:00起,至新一代V4.1 Pro正式发布前,所有指向deepseek-v4-pro的API请求将自动路由至V4.1 Flash,并按其定价标准计费。
腾讯旗下WorkBuddy、CodeBuddy,以及OpenCode平台已作为首批官方合作伙伴完成全量接入,即日起面向开发者开放使用。
API定价同步优化
得益于架构创新带来的效率提升,DeepSeek V4.1 Flash以更低算力消耗支撑更广泛服务,官方同步下调其API调用单价。同时延续峰谷定价机制:闲时价格为高峰时段价格的50%,鼓励用户灵活调度任务时间,进一步优化资源利用率。新定价于2026年9月10日12:00起正式生效。
持续拥抱开源生态
DeepSeek将持续投入开源社区建设,全力支持开发者开展V4.1 Flash的推理适配、量化部署与工具链集成,并探索多样化部署方案,推动模型在边缘设备、本地服务器及垂直场景中的规模化落地。
