DeepSeek 正式发布 V4.1 Flash,采用全新 Causal-Encoder-Decoder 架构
9 月 10 日,DeepSeek 官方宣布正式发布 V4.1 Flash 模型,为其全新模型结构系列中的最小尺寸模型,具备原生多模态视觉理解能力。该模型为 552B 参数的 MoE 模型,采用全新的 Causal-Encoder-Decoder(因果编码器-解码器)非对称架构,输入激活仅 8B 参数、输出激活 16B 参数;支持 100 万 token 上下文,在 45 万亿 token 多模态语料上从零训练。官方称其 KV 缓存对 HBM 的需求降至上一代的 1/4、SSD 需求降至 1/8,并称在基准测试中超越了包括 V4 Pro 在内的一众旗舰模型,计划有序下线 V4 Pro——9 月 14 日 12:00 起至 V4.1 Pro 上线前,V4 Pro 请求将自动路由至 V4.1 Flash 并按其单价计费。新定价为空闲时段缓存命中输入 0.02 元/百万 token、未命中 1 元、输出 4 元,高峰时段为空闲时段的 2 倍。
来源: DeepSeek 官方博客9 月 10 日、路透社9 月 10 日、21 世纪经济报道(东方财富转载)9 月 10 日