DeepSeek V4.1 Flash 正式发布并开源!
1. 更大的规模底座、更小的运行成本
新 V4.1 Flash 使用了相比 V4 Flash 更大 (近乎大了一倍) 的模型底座: 284B -> 552B,意味着 Flash 模型也能拥有 DeepSeek V3/R1 水平级的世界知识能力
但 V4.1 Flash 使用了全新 “Causal-Encoder-Decoder” 架构降低了推理成本:输入激活只有 8B,输出激活 16B,带来的优势就是相同的规模和相近表现的前提下吞吐量 (tok/s) 更大
2. 相比 V4 Flash 0731, 新模型缩小了 13.7 倍的 KV Cache 用量
对 KV Cache 体积的压缩,大幅降低了 Agent 等任务的使用成本 (附图 P2)
🤗HF: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Benchmark: [附图P1/P3], 含金量可见官方文案: “DSv4.1 Flash 全面超越 DSv4 Pro 0812”
Tech Report: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
1. 更大的规模底座、更小的运行成本
新 V4.1 Flash 使用了相比 V4 Flash 更大 (近乎大了一倍) 的模型底座: 284B -> 552B,意味着 Flash 模型也能拥有 DeepSeek V3/R1 水平级的世界知识能力
但 V4.1 Flash 使用了全新 “Causal-Encoder-Decoder” 架构降低了推理成本:输入激活只有 8B,输出激活 16B,带来的优势就是相同的规模和相近表现的前提下吞吐量 (tok/s) 更大
2. 相比 V4 Flash 0731, 新模型缩小了 13.7 倍的 KV Cache 用量
对 KV Cache 体积的压缩,大幅降低了 Agent 等任务的使用成本 (附图 P2)
🤗HF: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
Benchmark: [附图P1/P3], 含金量可见官方文案: “DSv4.1 Flash 全面超越 DSv4 Pro 0812”
Tech Report: https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf