钛媒体9月14日消息,DeepSeek发布V4.1 Flash。该模型发布后速度变快、内容更准确,并具备原生多模态能力;相较于V4 Flash,V4.1 Flash采用完全不同的非对称结构,对V4推倒重来。
材料称,DeepSeek已是拥有数百名员工的企业,梁文锋仍决定对V4重构。官方论文显示,V4.1 Flash后训练遵循标准SFT→RL→在线蒸馏(OPD)范式,没有算法改动。
其变化主要在数据流水线:大规模自动合成Agent任务与环境,数据、任务和rollout渐进式扩增;RL训练让模型在6种不同Agent框架中反复试错,DSH是其中最重要的训练场,V4.1 Flash还针对DSH不同操作模式做了定向训练。
