8月21日,DeepSeek官方宣布多模态视觉理解模型DeepSeek-V4-Flash-Vision-Exp正式上线API平台。开发者可通过设置model='deepseek-v4-flash-vision-exp'直接调用,支持base64内联、外部URL、Files API三种图片传入方式。
据官方公告,该模型定价与V4-Flash一致,一张图片最多占384个token,没有额外视觉处理溢价。官方称其多模态Agent能力已接近Opus-4.8,在Agent、推理、世界知识等纯文本基准上与V4-Flash正式版持平。同步上线的Files API不收费,开发者可先上传图片获取file_id,供后续请求重复引用。
极客公园测试中,该模型能在35秒内根据《牛来》截图输出SVG+CSS卡通牛,36秒生成像素风跑酷游戏HTML,26秒将支付产品设计稿转为响应式页面。但开启thinking模式时,推理token会吞掉全部输出预算,实测2001个completion token全为reasoning token,关闭思考模式后同一测试从23秒缩短至7.9秒。
