深耕实体创业,拒绝短期投机;聚焦可落地商业模式,与实干者共建长期事业。
商务合作关于我们联系我们投稿合作
创场创业创场创业让创业有方法、起步有赛道
创场创业
创场创业让创业有方法、起步有赛道
首页创业干货创业头条创业经验工商财税运营获客项目赛道轻资产线上项目小成本实体生意副业转型创业避雷项目盘点工具资料AI排行榜
快讯

DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

2026-08-31 19:35:24

8月31日,DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 开源,采用 MIT License。模型支持图片输入、文字识别与图表分析,官方称多模态 Agent 能力已接近 Opus-4.8。

IT之家 8 月 31 日消息,深度求索刚刚在 Hugging Face 上线 DeepSeek V4 首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License 开源。

公开内容包括模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现,覆盖视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心模块。

该模型是 DeepSeek V4 系列首款原生支持图片输入的视觉模型,官方标注为“Exp”实验版本,已于 2026 年 8 月 21 日上线 DeepSeek API 平台。支持 JPEG、PNG、GIF、WebP 格式,可描述图片、识别截图文字、分析图表。

深度求索表示,V4-Flash-Vision-Exp 在 Agent、推理、世界知识等纯文本任务上与 V4-Flash 正式版持平,在视觉理解的 Agent 基准测试中大幅提升,多模态 Agent 能力已接近 Opus-4.8。