IT之家 8 月 31 日消息,近日,DeepSeek V4 系列中的首个多模态模型 DeepSeek-V4-Flash-Vision-Exp 已在 Hugging Face 平台发布,采用 MIT License 开源协议。
公开内容涵盖模型文件、Tokenizer、Prompt Encoding 参考实现,以及简化的 PyTorch 推理实现,涉及视觉编码器、Aligner、DFlash Attention、MoE、Hyper-Connections 与 DSpark 等核心组件。
根据IT之家了解,DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek V4 系列中首款原生支持图片输入的视觉模型,官方明确标注为“Exp”实验版本,于 2026 年 8 月 21 日在 DeepSeek API 平台上架。
该模型除了文本之外,还支持图片输入,可用于描述图片、识别截图中的文字、分析图表等。支持的图片格式包括 JPEG、PNG、GIF、WebP。
深度求索官方指出,V4-Flash-Vision-Exp 在多种 Agent 框架中展现出良好的多模态适应能力,能有效支持用户借助多种 Agent 工具探索更多实用工作场景。在 Agent、推理、世界知识等纯文本任务上,该模型与 V4-Flash 正式版表现持平,原有优势得以保留。在需要视觉理解的 Agent 基准测试中,该模型相比 V4-Flash 有显著提升,其多模态 Agent 能力已接近 Opus-4.8 水平。

张伟
实时比分更新,不错过精彩瞬间。
李娜
多元体育专题,满足个性化需求。
王强
全球热门赛事一手掌握。