一周之内,DeepSeek 补上了"眼睛"
8月21日下午,DeepSeek 官方 API 文档的模型详情页悄然上线了一个新模型:deepseek-v4-flash-vision-exp。这是 V4 系列里第一款直接支持图片输入的视觉模型。腾讯新闻、凤凰网科技等媒体当天均做了跟进报道,与官方页面披露的信息一致。
从官方说明看,这个模型拥有 100 万 token 的上下文窗口,最大输出长度 384K,支持 JSON 输出、工具调用、Responses API、Anthropic API 兼容以及对话前缀续写。图片会按尺寸折算成 token,和文本 token 合并计费,单张图片最多占 384 个 token。
为什么先给"小模型"接视觉
一个有意思的细节是,DeepSeek 选择先把视觉能力接到 V4-Flash 上,而不是参数更大的 V4-Pro。V4-Flash 总参数 284B、激活 13B,定位本就是高吞吐、低成本的型号。把视觉能力放进这条产品线,瞄准的显然不是"看图聊天",而是大量发生在 Agent 工作流里的视觉任务:读网页截图、识别报错界面、分析图表、查看软件 UI、读取设计稿,再根据图片继续操作电脑或修改代码。
就在大约一周前,DeepSeek 刚开源了自己的 Agent 框架 DeepSeek Harness,把模型、工具、技能、会话、沙箱、存储和 Agent 循环放进一套可组合的运行框架里。但当时 DeepSeek 自己的模型没有视觉能力,开发者在 GitHub 讨论区里高频提问"怎么让 DeepSeek 看图",社区甚至自己做了 vision-bridge 插件来曲线救国。
对做 AI 内容基建的人意味着什么
视觉模型接入 Agent 框架,意味着"看—想—做"的闭环第一次在纯国产模型栈里跑通。过去 GEO(生成式引擎优化)讨论的更多是文本问答里的品牌引用,但当 Agent 能直接读图、读界面、读文档,品牌的官网截图、产品图、说明书 PDF 都可能成为 Agent 决策时的直接信源。
换句话说,企业留给 AI 的"第一手材料"不应该只有文字。图片、图表、结构化文档是否清晰、是否可被模型准确理解,会越来越影响 AI 在真实工作流里对企业的判断。这部分目前仍被很多 GEO 方案忽略,大家还在卷关键词和文章数量,却没意识到一张标注清楚的产品图,可能比十篇软文更能让 Agent 准确认识一个品牌。
需要留意的边界
DeepSeek 目前没有公布 Vision-Exp 的模型结构、训练方式或视觉编码器信息,也没有发布技术报告和视觉 Benchmark。它带着明确的"Exp"实验后缀,更像先交给开发者在真实场景里找问题、再决定正式版本路线。多家媒体在报道中也谨慎地指出,仅凭"现在能上传图片",还无法判断它究竟是原生多模态模型,还是一套视觉前端与 V4-Flash 组合起来的系统。
对企业和开发者来说,现阶段可以把它当作低成本的多模态 Agent 能力去试用,但不宜把关键生产流程完全押在实验版本上。真正的成本还要看官方后续公布的图片 token 换算规则,目前只知道图片按尺寸折成 token、与文本合并计费,具体换算系数尚未完全公开。
一个可落地的动作
不论模型怎么迭代,企业现在就能做的一件事是:把官网和对外资料里的关键图片、图表、产品手册,做得更"机器友好"。文件名别用 IMG_001,改成"品牌名_产品型号_核心卖点";图表里的结论用文字再表述一遍;PDF 说明书保留可复制的文本层。这些细节不会立刻带来流量,但会在 Agent 越来越能"看图"的未来,成为品牌被准确理解的基础设施。
对企业而言,模型能力迭代的节奏越来越快,但真正能被 AI 稳定引用的品牌资产,永远建立在"内容本身是否清晰、可信、可被机器理解"之上。
信息来源
- DeepSeek 官方 API 文档(模型详情页 / 图像理解指南),2026-08-21,https://api-docs.deepseek.com/zh-cn/
- 腾讯新闻《DeepSeek终于长出"眼睛",V4 Flash视觉模型上线》,2026-08-21,https://news.qq.com/rain/a/20260821A0B95B00
- 凤凰网科技《智谱GLM-5.3上线:擅长复杂编码、防御性网络安全及长程任务》(同批行业动态报道),2026-08-19,https://tech.ifeng.com/c/8viB3LzQ0FO

