DeepSeek 首款视觉模型上线:V4 补上最后一块拼图,会「看」的 Agent 来了

DeepSeek 首款视觉模型上线:V4 补上最后一块拼图,会「看」的 Agent 来了

· ⏱ 5 分钟阅读 ✍️ spark1 👁 1 次阅读 📂 AI普惠系列
🎧 听全文
点击播放,AI语音朗读全文
1.0x
标签 DeepSeek AI资讯

8月21日,DeepSeek 在其 API 平台上线了首款多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,开发者把请求里的 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。名字末尾那个 Exp 已经把定位说得很明白:这是一个实验性版本,还不是 V4-Flash 的多模态正式版。

对等这块拼图等了快四个月的人来说,这条消息的分量不亚于又一次「发新模型」。

V4 的最后一块拼图

把时间线铺开看,DeepSeek 这局棋下得很有节奏:

视觉是最后一块,也是外界等得最久的一块。以至于在官方开放之前,社区已经等不及自己动手,把第三方视觉编码器接到 V4-Flash-0731 上,做出了非官方的「混合视觉」版本(关于 V4 本身和 Harness,可回看《DeepSeek 是什么?国产大模型黑马完全解读》《DeepSeek 官方 Agent 框架 Harness,5 分钟跑通》)。

「会看」到底带来了什么

按 DeepSeek 官方说法,V4-Flash-Vision-Exp 在纯文本能力(Agent、推理、世界知识)上与 V4-Flash 正式版持平;而在需要视觉理解的 Agent Benchmark 上,相比 V4-Flash 实现了大幅跃升,多模态 Agent 能力已接近 Claude Opus-4.8(以上均为官方/媒体口径)。

官方公告给了三个能力示例,恰好都是「看图干活」的场景:在 Agent 框架下生成一份面向高净值客户的西藏自驾游定制 PPT;对 DeepSeek Harness 官网做深海黑蓝加玻璃 UI 风格的二次创作;以及做一个黏土怪物风格的动态特效前端 Demo。

这三点背后是同一件事:文本模型再强,也只能「读」和「写」,接不住真实世界里一张截图、一份设计稿、一个待改的网页。视觉补上之后,Agent 才能把眼睛伸进这些任务里。DeepSeek Harness 也在发布前两小时同步新增了对该模型的支持,等于给自家 Agent 框架配上了第一双眼睛。

成本:又是一发「掀桌子」的价格

价格是 DeepSeek 的保留节目。这次视觉模型沿用 V4-Flash 正式版的价格体系,即「价格和 V4-Flash 正式版一致」(财新网口径)。而 V4-Flash 上一次出场,就是把大模型调用成本打到「几亿 token 才几块钱」的级别(见《DeepSeek 又掀桌子了:几亿 token 才几块钱》)。

换句话说:视觉不再是高端模型的专属小灶,它正被拉到和文本模型同一个价位的平民档。这对相册整理、票据识别、截图转代码、设计稿还原这一类「普通人也会遇到」的视觉活儿,意义比跑分更重要。

冷思考:兴奋之前,摆正预期

有三件事值得先按住。

第一,Exp 就是实验版。它明确不是正式发布,稳定性、可用额度、规模的正式供应都还悬着,开发者今天能调,不代表明天可以直接搬上生产线。

第二,「接近 Opus-4.8」是官方在特定 Benchmark 上的口径,实战效果向来众说纷纭——Benchmark 分数和真实项目里的表现,吃的是两套功夫。

第三,对普通用户来说这还早。这是一个面向开发者的 API 模型,不是面向 C 端的新应用。但它真正传递的信号是:国产大模型从文本卷到多模态,补齐「眼睛」的速度比很多人预想的快。会看图、会动手的 AI,离普通人的工具箱又近了一步。

Q: DeepSeek 这次上线的是什么模型?

是 DeepSeek-V4-Flash-Vision-Exp,DeepSeek 首款多模态视觉理解模型,8月21日上线其 API 平台。开发者在请求里把 model 参数设为 deepseek-v4-flash-vision-exp 即可调用。名字里的 Exp 表示这是实验性版本,不是 V4-Flash 的多模态正式版。

Q: 它的「视觉」能力有什么用?

主要用于让 Agent「看图干活」:文字模型只能读写文本,接不住截图、设计稿、网页这类视觉输入。补上视觉后,官方示例包括生成西藏自驾游定制 PPT、对官网做视觉风格的二次创作、做黏土怪物风动态前端 Demo 等。DeepSeek Harness 也已同步支持该模型。

Q: 价格贵吗?

不贵。据财新网报道,视觉模型价格与 V4-Flash 正式版一致。而 V4-Flash 此前就把调用成本打到了「几亿 token 才几块钱」的平民价位,视觉因此也被拉到了和文本同档的低成本区间。

Q: 「接近 Opus-4.8」可信吗?

这是 DeepSeek 官方在视觉理解相关 Agent Benchmark 上的口径,指多模态 Agent 能力已接近 Claude Opus-4.8。Benchmark 分数与真实项目表现是两回事,引用时应标注为官方/媒体口径,实际效果以各自场景的实测为准。

📄 版权声明:本文由 AI家园 团队创作。欢迎非商业性转载或引用,转载时须注明原文出处并保留原文链接;商业使用请事先联系授权。

本文链接:https://spark1.cn/articles/20260822-deepseek-shou-kuan-shi-jue-mo-xing-shang-xian-v4-bu-shang-zui-hou-yi-kuai-pin-tu · 转载规则详见《服务条款》

🎁 喜欢这篇文章?获取更多干货

关注公众号「xAI智工场」

关注公众号「xAI智工场」

每天一个AI干货
回复「提示词」免费领价值¥199模板

💬

加入AI交流群

微信号:xaizgc
和AI爱好者一起成长

🔥 超值

知识星球·深度圈

系统课程 · 社群答疑 · 资源库
原价¥999 ¥99/年

立即加入 →
分享到

💡 想用 AI 马上搞定这件事?

查看全部 AI 工具 →

💬 评论

加载中...

转载或引用本站内容请注明原文出处及链接 · 转载规则

Copyright © 2026 AI家园 浙ICP备2024142181号-2 浙公网安备 33010202005420号