当前位置:首页>文章>工具配置>DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

文本是《AI咨询(共124篇)》专题的第 124 篇。阅读本文前,建议先阅读前面的文章:

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

DeepSeek-V4-Flash-Vision-Exp上线后,最值得关注的不是“会不会看图”,而是它终于可以把视觉能力接进 Agent 工作流:看图、改前端、跑 Blender、反复截图验证,开始变成一条完整链路。

DeepSeek 的多模态模型,终于从“内测传闻”走到了公开 API。

这次上线的是 deepseek-v4-flash-vision-exp。它不负责生成图片,而是负责理解图片,并把视觉信息交给 Agent 继续执行任务。

我把这次更新拆成三个问题:它看图到底怎么样?价格为什么能做到一分钱看九张图?接入 DeepSeek Harness 后,Agent 是否真的不再“闭着眼睛写代码”?

先给结论:单看基础识图,它更像是网页版视觉模型的公开版本;但一旦接入 Harness 和高强度推理,价值就从“回答图片问题”变成了“看着屏幕把事情做完”。

01 这次到底发布了什么?

deepseek-v4-flash-vision-exp 可以理解为 DeepSeek-V4-Flash 的视觉增强版本。

它支持图片输入,但目前不负责图片生成。也就是说,你可以把截图、设计稿、产品界面、代码报错、3D 参考图交给它,让模型先理解画面,再继续调用工具完成后续任务。

从公开信息和实际体验看,它的纯文本能力与 V4-Flash 正式版基本保持同一水平,变化主要集中在多模态 Agent 任务上。

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

DeepSeek 官方展示的方向也很明确:PPT 生成、网页改造、前端界面复刻、视觉理解和工具调用,都是它希望优先落地的场景。

02 1分钱,真的能看9张图吗?

这可能是这次更新最容易出圈的数字。

在 API 服务中,图片会先转换成 token,再按 token 计费。按素材中的计费口径,一张图片最多占用 384 tokens;在高峰期、缓存未命中的情况下,折算下来大约是 0.12 分钱一张

换算一下:

  • 1 分钱约等于 9 张图片;
  • 1 元钱理论上可以处理约 833 张图片;
  • 图片越简单、缓存命中越高,实际成本可能更低;
  • 真实账单仍要以官方价格、图片尺寸、缓存状态和调用时段为准。

这里要加一个限定:“一分钱九张图”是按特定价格条件估算出来的传播口径,不是所有调用场景下的固定价格。

但即使把缓存、峰谷价格和输出 token 都算进去,视觉输入的成本依然足够低,这会直接降低开发者把图片接入日常 Agent 的门槛。

03 它真正的升级,在 Agent 里

如果只让模型回答“图片里有什么”,这次更新并不会让所有人产生强烈震动。

真正有意思的地方,是它可以把图片当成工作现场的一部分。

以前的 Agent 只能读取文字、执行命令、修改文件,却看不到浏览器里的页面,也看不懂设计稿和渲染结果。现在,视觉模型可以参与这样的循环:

  1. 读取截图或参考图;
  2. 判断当前结果和目标之间的差异;
  3. 修改代码、参数或场景;
  4. 重新运行并截图;
  5. 根据新画面继续返工。

这不是简单的“图片问答”,而是 视觉反馈驱动的 Agent 闭环

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

04 Blender 实测:终于可以照着图做东西

这次测试里,一个很有代表性的任务是让 Agent 参考图片,在 Blender 里完成一个 3D 场景。

它会自行安装 Blender,创建场景,运行脚本,再通过截图观察结果。中间并不是一次生成,而是经历了多轮返工:模型会根据画面发现比例、材质、光泽和构图问题,然后继续修改。

最后的效果并不等于专业设计师作品,但它已经不再是“代码跑通就算完成”。模型开始关注物体是否像、光泽是否对、画面是否接近参考目标。

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

这类任务最能说明视觉模型的价值:它不只是理解图片,而是把图片变成了可执行的目标。

05 前端任务:从“能运行”到“看起来对”

另一个测试是让 Agent 用 Canvas 做一个宇宙风格的交互 Demo:点击画面,可以生成 UFO 和相关动画效果。

对前端开发来说,视觉反馈非常重要。一个页面能不能运行,只是第一关;布局是否舒服、动效是否自然、颜色是否统一、元素是否挤在一起,往往要靠截图才能判断。

过去,开发者需要自己盯着浏览器反复描述:“这个按钮往左一点”“背景太空了”“卡片高度不对”。有了视觉输入之后,Agent 可以直接看到问题,再进入下一轮修改。

所以,多模态真正改变的不是“模型会不会画”,而是 前端开发的反馈速度

06 基础识图:强,但没有神化的必要

基础识图测试的结果比较有意思。

让模型识别三代蜘蛛侠同框的图片,它很快就给出了判断。对于人物、物体和场景这类常规问题,表现与已经内测的网页版视觉模型比较接近。

需要联网搜索的问题也能完成,但链路会明显变慢。比如搜索影视剧照或确认具体出处时,Agent 需要多轮调用搜索工具,整个过程可能持续几分钟;而在网页版里,简单识图通常不需要这么多工具调用。

不过,手指计数依然是多模态模型的老难题。第一轮回答很可能坚持“这是五根手指”,即使画面已经在暗示答案并不正确。

这提醒我们:视觉模型能看见,不代表它总能准确测量、计数和校验。

07 和 Harness 结合,才是这次更新的关键

DeepSeek Harness 同步加入了对第一方多模态模型的原生支持。开发者可以直接在工具里选择视觉模型,不需要再通过复杂的中转方案把图片传给 Agent。

这件事的意义不小。

模型单独发布,只是增加了一个 API;模型和 Harness 同天就位,才意味着开发者可以马上把它放进真实工作流。

几个更容易落地的场景包括:

  • 根据设计稿复刻前端页面;
  • 读取报错截图并定位问题;
  • 观察浏览器结果后自动迭代 UI;
  • 参考图片创建 Blender、Canvas 或 Three.js 场景;
  • 对表格、流程图和产品截图进行结构化分析。

08 这不是“视觉能力终局”

这次更新值得关注,但没有必要把它包装成多模态终局。

它目前仍有几个清晰边界:

  • 图片生成并不在它的能力范围内;
  • 搜索型任务的工具链延迟可能较高;
  • 手指、细小文字、复杂计数仍然容易出错;
  • Agent 运行时间更长,输出也可能更繁琐;
  • 视觉模型不一定适合替代日常纯文本模型,成本和缓存命中率需要单独评估。

更准确的说法是:它给 DeepSeek 的 Agent 体系补上了一双能工作的眼睛,但这双眼睛还需要工具、权限和人工复核来配合。

09 彩蛋:最近刷屏的“牛来”到底是谁?

说完 DeepSeek 的视觉模型,再补一个最近在开发者圈刷屏的名字:“牛来”

它并不是官方名称,而是中文社区给匿名模型 Ox Alpha 起的外号。这个模型在 8 月 20 日前后以匿名形式出现在 OpenRouter,预览期提供免费访问,主打长上下文、编码和 Agent 任务,同时支持文本、图片和视频输入。

“牛来”之所以引发讨论,一方面是因为它的上下文窗口达到约 100 万 tokens,另一方面是部分社区测试显示,它在编码和长周期 Agent 任务上表现很强。

但这里必须把事实和猜测分开:模型提供方目前没有公开认领,社区里关于“它来自智谱”“它与 GLM 系列有关”或“它是某个海外团队的新模型”等说法,都还属于技术指纹分析和行业猜测,不能当成官方结论。

把“牛来”和 DeepSeek 视觉模型放在一起看,会发现一个有意思的趋势:多模态正在从“模型功能”变成“Agent 基础设施”。

DeepSeek 补上的是视觉输入和工具闭环;Ox Alpha 展示的则是长上下文、多模态和编码 Agent 的组合潜力。接下来真正决定产品价值的,不只是模型是谁家的,而是它能不能稳定、低成本地进入开发者每天使用的工作流。

10 结语:DeepSeek 终于摘下了眼罩

过去几个月,很多人都在等 DeepSeek 把视觉能力正式接入 Agent。

现在它终于来了。

单看识图,它没有突然变成另一个物种;但接入 Harness、工具调用和高强度推理之后,模型开始能够看着结果继续修改,而不是只凭文字猜测页面长什么样。

这正是多模态 Agent 的真正价值:不是让模型会看一张图,而是让它看完之后知道下一步该做什么。

至于“一分钱看九张图”能不能长期保持,还是要看后续官方定价、缓存策略和实际调用量。但至少在今天,视觉能力已经不再是少数大模型的昂贵特权。

欢迎关注 一步API,我们还会持续分享更多 AI 资讯、AI 工具、实战经验、踩坑记录,助力你高效玩转 AI 开发、避开行业弯路。

DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?

想了解更多细节、获取专属支持,可添加客服微信:xuexiv5876 / YibuDev,随时咨询交流~

如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。

资料说明:模型名称、价格、权限和接口状态请以 DeepSeek 官方文档为准。

给TA打赏
共{{data.count}}人
人已打赏
工具配置

AI圈炸锅:Fable 5.1 8月发布、对标GPT-6?真相没那么简单

2026-8-10 15:23:14

数据结构

优先队列与堆(Heap)详解:概念、实现、Heapify 与应用

2025-8-18 10:09:09

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧
个人中心
购物车
优惠劵
今日签到
有新私信 私信列表
搜索