文本是《AI咨询(共124篇)》专题的第 124 篇。阅读本文前,建议先阅读前面的文章:
- 1.Gemini 3.0 要掀桌子了?它到底能不能影响到 GPT 和 Claude——以及**
- 2.🤖到底哪种AI才适合你?
- 3.Claude”全能模型”?我来给你扒一扒他的真实战力
- 4.为什么国内模型这么多,还是有很多人用国外的模型?
- 5.2025编程AI模型终极省钱指南:又便宜又能干的”码农助手”怎么选?
- 6.AI小白选择指南:别慌,我教你
- 7.公司批量跑图片数据?2025年最新模型全景选型指南
- 8.AI模型这么多,我难道要一个一个接入?
- 9.纯小白的大模型API使用指南:从”这是啥”到”我会了”
- 10.AI赋能企业:从”人工智障”到”人工智能”的华丽转身
- 11.AI酒馆玩家必读:API中转站的六大核心优势
- 12.Claude Code写代码的好处:让AI当你的编程助手
- 13.Gemini 3全面评测:比Gemini 2.5强在哪?性能对比+实战测试【2025最新】
- 14.详细教程:国内调用 Google Gemini 3.0 Pro API 接口(附 Python 示例)
- 15.🚀 Claude Opus 4.5:Anthropic 2025年发布的旗舰级AI模型,全面升级!
- 16.🚀 Claude Opus 4.5 横空出世,国内调用教程(附 Python 示例)
- 17.无需翻墙!YibuAPI中转站带你直连Google Gemini 3,多模态AI能力即刻解锁
- 18.Google Gemini 3.0 Pro国内接入指南:API中转破解三重困境
- 19.最全 调用 Gemini 3.0 Pro 完整教程-附完整python代码(2025最新版)
- 20.🚀 Google Gemini 3.0 Pro国内直连:API中转破困境,3步接入教程
- 21.GPT-5:国内开发者零门槛接入指南,低价多模态API实战方案
- 22.Gemini3:国内开发者零门槛接入指南,原生多模态 API 实战方案
- 23.Claude 4合规接入教程:国内支付+250万Token免费领,多模态API实战
- 24.Java调用大模型API实战指南:从环境搭建到生产级适配
- 25.GPT-5 API国内直连解决方案:开发者接入指南
- 26.无需费脑!YibuAPI中转站直连Claude Opus 4.5,解锁新一代超智能AI交互体验
- 27.9步配置Sider+一步API:打造网页浏览最强AI助手(开发者避坑指南)
- 28.打工人狂喜!GPT-5.2强势来袭,办公效率翻倍,YIBUAPI零门槛解锁
- 29.GPT-5.1与GPT-5.2全面评测及落地手册:能力迭代解析与一步API接入实操
- 30.破解AI模型集成的”多端适配困局”:一站式解决方案的技术实践
- 31.纯小白入门大模型API:从零基础到实战通关
- 32.详细教程:国内调用 GPT-5.2 API 接口(附 Python 示例)
- 33.gpt-image-1.5 国内直连指南:解锁多模态AI创作新体验
- 34.step-audio-2 解锁跨模态音频新纪元:国内无缝接入指南
- 35.小米MiMo-V2-Flash:开源大模型的效率革命与全能突破
- 36.GPT-Image-1.5 性能巅峰!国内直连攻略(无壁垒接入)
- 37.Mistral 3系列模型国内直连指南:突破壁垒的API中转方案
- 38.PHP 项目调用大模型 API 全流程实战(适配 OpenAI/国内大模型)
- 39.Claude Opus 4.5:凭何加冕编程新王?
- 40.Gemini 3.0 Pro:多模态重塑编程生态,开启智能开发新纪元
- 41.GLM-4.7:开源大模型的全能进化,重新定义人机协同边界
- 42.DeepSeek-V3.2重磅开源:340B混合专家架构,重塑开源大模型性能新标杆
- 43.国内外主流AI大模型全景对比与国外大模型高效接入方案
- 44.解锁 AI 大模型价值:从低门槛接入到未来布局
- 45.开源突围VS闭源巅峰:DeepSeek-V3.2与GPT-5.2全方位实力对决
- 46.双雄对决:DeepSeek-V3.2与Gemini 3.0 Pro的AI技术路径博弈
- 47.GLM-4.7与GPT-5.2全面对比及一步API接入指南
- 48.Grok-4.1:马斯克的AI新王,重新定义人机交互新范式
- 49.Grok-4.1横空出世:双商驱动重构大模型竞争新秩序
- 50.一步API:赋能企业高效链接全球AI大模型的核心枢纽
- 51.一步API:轻松打通GPT-5.2接入链路,赋能全场景AI应用
- 52.一步API:打通全球顶尖AI的桥梁,Gemini 3.0 Pro接入指南全解析
- 53.Sora Video2:次世代AI视频生成引擎,从功能突破到API实战接入
- 54.Sora Video2:重塑AI视频生成生态,附完整API接入指南
- 55.Sora Video2深度解析:核心能力与一步API接入全指南
- 56.DeepSeek-V3.2:技术革新与一步API平台接入指南
- 57.Sora Video2:重塑AI视频创作生态,一步API解锁国内零门槛接入
- 58.Kimi K2.5:多模态全能模型的突破与一步API接入指南
- 59.Kimi K2.5:全能开源AI新标杆,一步API接入实战指南
- 60.ClaudeBox入门到实战:容器化AI编程环境+国内合规API接入全指南
- 61.Clawdbot+一步API:破解国内AI智能体落地难题,打造本地化“数字员工”新范式
- 62.Clawdbot 与一步 API 深度集成:打造个人 AI 管家
- 63.Clawdbot(Moltbot):本地优先的全能AI助手与一步API接入实战指南
- 64.OpenClaw+一步API接入指南:打通企业级AI能力,10分钟落地数字协作者
- 65.揭秘AI漫剧制作全流程:从0到1低成本创作,一步API助力效率飙升
- 66.Sora2政策收紧,Veo 3.1能否撑起AI漫剧生产力大旗?
- 67.AI漫剧制作新纪元:4K高清+稳如磐石,一步API解锁创作新可能
- 68.4K高清时代降临!Veo 3.1模型正式上线,一步API零门槛接入
- 69.实测一步API跑Veo 3.1 4K:2026商用漫剧,画质与稳定才是生死线
- 70.今日首发|Claude Opus 4.6重磅登场,核心能力全面跃升,新功能解锁高效体验
- 71.Claude Opus 4.6 版本特性解析及一步API接入指南
- 72.双雄炸场!Claude Opus 4.6与GPT-5.3-Codex对决,AI编程迈入全能协作新纪元
- 73.GPT-5.3-Codex重磅发布|OpenAI最强编程智能体,一步API便捷接入适配全场景
- 74.doubao-Seedance-2.0:字节自研Seed基座重构AI视频创作,一步API接入开启全场景生产力
- 75.阿里Qwen-Image-2.0重磅发布:生编一体焕新AI图像创作,一步API平台便捷接入
- 76.GLM-5重磅来袭:开源SOTA旗舰模型,一步API轻松解锁全能AI能力
- 77.豆包大模型2.0重磅发布 一步API开启企业AI升级高效接入新路径
- 78.除夕开源重磅:Qwen3.5重构大模型范式,开启效率与能力双优新时代
- 79.跨代升级来袭!豆包大模型Seed-2.0正式发布,全维度解锁AI新能力
- 80.谷歌Gemini 3.1 Pro重磅发布:推理性能翻倍,一步API快速接入指南
- 81.大年初二重磅!Anthropic 最强 Sonnet 来袭:Claude Sonnet 4.6 发布,一步API一键直连
- 82.Seedance-2.0:重构AI视频创作范式,开启导演级创作新纪元
- 83.Seedance-2.0重构AI漫剧/短剧生态:新手零门槛量产,全群体可API接入抢占百亿风口
- 84.百亿赛道突围:Seedance-2.0重构AI漫剧/短剧创作逻辑,全群体均可API接入量产
- 85.Seedream 5.0 Lite重磅上线:三大能力革新,一步API轻松接入解锁全场景创作
- 86.Fable 5轰然倒下的48小时:中国AI完成了一场安静的”接棒”
- 87.GLM-5.2实测:一亿token验证,国产Coding之光真的来了
- 88.Seedance 2.0 Mini重磅发布:AI视频生成成本腰斩,一步API抢先接入体验
- 89.GLM-5.2 开源炸场!Code Arena 全球第一,国产大模型终于能写 “真工程” 了
- 90.刚刚,Anthropic认怂了!Claude Fable 5即将全球回归,但代价是刷脸?
- 91.Claude Code Artifacts上线:AI终于学会了”汇报工作”,终端秒变实时协作看板
- 92.谷歌Gemini 3.5 Pro被曝难产:数学封神、编程拉胯,皮查伊罕见承认AI赛道掉队
- 93.外卖公司做出1.6万亿参数大模型:美团这只”LongCat”,盯上的不是发布会
- 94.小米 MiMo-V2.5 全面接棒:AI 不再只会聊天,国产大模型开始卷“办事能力”了
- 95.GPT-5.6要来了:AI模型大战,正在从“谁更聪明”变成“谁更好用”
- 96.谁最先用上 GPT-5.6?一步 API 抢先接入,Codex 才是核心升级
- 97.Claude Fable 5 vs GPT-5.6 Sol:5 个关键差异,谁更适合你?
- 98.别再乱用AI了!6大模型实测后,我让你知道谁才是真正主力
- 99.凌晨 00:30 后调用 DeepSeek 真能更便宜?答案没那么简单
- 100.从“补代码”到“跑项目”:快手 KAT-Coder-Pro V2.5 到底强在哪?
- 101.GPT Image 2.0 对上 Seedream 5.0 Pro:新一代 AI 生图模型,谁更值得用?
- 102.DeepSeek V4突然提速:Kimi K3刚登场,国产大模型新一轮对决就来了
- 103.Google 不再只卷”最强模型”:轻量 Gemini,正在把 AI 竞争拉进价格战
- 104.我卸载了 12 个 AI 工具,效率反而翻了一倍
- 105.GPT-5.4没了,刚调好的提示词又白费了?
- 106.Claude发了新模型,但整场发布会没提”最聪明”
- 107.美团3万个AI Agent背后:当AI不再是对话框,你的工作方式正在被改写
- 108.GPT-6突然刷屏!OpenAI还没官宣,全网却已经开始倒计时
- 109.OpenAI急了?GPT-5.6刚上线就暴降80%,AI价格战彻底打响
- 110.GPT-6真要来了?OpenAI下一代模型Astra曝光,普通用户先看懂这4件事
- 111.别再用贵模型硬跑了:Claude Code、Codex 接入 DeepSeek-V4-Flash 教程
- 112.别再乱装AI工具了:2026真正值得用的,我替你筛好了
- 113.别再花冤枉钱试视频模型了:MiniMax H3、Kling 3.0、Veo 3.1,到底怎么选?
- 114.刚刚,Google开源天气AI:一次推演1000种台风走向
- 115.AI圈炸锅:Fable 5.1 8月发布、对标GPT-6?真相没那么简单
- 116.95%!GPT-5.6-Cyber 发布:模型 ID、价格、API 都公开了,为什么你还是调用不了?
- 117.8月14日,马斯克会突然出牌吗?Grok 4.6背后的三个信号
- 118.原本要涨50%,Claude为什么在最后关头踩刹车?
- 119.刚发布就涨价,DeepSeek V4 Pro 到底要干嘛?普通用户有必要买单吗?
- 120.DeepSeek涨价、Google降价、OpenAI提速14倍:AI价格战真正拼的,已经不是模型能力
- 121.DeepSeek V5 Flash架构、Agent 与成本,能否一起跃迁?
- 122.谁在被开发者疯狂调用?本周大模型调用榜前十出炉
- 123.同一个项目丢给 3 款国产 AI 编程工具,谁真的能交付?
DeepSeek视觉模型杀疯了:1分钱看9张图,Agent终于不再“瞎写”!牛来竟然是它?
DeepSeek-V4-Flash-Vision-Exp上线后,最值得关注的不是“会不会看图”,而是它终于可以把视觉能力接进 Agent 工作流:看图、改前端、跑 Blender、反复截图验证,开始变成一条完整链路。
DeepSeek 的多模态模型,终于从“内测传闻”走到了公开 API。
这次上线的是 deepseek-v4-flash-vision-exp。它不负责生成图片,而是负责理解图片,并把视觉信息交给 Agent 继续执行任务。
我把这次更新拆成三个问题:它看图到底怎么样?价格为什么能做到一分钱看九张图?接入 DeepSeek Harness 后,Agent 是否真的不再“闭着眼睛写代码”?
先给结论:单看基础识图,它更像是网页版视觉模型的公开版本;但一旦接入 Harness 和高强度推理,价值就从“回答图片问题”变成了“看着屏幕把事情做完”。
01 这次到底发布了什么?
deepseek-v4-flash-vision-exp 可以理解为 DeepSeek-V4-Flash 的视觉增强版本。
它支持图片输入,但目前不负责图片生成。也就是说,你可以把截图、设计稿、产品界面、代码报错、3D 参考图交给它,让模型先理解画面,再继续调用工具完成后续任务。
从公开信息和实际体验看,它的纯文本能力与 V4-Flash 正式版基本保持同一水平,变化主要集中在多模态 Agent 任务上。

DeepSeek 官方展示的方向也很明确:PPT 生成、网页改造、前端界面复刻、视觉理解和工具调用,都是它希望优先落地的场景。
02 1分钱,真的能看9张图吗?
这可能是这次更新最容易出圈的数字。
在 API 服务中,图片会先转换成 token,再按 token 计费。按素材中的计费口径,一张图片最多占用 384 tokens;在高峰期、缓存未命中的情况下,折算下来大约是 0.12 分钱一张。
换算一下:
- 1 分钱约等于 9 张图片;
- 1 元钱理论上可以处理约 833 张图片;
- 图片越简单、缓存命中越高,实际成本可能更低;
- 真实账单仍要以官方价格、图片尺寸、缓存状态和调用时段为准。
这里要加一个限定:“一分钱九张图”是按特定价格条件估算出来的传播口径,不是所有调用场景下的固定价格。
但即使把缓存、峰谷价格和输出 token 都算进去,视觉输入的成本依然足够低,这会直接降低开发者把图片接入日常 Agent 的门槛。
03 它真正的升级,在 Agent 里
如果只让模型回答“图片里有什么”,这次更新并不会让所有人产生强烈震动。
真正有意思的地方,是它可以把图片当成工作现场的一部分。
以前的 Agent 只能读取文字、执行命令、修改文件,却看不到浏览器里的页面,也看不懂设计稿和渲染结果。现在,视觉模型可以参与这样的循环:
- 读取截图或参考图;
- 判断当前结果和目标之间的差异;
- 修改代码、参数或场景;
- 重新运行并截图;
- 根据新画面继续返工。
这不是简单的“图片问答”,而是 视觉反馈驱动的 Agent 闭环。

04 Blender 实测:终于可以照着图做东西
这次测试里,一个很有代表性的任务是让 Agent 参考图片,在 Blender 里完成一个 3D 场景。
它会自行安装 Blender,创建场景,运行脚本,再通过截图观察结果。中间并不是一次生成,而是经历了多轮返工:模型会根据画面发现比例、材质、光泽和构图问题,然后继续修改。
最后的效果并不等于专业设计师作品,但它已经不再是“代码跑通就算完成”。模型开始关注物体是否像、光泽是否对、画面是否接近参考目标。

这类任务最能说明视觉模型的价值:它不只是理解图片,而是把图片变成了可执行的目标。
05 前端任务:从“能运行”到“看起来对”
另一个测试是让 Agent 用 Canvas 做一个宇宙风格的交互 Demo:点击画面,可以生成 UFO 和相关动画效果。
对前端开发来说,视觉反馈非常重要。一个页面能不能运行,只是第一关;布局是否舒服、动效是否自然、颜色是否统一、元素是否挤在一起,往往要靠截图才能判断。
过去,开发者需要自己盯着浏览器反复描述:“这个按钮往左一点”“背景太空了”“卡片高度不对”。有了视觉输入之后,Agent 可以直接看到问题,再进入下一轮修改。
所以,多模态真正改变的不是“模型会不会画”,而是 前端开发的反馈速度。
06 基础识图:强,但没有神化的必要
基础识图测试的结果比较有意思。
让模型识别三代蜘蛛侠同框的图片,它很快就给出了判断。对于人物、物体和场景这类常规问题,表现与已经内测的网页版视觉模型比较接近。
需要联网搜索的问题也能完成,但链路会明显变慢。比如搜索影视剧照或确认具体出处时,Agent 需要多轮调用搜索工具,整个过程可能持续几分钟;而在网页版里,简单识图通常不需要这么多工具调用。
不过,手指计数依然是多模态模型的老难题。第一轮回答很可能坚持“这是五根手指”,即使画面已经在暗示答案并不正确。
这提醒我们:视觉模型能看见,不代表它总能准确测量、计数和校验。
07 和 Harness 结合,才是这次更新的关键
DeepSeek Harness 同步加入了对第一方多模态模型的原生支持。开发者可以直接在工具里选择视觉模型,不需要再通过复杂的中转方案把图片传给 Agent。
这件事的意义不小。
模型单独发布,只是增加了一个 API;模型和 Harness 同天就位,才意味着开发者可以马上把它放进真实工作流。
几个更容易落地的场景包括:
- 根据设计稿复刻前端页面;
- 读取报错截图并定位问题;
- 观察浏览器结果后自动迭代 UI;
- 参考图片创建 Blender、Canvas 或 Three.js 场景;
- 对表格、流程图和产品截图进行结构化分析。
08 这不是“视觉能力终局”
这次更新值得关注,但没有必要把它包装成多模态终局。
它目前仍有几个清晰边界:
- 图片生成并不在它的能力范围内;
- 搜索型任务的工具链延迟可能较高;
- 手指、细小文字、复杂计数仍然容易出错;
- Agent 运行时间更长,输出也可能更繁琐;
- 视觉模型不一定适合替代日常纯文本模型,成本和缓存命中率需要单独评估。
更准确的说法是:它给 DeepSeek 的 Agent 体系补上了一双能工作的眼睛,但这双眼睛还需要工具、权限和人工复核来配合。
09 彩蛋:最近刷屏的“牛来”到底是谁?
说完 DeepSeek 的视觉模型,再补一个最近在开发者圈刷屏的名字:“牛来”。
它并不是官方名称,而是中文社区给匿名模型 Ox Alpha 起的外号。这个模型在 8 月 20 日前后以匿名形式出现在 OpenRouter,预览期提供免费访问,主打长上下文、编码和 Agent 任务,同时支持文本、图片和视频输入。
“牛来”之所以引发讨论,一方面是因为它的上下文窗口达到约 100 万 tokens,另一方面是部分社区测试显示,它在编码和长周期 Agent 任务上表现很强。
但这里必须把事实和猜测分开:模型提供方目前没有公开认领,社区里关于“它来自智谱”“它与 GLM 系列有关”或“它是某个海外团队的新模型”等说法,都还属于技术指纹分析和行业猜测,不能当成官方结论。
把“牛来”和 DeepSeek 视觉模型放在一起看,会发现一个有意思的趋势:多模态正在从“模型功能”变成“Agent 基础设施”。
DeepSeek 补上的是视觉输入和工具闭环;Ox Alpha 展示的则是长上下文、多模态和编码 Agent 的组合潜力。接下来真正决定产品价值的,不只是模型是谁家的,而是它能不能稳定、低成本地进入开发者每天使用的工作流。
10 结语:DeepSeek 终于摘下了眼罩
过去几个月,很多人都在等 DeepSeek 把视觉能力正式接入 Agent。
现在它终于来了。
单看识图,它没有突然变成另一个物种;但接入 Harness、工具调用和高强度推理之后,模型开始能够看着结果继续修改,而不是只凭文字猜测页面长什么样。
这正是多模态 Agent 的真正价值:不是让模型会看一张图,而是让它看完之后知道下一步该做什么。
至于“一分钱看九张图”能不能长期保持,还是要看后续官方定价、缓存策略和实际调用量。但至少在今天,视觉能力已经不再是少数大模型的昂贵特权。
欢迎关注 一步API,我们还会持续分享更多 AI 资讯、AI 工具、实战经验、踩坑记录,助力你高效玩转 AI 开发、避开行业弯路。

想了解更多细节、获取专属支持,可添加客服微信:xuexiv5876 / YibuDev,随时咨询交流~
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。
资料说明:模型名称、价格、权限和接口状态请以 DeepSeek 官方文档为准。
