1000张图只要1块钱:多模态版 DeepSeek 暴力破局,多模态高价神话彻底崩塌
1000张图只要1块钱:多模态版 DeepSeek 暴力破局,多模态高价神话彻底崩塌
就在今天,DeepSeek 再次把价格屠刀挥向了多模态领域。
官方首个多模态视觉 API 模型 DeepSeek-V4-Flash-Vision-Exp 正式上线,并同步接入刚刚开源的 DeepSeek Harness 运行时。
如果说过去各大硅谷巨头把多模态(Vision)当成高端收费增值项,那么 DeepSeek 这次的定价直接让整个行业倒吸一口凉气:单张图片最多只占 384 个 Token,输入计费与纯文本版 V4-Flash 完全一致(3元/百万 Token,谷时段 1.5元/百万 Token)!
换算下来:处理 1000 张 1024×1024 高清大图,在 Claude Sonnet 4.6 上要烧掉近 29 元人民币(吃掉 1334 个 Token/图),在 GPT-5.4 Vision 上要 14 元,而在 DeepSeek 这里只要 1.15 元,夜间谷时段更是低至不到 6 毛钱!
25 倍到 50 倍的断崖式价差,宣告多模态高价神话彻底终结。
“一千张图三十块”与“一千张图一块钱”:这是两种完全不同的产品哲学
很多开发者觉得多模态降价只是省了点 API 账单,但从系统架构和产品设计的角度来看,价格差了 50 倍,意味着 Agent 的底层设计逻辑完全被颠覆了。
在过去每千张图要花 30 块钱的时代: – 开发者必须斤斤计较“这一步究竟有没有必要截屏让 AI 看”; – 必须通过 OCR、语义解析做前置过滤,生怕调用一次视觉模型导致账单爆炸; – 视觉往往被隔离在独立流程之外,沦为“低频低优先级”的后备手段。
而当 1000 张图被拉平到 1 块钱甚至 6 毛钱时: – 全流程截图闭环(Continuous Visual Feedback)成为可能:UI 自动化 Agent 可以每执行一步操作就截一次屏,通过实时像素对比确认按钮是否点击成功、页面是否正确跳转; – 前端代码 1:1 视觉像素级复刻:直接丢一张完整复杂的 Web 页面,模型在 384 个 Token 内就能拆解布局栅格、字重层级与十六进制色值,并手写出带有动态响应与悬浮态的单文件 HTML; – 免费的 Files API 零冗余传输:配合新上线的 Files API,同一张设计稿或报表只需上传一次拿到 `file_id`,多轮对话反复引用无需重新传图,彻底消除了往返带宽瓶颈。
在纯文本基准测试中,带上视觉能力的 V4-Flash 在 7 项 Agent 评测中有 6 项反超了纯文本版本——视觉不再是外挂的“昂贵插件”,而是与文本逻辑深度交织的基础器官。
拼完文本卷视觉:开源生态的“全栈绞杀”
过去一周,DeepSeek 的连环出牌节奏极其紧凑: – 8月13日:开源微内核智能体框架 DeepSeek Harness,搭建好了 Agent 运行时的骨架; – 8月19日:Harness 迅速迭代至 rc.8,把竞对 Claude Code 和 Codex 收编为模块化子代理; – 8月21日:多模态视觉 API 全面开放,Files API 免费就绪,Harness 0.1.1 原生免配置直连。
从底层模型、多模态感知到上层工作流编排,开源生态用极低的价格与完全透明的代码,给闭源巨头筑起的高墙来了一记组合拳。
Kate 的观点与判断
对于正在开发具身智能、GUI Agent 和多模态应用的团队,我有三个直接的判断:
1. “多模态单独计费”的商业模式已经死亡。任何试图将多模态能力包装成高阶溢价功能的产品,都会在白菜价的开源 API 冲击下失去竞争力。视觉能力必将成为所有大模型的出厂默认标配。 2. GUI 与自动化 Agent 迎来爆发拐点。此前由于看图成本过高,端侧自动化(Computer Use / RPA)一直无法大规模跑通;当视觉 Token 成本趋近于零时,基于视觉流的桌面操作、自动化测试和跨平台 RPA 将在各行各业迅速普及。 3. “土法拼凑”不如拥抱原生多模态。过去很多架构师费尽心思把图片转为 OCR 文本、向量检索再喂给纯文本大模型,链路冗长且极易丢失空间信息。现在,直接让具备原生视觉能力的轻量模型进行端到端感知,才是最优雅、最稳健的工程解。
大模型从“盲人摸象”走向“睁眼看世界”,不该成为少数富豪用户的特权。把视觉成本打进地平线,真实的工业级智能才会真正降临。