AI 的下一场战争,不是模型之争,而是 Agent 平台之争

摘要

过去 24 小时,AI 行业最值得关注的消息并不是某个模型刷新了 Benchmark,而是微软宣布成立 Microsoft Frontier Company,计划投入 25 亿美元帮助企业构建 AI 系统,而不是推广某一个固定模型。与此同时,Anthropic 刚刚发布 Claude Sonnet 5,OpenAI 最新关于 Codex 的研究也显示,AI Agent 正在承担越来越长、越来越复杂的知识工作。

这些事件共同说明:

企业 AI 已经从“选哪个模型”进入“如何构建 Agent 平台”的阶段。

未来真正决定竞争力的,将不再只是模型参数,而是 Agent 工作流、工具调用、安全治理、可观测性以及工程化能力。



企业 AI 的关注点正在发生变化

过去两年,企业讨论 AI 时最常见的问题通常是:

  • 用 GPT 还是 Claude?
  • 用闭源还是开源?
  • 上下文有多长?
  • 每百万 Token 多少钱?

这些问题依然重要,但已经不是核心。

7 月 2 日,微软宣布成立 Microsoft Frontier Company,投入约 25 亿美元,帮助企业根据自身业务、数据和流程选择并组合不同 AI 模型,而不是绑定单一模型提供商。微软强调,企业越来越倾向于采用混合模型策略,并希望保留对 AI 系统成果的控制权。

这释放出一个非常明确的信号:

企业真正购买的,不再只是模型,而是完整的 AI 系统能力。


为什么模型开始“退居二线”?

过去,大模型像数据库。

大家比的是:

  • 参数规模
  • 推理能力
  • Benchmark
  • Token 成本

而现在,大模型越来越像操作系统里的一个运行时(Runtime)。

真正的应用开始围绕它构建:

  • Memory
  • Planner
  • Tool Calling
  • Browser
  • Terminal
  • MCP
  • Workflow
  • Multi-Agent

也就是说:

用户任务
      │
      ▼
 Planner
      │
      ▼
 Memory
      │
      ▼
 Tool Calling
      │
      ▼
   LLM(Claude / GPT / Gemini / Qwen)
      │
      ▼
 结果

模型已经成为系统中的一个组件,而不是整个系统。


Claude Sonnet 5 再次证明了这一趋势

Anthropic 于 6 月 30 日发布 Claude Sonnet 5,官方将其定位为目前最具 Agent 能力的 Sonnet 模型,重点提升了编码、推理、工具调用和专业知识工作能力,并同步推出面向科研场景的 Claude Science。

值得注意的是,Anthropic 官方几乎不再强调传统意义上的聊天体验,而是不断强化:

  • Agent
  • Tool Use
  • Professional Work
  • Long-running Tasks

说明他们已经把 Claude 定位成:

可以持续执行任务的 Agent Runtime。

这与微软的新战略方向高度一致。


OpenAI 的数据同样说明了 Agent 正在改变工作方式

OpenAI 最近公开的《How agents are transforming work》研究显示,随着 Agent 能力提升,用户越来越多地把 AI 用于持续数十分钟甚至数小时的复杂任务,而不仅仅是一次性的问答。

论文中的几个趋势尤其值得关注:

  • 2026 年上半年,Codex 活跃用户增长超过 5 倍;
  • 多 Agent 并行工作的比例持续提升;
  • 企业用户比个人用户更快采用 Agent 工作流;
  • AI 正逐渐替代传统聊天式交互,承担完整的工作任务。

这意味着,AI 的价值正在从“回答问题”升级为“完成工作”。


对 Web 开发最大的影响是什么?

作为 Web 开发者,我们需要重新理解自己的工作。

过去:

需求
↓

写代码

↓

提交

未来:

需求

↓

Planner Agent

↓

Coding Agent

↓

Review Agent

↓

Test Agent

↓

Developer Review

↓

Merge

开发者越来越像:

Agent Orchestrator(Agent 调度者)

真正写代码的比例会下降,而更多时间会用于:

  • 定义任务
  • 拆解工作流
  • 制定规范
  • 审查结果
  • 控制权限

为什么 AI 工程化会成为核心竞争力?

如果团队拥有:

  • AGENTS.md
  • OpenSpec
  • Project.md
  • MCP
  • GitHub Actions
  • Jenkins
  • Swagger
  • Review Rules

那么这些资产的价值会越来越高。

因为 Agent 并不了解你的业务。

真正指导它工作的,是:

  • 项目规范
  • 开发流程
  • 工程约束
  • 工具能力

未来真正重要的不再是 Prompt,而是:

Workflow。

Prompt 解决的是一句话。

Workflow 解决的是整个项目。


多模型时代,平台能力比模型能力更重要

微软最新战略还有一个非常重要的信息:

企业越来越希望保留 AI 系统的控制权,而不是绑定某一家模型供应商。

这意味着未来的平台应该具备:

  • 可切换模型
  • 多模型协同
  • 模型路由
  • 统一上下文
  • 工具抽象
  • 权限控制
  • 审计日志

例如:

  • 编码任务默认使用 Claude;
  • 长文本分析使用 GPT;
  • 本地敏感数据使用开源模型;
  • 图像生成调用专用模型。

模型只是能力来源,平台负责统一调度。


给开发团队的五点建议

1. 不要把 AI 集成停留在聊天窗口

真正有价值的是:

Agent + Workflow。

让 AI 能完成一个完整任务,而不仅回答一个问题。


2. 建立统一工程规范

包括:

  • AGENTS.md
  • OpenSpec
  • Coding Rules
  • Review Rules

让 Agent 每次执行都有一致的行为约束。


3. 建立 MCP 能力层

不要让 Agent 只能聊天。

应该让它连接:

  • GitHub
  • GitLab
  • Jenkins
  • Swagger
  • Figma
  • Browser
  • 数据库

真正参与研发流程。


4. 建立 Agent 评测体系

不要只比较模型排行榜。

应该评估:

  • 是否遵守项目规范;
  • 是否完成真实需求;
  • 是否通过构建与测试;
  • 是否修改了正确文件;
  • 是否输出可审计结果。

这些指标比 Benchmark 更贴近生产环境。


5. 构建可替换模型的平台

不要把业务逻辑绑定到某一个模型。

建议建立统一的模型网关和调用层,让 Claude、GPT、Gemini、Qwen、开源模型都可以按场景切换。

这样既能降低成本,也能降低供应商锁定风险。


写在最后

过去几年,AI 的竞争主要发生在模型实验室之间。

未来几年,竞争将更多发生在企业内部。

真正拉开差距的,不是:

谁拥有最强模型。

而是:

谁拥有最好的 Agent 平台。

微软最新成立 Frontier Company、Anthropic 推出 Claude Sonnet 5、OpenAI 发布 Codex 工作研究,这些事件都指向同一个方向:

AI 正在从“模型时代”迈向“Agent 平台时代”。

对于开发团队来说,现在最值得投入的,不是继续研究 Prompt,而是尽快建立属于自己的 AI 工程体系:

  • 标准化规范;
  • Agent 工作流;
  • MCP 工具层;
  • 多模型调度;
  • 权限与安全治理;
  • 可观测、可审计的执行过程。

未来的软件工程,不只是人与代码的协作,更是人与 Agent 的协作。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注