六个案例:它们怎样把能力边界,变成了行业方法论
ChatGPT / OpenAI
“如何使用大模型?”一个持续对话框把提示、上下文、追问、纠错合并为单一交互;公开研究预览获得大规模反馈。发布说明显示其训练使用了监督微调、偏好排序与 RLHF。
o1 / OpenAI
“模型需要立即回答吗?”把更多训练期强化学习和更多推理期计算,变成面向难题的可见产品档位。OpenAI 报告指出,两类计算增加都会提升 o1 的推理表现。
MCP / Anthropic,后续多方共建
“每个 AI 应用都要重写一次连接器吗?”用统一 client/server 协议解耦模型客户端与外部工具、数据和工作流;一次构建,可被多客户端使用。
Claude Code / Anthropic
“代码助手只能补全,还是能负责任务?”将模型直接放进开发者熟悉的终端、仓库和测试循环;初期即定位为可委派大量工程任务的研究预览。
Agent Skills / Anthropic,逐步跨平台化
“怎样让通用 Agent 学会组织的流程?”把指令、脚本与资源装进可发现、按需载入的文件夹;知识从一次 prompt 变成可审计资产。
ChatGPT Agent / Atlas、Claude 与生态
“AI 能否从建议走向执行?”推理模型开始在工具调用、浏览器与虚拟环境里运行闭环;重点不只是会点按钮,而是观察、验证、授权、暂停与交接。
这六个案例共同揭示了一件事:领先者不是“无视边界、许诺万能”,而是比别人更早识别一条能力边界刚刚移动后,哪类工作第一次变得值得产品化。OpenAI 的计算机使用工具把视觉和动作收进受控环境,Claude Code 则公开工具白名单、权限模式和最大回合数等控制面——它们都在把“聪明”变成“可运营”,而不是停在演示。
从 Chatbot 到 Agent:技术上到底多了什么?
1. Chatbot:把“提示工程”藏进自然交互
ChatGPT 的突破并不等于第一个聊天机器人。真正的产品创新是把多轮上下文、追问、承认错误和拒绝不当请求,收敛为人人都会使用的对话界面。人类不需要学习 API 参数,只需像和同事沟通一样补充信息。
它成为范式的原因:接口比模型名更先进入大众心智。此后几乎每个 AI 产品都默认拥有“可追问、会记住上下文”的对话入口。
2. Reasoning model:把计算预算留给难题
普通生成模型偏向一次前向生成:快,但在多步数学、代码调试、规划问题上容易早早选错分支。Reasoning model 的思路是给模型更多内部搜索与校验的机会:在训练期用强化学习学习有效推理策略,在推理期按任务难度增加计算预算。
可以用一个不严格但有用的直觉表示:
质量 ≈ 基础模型能力 × 训练期推理策略 × 推理期搜索/校验预算
这不是让模型“像人一样有意识地思考”,也不意味着把内部思维过程完整展示给用户。它是工程上的资源调度:简单问题快答,关键问题愿意付出更多延迟与算力来减少错误。o1 的研究报告明确展示了性能随训练期和测试期计算扩展的趋势。
它成为范式的原因:行业从“更大的预训练模型”转向“在正确问题上多花计算”的产品设计。这改变了评测、定价和用户预期。
3. Claude Code:把模型置入工程反馈回路
一段代码补全和“修好一个 bug”之间,隔着读取仓库、理解约束、搜索依赖、修改文件、运行测试、看失败日志、再修复的循环。Claude Code 的重要性在于把这个循环放进开发者已信任的终端与 Git 工作流,而非另造一个孤立聊天框。
一个健康的 Coding Agent 流程应当是:
- 先读取相关代码与约束,写出最小假设;
- 修改最小范围的文件,而不是“感觉上顺手重构”;
- 运行与改动相称的测试或构建;
- 读取失败输出,形成下一轮证据,而非盲目再试;
- 报告改了什么、验证了什么、还没验证什么。
这也是为什么终端 Agent 往往同时提供 allowedTools、权限模式、回合上限等机制:能力越接近生产环境,最小权限与可中断性越不是附属功能。Claude Code CLI 文档可看到这些控制面。
4. MCP:把“连接外部世界”变成协议问题
没有 MCP 时,N 个 Agent 客户端接 M 个 SaaS、数据库或本地工具,大致需要 N×M 套对接。协议把它改写为两个清晰角色:客户端负责会话、授权和模型编排;服务器负责暴露受控的工具、资源或提示模板。
Agent Host
└─ MCP Client ── 标准消息与能力发现 ── MCP Server
├─ tools:可调用动作
├─ resources:可读取上下文
└─ prompts:可复用任务模板
关键不在于“模型能调用 API”——函数调用早已存在;关键在于能力发现和可移植性。一个 PostgreSQL、GitHub 或设计工具的连接器不必为每个聊天产品重写。
它成为标准的原因:它让生态的边际成本降低。客户端越多,服务端越愿意实现;服务端越多,客户端越有价值。这是协议的网络效应,而不是单一模型的护城河。
5. Skills:把“秘诀”升级为程序知识
Prompt 很适合一次性的灵感;它不适合承载复杂、可维护、需要执行脚本的组织流程。Skill 的目录结构很朴素:一个含名称和描述的 SKILL.md,外加按需引用的说明、脚本、模板或样例。
pdf-review/ ├── SKILL.md # 何时用、总规则、入口 ├── references/ # 罕见情形才读取的细则 ├── scripts/ # 确定性操作:提取、校验、转换 └── examples/ # 输入输出与质量标准
它的核心技术思想叫渐进披露(progressive disclosure):启动时只给 Agent 每个 Skill 的名称与描述;任务相关时再读取主说明;只有实际需要时才打开细则或执行脚本。好处是上下文不被几百页手册淹没,且确定性任务交给代码,而不是让模型“用 token 模拟排序程序”。
这也是未来组织知识的一个合理形态:不是把所有 SOP 塞进长提示词,而是把规则、工具和验收标准做成可版本化、可审计、可测试的能力包。
为什么它们总能在事前选对范式?
1. 它们先判断“能力边界刚刚跨过了哪里”
真正重要的不是模型能否做一次惊艳展示,而是它在成本、成功率、延迟与可控性上,是否第一次跨过某个工作流的可用阈值。ChatGPT 选中的是“用自然语言持续表达意图”;o1 选中的是“某些难题值得更多推理计算”;Claude Code 选中的是“模型已经能够进入读代码—改代码—跑测试的反馈回路”。
这是一种对本质的判断:模型本质上是一个在不确定性中生成、搜索与选择的系统,不是全知全能的员工。因此正确的方向不是把它强塞进所有岗位,而是找那些错误可以被观察、结果可以被验证、上下文可以获得、人工可以接管的任务。
2. 它们不是押技术名词,而是押“能完成一件事”的最小闭环
用户不会购买“RL 后训练”或“JSON-RPC 协议”;他们购买“能连续问下去”“难题愿意多想”“把这个 bug 修好”“让我连上公司的知识库”。每一次范式提出,背后都有一个可感知的任务闭环:聊天的闭环是回复是否有帮助,代码的闭环是测试是否通过,Agent 的闭环是业务任务是否真实完成且没有越权。
事后我们说“当然有用”,是因为这些闭环确实存在;事前的难处在于,必须在技术还不成熟、体验仍然粗糙时判断:这个闭环会不会随着模型进步而越来越短、越来越便宜、越来越可靠。
3. 它们把边界当作产品设计输入,而不是营销里的瑕疵
安全、权限、审计、人工接管不是在能力完成后补上的“刹车”。它们决定了一个能力能否进入真实世界。工具白名单、浏览器接管、敏感站点监督、最小权限、可重放的调用日志,会增加一些摩擦,却使组织敢把真实数据、资金和生产流程交进去。
这正是强者与噱头的分界线:噱头追问“它能不能做到”;产品团队追问“它会在什么条件下稳定做到,失败时会怎样,谁能接手”。
4. 它们适时把私有洞察翻译成公共方法论
看懂能力边界只解决“自己应该做什么”;要成为标准,还要让别人能跟着做。MCP、SDK、API、评测、样例、Skill 目录结构,都是把内部经验外化为公共语言的装置。它们降低了朋友加入生态的成本,也让第三方能在同一套接口、术语和质量标准上投资。
这里的远见不是封闭地占有一项能力,而是在合适的时点让它开放到足以形成网络效应。
5. 它们长期运营到采用鸿沟另一侧
一项范式首次发布时,通常有失败、延迟、成本高、工具少、用户不会用等问题。发布不是胜利,持续收集真实反馈、补评测、做教程、维护 SDK、吸引服务端、修安全模型、把失败说清楚,才是从“好点子”到“行业默认项”的漫长运营。这点对于国内互联网公司来说,太难了。
所以,所谓一方霸主并不是一次发布会赢来的。它来自多年持续下注:当别人还在争论概念时,他们已在经营开发者、用户、合作伙伴与治理者共同使用的语言。
给团队的行动清单:别复制名词,训练事前判断
如果你正在做 AI 产品、开发平台或企业 Agent,最值得带走的不是“也做一个 MCP”或“也写一个 Skill”,而是下面这份检查表:
- 先画出能力边界。列出:它看得到什么、做得到什么、错在哪里、什么结果可验证、何时必须交还给人。
- 从一个高价值闭环切入。明确输入、允许动作、成功条件和失败代价;不要从“万能助理”开始。
- 把可验证性写进产品。每次工具调用要有输入、输出、耗时、权限和结果;业务成功不能只靠模型自我宣称。
- 公开边界。不要宣传“替你完成一切”;明确它不能做什么、何时暂停、数据去哪儿、如何撤销。这会减少短期幻觉,增加长期信任。
- 经营范式,而不只发布功能。持续写样例、教程、工具链、兼容策略与迁移路径;让早期相信你的人能够更容易地拉来下一个人。
远见,是看见边界移动后的真实世界;坚持,是带人走到那里
真正能被行业接受的创新,同时给三类人一个更好的答案:给用户一个立即可感知的收益,给开发者一个可复用的接口,给组织一个可管理的风险边界。
ChatGPT 教会世界用对话来使用模型;Reasoning model 教会世界把计算留给难题;Claude Code 让 Agent 进入工程反馈回路;MCP 让工具连接有机会摆脱私有孤岛;Skills 把经验变成可加载的资产;浏览器 Agent 则把这些能力推到真实数字世界的最后一公里。
这不是“谁的模型更强”这么简单,也不是某一家包办的技术圣杯。OpenAI 与 Anthropic 的领先之处在于:它们能把对能力本质的理解,转化为对真实任务的判断;把对边界的敬畏,转化为可托付的产品;再用开放方法论和长期运营,让其他人愿意在其上继续建设。
这才是范式反复成为标准的原因:先看见真实能做成的事,再让越来越多的人也能把它做成。
