三个模型,一套系统
北京时间 7 月 21 日凌晨,OpenAI 召开发布会,发布 GPT 5.6 系列模型。这次不是一个模型,而是三个——Soul、Terra、Luna,分别面向不同场景。
发布会还同步推出了几个新东西:ChatGPT Work(任务入口)、新的 ChatGPT 桌面 App(环境接入)、以及 Hosted Sites(结果交付)。
把这些放在一起看,OpenAI 的思路很清楚:让 ChatGPT 从一个聊天工具,变成能接任务、读文件、调工具、操作桌面、最后交付结果的执行系统。
Soul / Terra / Luna 怎么分工
GPT 5.6 三个模型分工明确:
- Soul:面向复杂 Agent 工作流,处理长上下文推理和多步规划
- Terra:日常任务,对话和轻量分析
- Luna:高频低成本任务,摘要、分类、格式转换
这套分层设计的核心在于调度。Agent 场景下,一个复杂任务可能涉及长文档阅读、多轮工具调用、代码生成、结果校验。如果每步都用最强模型,成本太高响应太慢。如果全程用低成本模型,关键步骤又不稳定。
所以 OpenAI 的方案是分层路由。简单任务交给 Luna 和 Terra,复杂推理和代码生成走 Soul,中间步骤动态切换。用户看到的只是一个 ChatGPT,系统内部在反复做模型选择、上下文分配和工具调度。
ChatGPT Work:从问答到任务
ChatGPT Work 改变了交互方式。用户给的请求不再是一段文本,而是一个任务。系统需要判断需要哪些数据源,先读什么,后处理什么,哪些步骤自动执行,哪些地方需要用户确认。
发布会里展示的例子包括:从 Slack 和员工反馈里找内部用例、安排访谈;读取财务数据做 variance analysis、更新 forecast、生成汇报材料和可分享页面。
这类任务的难点在于编排和状态维护。普通问答只需处理当前输入,Agent 工作流必须跟踪已经用了哪些材料、得出过什么结论、哪些假设还没确认。
桌面 App 接入真实环境
网页端主要靠上传文件和云端连接器。桌面 App 可以直接接触本地文件、浏览器标签页和其他应用。
发布会展示的能力包括:整理 Apple Notes、读取本地文件夹、分析 Chrome 标签页、在表格里做可视化。
但接入环境后问题不会自动变简单。模型不可能把用户电脑里所有文件都塞进上下文。它要先判断哪些内容与任务相关,再把 PDF、Excel、网页、笔记等不同格式转成可处理的表示。这背后涉及文件索引、语义检索、上下文压缩、引用追踪和冲突处理——同一个项目里的 PDF、PPT、Slack 消息和 Excel 内容可能互相矛盾,Agent 需要判断哪些来源更新、更可信。
Hosted Sites:结果直接上线
过去大模型输出大多是文本或代码片段,用户还要搬到其他工具里继续处理。Hosted Sites 把结果直接变成网页、看板、内部工具或交互式原型,适合临时 dashboard、项目汇报这类轻量场景。
交付层需要稳定协议。Agent 调用工具时,输入字段是什么、返回结果怎么表示、失败状态怎么处理、哪些操作只读、哪些有副作用——都需要结构化约定。比如"更新 forecast"这个任务,不能直接让模型改 Excel,而是拆成读取单元格、检查公式、生成 diff、等待确认、写回文件这几步。
Ultra Mode 和多 Agent 并行
当单个模型不够用时,Ultra Mode 把复杂任务拆给多个 Agent 并行处理。一个 Agent 读资料,一个处理表格,一个生成页面,一个做一致性检查,最后整合结果。
最难的是 orchestrator。它要决定任务怎么拆、每个 Agent 拿到什么上下文、冲突结果怎么处理、什么时候停止、怎么避免重复劳动和控制成本。多 Agent 系统没有稳定的调度层,错误链路只会更长。
安全和可信边界
Agent 越靠近真实工作环境,安全问题越具体。过去模型安全关注输出内容,到了 Agent 阶段,风险落在动作上——读了哪些文件、改了什么表格、调了哪些工具、是否发送了消息。
发布会提到 GPT 5.6 的 cyber 能力有明显提升,能发现漏洞也能生成补丁。但这个能力用于防御有价值,放进通用 Agent 产品也要求更严格的权限设计。
OpenAI 设计的四层安全机制:
- 最小权限:任务需要什么就开放什么,不暴露多余文件或连接器
- 操作分级:读取资料、生成草稿、修改文件、发送消息的确认逻辑不同
- 过程审计:记录模型读了什么、改了什么、依据是什么
- 事务化执行:生成计划和 diff 让用户确认后再一次性提交,支持回滚
新的评测基准
发布会提到几个新 benchmark:Terminal Bench(代码执行)、BrowseComp(复杂信息检索)、Agent's Last Exam(长周期专业任务)。它们比传统问答测试更贴近 Agent 场景。
但对真实企业环境来说,更关键的指标是失败率、人工接管率、平均完成时间、工具调用成功率和单位任务成本。
竞品格局
Anthropic 的 Claude Fable 5 最近在 Agent 场景也有不少更新,强调 Code 能力和长上下文。两家在 Agent 化方向上正在正面竞争。GPT 5.6 这次用三档模型分层和 Ultra Mode 多 Agent 调度作为差异化方向,而 Fable 5 侧重代码执行质量。
总结
GPT 5.6 发布会的技术路线很清晰:ChaGPT Work 接任务,桌面 App 接入环境,Hosted Sites 交付结果;Soul/Terra/Luna + Ultra Mode 做模型调度;权限和审计机制控制风险。
这几层连在一起看,OpenAI 不是在发布一个更强的聊天模型,而是在搭建一套 Agent 操作系统。最终价值不取决于发布会的 demo 效果,而取决于真实工作中的稳定性。



