
OpenAI发布GPT-5.6与Work代理,AI竞赛转向自主办公
新模型家族与工作代理的推出,标志着行业从对话式AI向可自主完成多步骤任务的智能体迁移,成本效率与监管博弈同步升温。
OpenAI于7月9日正式向公众推出GPT-5.6模型家族,包含旗舰模型Sol、均衡型Terra与低成本Luna,并同步发布工作代理ChatGPT Work。该代理可跨Gmail、Slack、Google Drive等应用自主完成文档、表格、演示文稿乃至交互式网站的生成,标志着AI产品从问答工具向可执行长周期工作流的数字同事转变。此前,该模型因美国政府以网络安全为由要求限制分发,仅向政府审查通过的合作伙伴开放,经过数周受限预览后才获准全面上线。
此次发布的直接竞争焦点在于自主编程与办公任务基准。OpenAI称Sol在Artificial Analysis编程代理指数上以80分领先Anthropic的Fable 5约2.8分,且在Agents' Last Exam(覆盖55个专业领域的长周期工作流测试)中取得53.6分,较Fable 5高出13.1分。但Anthropic在SWE-Bench Pro真实软件工程任务上仍以80.3%对64.6%保持显著优势。业界观察人士指出,两类测试分别衡量终端自动化操作与全代码库精准修复能力,因此双方各擅胜场。
成本效率成为本轮发布的核心叙事。Sol的定价为每百万输入token 5美元、输出30美元,Terra与Luna依次递减。OpenAI首席执行官Sam Altman在太阳谷会议上表示,Sol在代理编程任务上的token效率提升54%,企业客户对AI支出回报率的关注度显著上升。这一趋势在亚洲市场同样显现:尽管GPT-5.6定价仍高于智谱GLM-5.2和DeepSeek V4等中国模型,部分中国用户仍通过VPN访问并认可其效率。Meta同期发布的编程模型Muse Spark 1.1亦首次收费,其CEO扎克伯格批评其他AI实验室定价“极端”,显示硅谷内部对商业模式的路径分歧。
监管阴影贯穿此次发布。美国商务部此前援引出口管制法规迫使Anthropic暂停Fable 5与Mythos 5全球访问19天,并对OpenAI施加类似压力。微软总裁Brad Smith在日内瓦AI for Good峰会上警告,政府正以不透明的出口管制工具进行实质监管,缺乏明确规则,损害国际社会对美国AI基础设施的信任。随着ChatGPT Work率先向Pro、Enterprise及Edu用户开放,并计划数日内扩展至Plus与Business用户,下一阶段观察重点将是企业实际部署中的安全审查与多模型混合使用策略的演变。
| 大西洋/英语圈媒体 | −0.40 | critical |
|---|---|---|
| 印度及南亚媒体 | +0.50 | aligned |
| 俄罗斯及独联体媒体 | 0.00 | neutral |
大西洋集团谴责华盛顿对人工智能的控制,这种控制非但没有保护,反而助长了中国的竞争。
通过将美国的限制描述为适得其反,它构建了一种‘回旋镖效应’的叙事,将开放模型视为不可避免的替代方案。
它没有提到限制仅适用于高级模型,而且OpenAI仍然获得了发布的批准。
南亚印度庆祝政府审查的成功,认为它使GPT-5.6更加安全,展示了监管过程的成熟。
通过强调审查期间所做的‘许多改变’,它将潜在的障碍转化为质量保证,使产品合法化。
它没有提及模型识别代码漏洞的能力问题,而其他集团提到了这些担忧。
俄罗斯将新模型描述为技术事实,与竞争对手进行比较,并强调规格,没有政治判断。
通过使用纯粹描述性和比较性的语言,它避免了对地缘政治或安全影响的任何评论,使发布正常化。
它没有提及美国政府在此次审查中的作用,也没有提及关于开放模型的争议。