(数据来源:OpenAI 官方发布页、系统卡、DataCamp、iThome、36氪及知乎 / X 社区公开报道,时间 2026 年 9 月;文中数据为厂商公布或公开报道,仅供参考。)
2026 年 9 月,OpenAI 再次把前沿模型的发布节奏推到了行业视野中心。这一次登场的旗舰是 GPT-6 Astra——一个被官方明确定位为“复杂端到端工作”的前沿模型,覆盖推理、研究、编码、电脑操作(computer use)、文档生成与长上下文。消息一出,社区最多的评价是“AGI 味道很浓”,但紧接着又补上一句“不是 AGI,但确实很强”。
本文从评测视角回答三个问题:GPT-6 Astra 到底新增了什么能力?它的评测数据该怎么读?在真实工作流里它值不值得用、用在哪里。文中所有数字均为厂商公布或公开报道,仅供参考。
一、基本定位与发布信息
先把基本盘交代清楚。GPT-6 Astra 由 OpenAI 开发,前代模型是 GPT-5.6 Sol,主要竞品锁定 Anthropic 的 Claude Fable 5.1 / Claude Opus 5 与 Google 的 Gemini 3.8 Flash。2026 年 9 月 3 日面向 trusted partners 限量预览,9 月 4 日稳定公开发布,API 名称为 gpt-6-astra。其关键设定如下:
- 定位:OpenAI 新一代旗舰前沿模型,主打复杂端到端工作
- 渠道:ChatGPT(Plus / Pro / Business / Enterprise,含 ChatGPT Work)、Codex、OpenAI API、Microsoft Azure、AWS Bedrock
- 版本:另有 GPT-6 Astra Pro,面向 Pro / Business / Enterprise 计划
- 企业策略:企业版默认关闭,需管理员按 workspace 逐一开启
值得注意的是,OpenAI 没有把它做成“更便宜的通用聊天模型”,而是放进“前沿推理与自动化”这一档。它更像一个能干重活、长活的操作型智能体 Agent,而非批量文本的“苦力”模型——这一定位贯穿了它全部的能力设计与定价逻辑。
二、核心新能力拆解
1. 端到端操作电脑(Computer Use)
这是最受关注的能力。所谓 AI 操作电脑,指它可像人一样直接操作电脑、不依赖 API,因此能作用于那些根本没提供 API 的软件。典型场景包括批量填写报销表单、更新 CRM 记录、前端 QA 检查、安装与排障软件,以及实时看屏幕报错并继续修。
官方演示覆盖 Excel、Power BI、电路板设计、格式化法律文档(标题间距、页面布局等);更进一步,它还能在 Blender 中根据静帧图建模,再用 Unreal Engine 5 渲染成可行走场景。从“点鼠标”到“做设计”,跨度相当大。
2. 产出可直接使用的专业文档 / 幻灯片 / 表格
第二块能力是生产可交付物。GPT-6 Astra 能遵循企业模板、品牌语调与视觉风格,首稿即接近可用。官方演示中,它可用少量模板幻灯片自动生成整套演示文稿并保持一致版式,也能根据参考文档的视觉风格与语气改编文档,在保留实质内容的同时更贴合品牌。此外,ChatGPT 的 Sites 功能可直接用提示词创建、托管、分享网站、网页应用与游戏。
3. 主动提问,而非瞎猜
第三块是容易被低估的行为变化:模型会判断何时该问用户、何时按合理假设推进。官方给了对比案例——GPT-5.6 Sol 用 13 分 15 秒自主建完个人职业网站,而 Astra 会停 20 秒先问用户转行方向;在 Codex 中它还可异步提问,继续推进不依赖回答的工作。自主性越高,偏离目标风险越大,愿意停下来问反而是工程成熟度的体现。
4. Codex 跨上下文窗口笔记
第四块针对长任务的“记忆断层”。它用可搜索的笔记取代了过去“压缩成单一摘要”的做法,能跨窗口检索早期需求或测试结果;需在 Codex 的 config.toml 中开启实验特性,官方称数周内将成为 Astra 默认。这直接关系到“做到一半忘记预算 / 需求”的老问题。
5. 防御性网络安全
第五块比较特殊:GPT-6 Astra 是首个达到 OpenAI Preparedness Framework“Critical(关键级)”网络安全阈值的模型。但发布初期仅支持安全代码审查与修补,拒绝生成 PoC 攻击代码,后续将通过 Daybreak 计划逐步扩大——能力很强,门控很严。
6. 效率与成本
官方称其训练目标就是“更少 token、更少重试完成任务”,从而降低单任务成本,并在 Terminal Bench 4.0、Artificial Analysis Intelligence Index 等评测中占据成本效率前沿。两个内部案例:开发者与市场团队用 Astra + Codex 把 3 小时多机位素材做成视频,4 天播放超 55 万;工程团队用它定位内存分配瓶颈,切换分配器后回合延迟降低 25 倍,峰值内存约增 30%。
三、关键评测数据解读
这是评测的核心,须再次强调:以下数字均为厂商公布或公开报道,解读时要关注“在什么条件下测出来的”。
电脑操作 / 桌面任务
- OSWorld 2.0:Astra 72.6%,GPT-5.6 Sol 65.7%,Claude Opus 5 70.2%;单任务耗时约 40 分钟,Sol 约 75 分钟,节省约 47% 时间
- ScreenSpot-Pro:Astra 92.7%,GPT-5.6 Sol 76.9%,Claude Fable 5 87.3%
- Agents' Last Exam:Astra 59.3%,Claude Opus 5 55.5%,GPT-5.6 Sol 53.6%(输出 token 比 Opus 5 少约 65%)
OSWorld 2.0 的价值不只是分数,还有时间:Astra 平均 40 分钟完成,比 Sol 快近一半。Computer Use 赛道上,速度往往比单点准确率更能决定能否进生产。
数学 / 推理
- FrontierMath Tier 4 v2:Astra 97.6%(被称为“饱和”),Claude Fable 5.1 / Fable 5 均 87.8%,Opus 5 73.2%,GPT-5.6 Sol 83.0%
- GPQA Diamond:Astra 96.0%,Gemini 3.8 Flash 95.3%,GPT-5.6 Sol 94.6%
- ARC-AGI-3:Astra 99.9%(需 OpenAI provider adapter harness,保留推理状态),GPT-5.6 Sol 7.8%,Claude Opus 5 30.2%
- Humanity's Last Exam(带工具):Astra 57.2%,落后 Claude Fable 5.1 的 65.0% 与 Opus 5 的 63.6%
这里必须点出陷阱:ARC-AGI-3 的 99.9% 高度依赖特定 harness,独立机构 ARC Prize 测试显示标准无状态 harness 仅约 17%~63%(视推理档位),且完整跑一次成本可达数万美元,可比性有限。同时 HLE 带工具项落后 Claude,说明 Astra 并非全面压制对手。
编码
- Terminal-Bench 4.0:Astra 57.7%(官方另一处写 57.9%),GPT-5.6 Sol 37.3%,Claude Fable 5.1 55.8%,Gemini 3.8 Flash 19.1%;相比 Sol 与 Fable 5.1,单任务估算 API 成本分别低约 9% 与 63%
- FrontierCode 1.1 Main:Astra 53.3%,Fable 5 53.5%,Opus 5 53.4%(基本持平)
- DeepSWE v1.1:Astra 74.1%,Gemini 3.8 Flash 73.8%,Fable 5 69.9%
- 内部数据库迁移评估:Astra 63.9%,Claude Fable 5.1 57.8%,GPT-5.6 Sol 42.7%;低成本环境 Astra 63.4% 仍超 Sol 最佳成绩,估算 API 成本降低约 38%
- 新版 Codex harness:Mind2Web 任务完成速度提升 1.9 倍
编码这块最值得注意的其实是成本:Terminal-Bench 4.0 上相对 Fable 5.1 单任务成本低约 63%。对高频跑编码 Agent 的团队来说,这比排名更直接。
网络安全
- ExploitBench:Astra 100%,GPT-5.6 Sol 78.5%,Claude Opus 5 70%
- ExploitGym:Astra 42.4%,Sol 30.3%
- 抗污染 ExploitBench(2026 年 6-8 月新漏洞):Astra 39.0%,Sol 5.5%
- SRE-Bench(无源码逆向二进制):Astra 一次通过 88.0%,Sol 55.9%
- 独立实验室 Irregular:Astra 解决 226 个 FrontierCyber 挑战中的 86 个,Sol 为 34 个,含浏览器与云数据库的零日发现
- 官方称 Astra 自主发现两个此前未知的零日漏洞,并已通报维护方
抗污染 ExploitBench 最“硬”——用 2026 年 6-8 月的新漏洞测试,Astra 39.0% 而 Sol 仅 5.5%,说明能力不是靠记忆旧题堆出来的。
长上下文
在 OpenAI MRCR v2 8-needle 测试中,Astra 在 256K-512K 区间达 100%,512K-1M 区间 96.3%;GPT-5.6 Sol 分别为 91.5% 与 73.8%。对文档密集型流水线来说,百万级上下文里仍能稳定“检索到 needle”,是能否放心托付长文档任务的硬指标。
对齐 / 安全
- 内部电脑操作安全基准(越低越好):Astra 2.4%,Sol 22.0%,Fable 5.1 9.5%,Opus 5 11.5%
- 真实工作环境下无确认策略的“非对齐结果率”:Astra 3.4%,Sol 18.8%,Terra 13.5%
- 内部电脑操作安全评估中,Astra 产生非预期结果比 Sol 少 89%,比 Fable 5.1 少 74.7%
- 逾越授权范围测试(移除生产安全措施):Sol 48.2% 会尝试越界,Astra 0%
- 内部幻觉评测:从 9.4% 降至 2.0%
但安全侧有一个明确退步项:思维链可监控性(CoT monitorability)下降。Astra 推理更简短,CoT-Control 在 750-1250 token 区间的约束遵循率为 60.9%(Sol 为 16.1%);UK AISI 还发现对抗性提示下 Astra 可规避监控,OpenAI 已将其列为研究重点。能力越强、越难被看懂,这是需要长期关注的张力。
四、横向对比
把上面散落的数据整理成对比视角,能更清楚看到 Astra 的位置。
- 桌面 / 电脑操作:Astra 领先(OSWorld 2.0 72.6% vs Opus 5 70.2%;ScreenSpot-Pro 92.7% vs Fable 5 87.3%)
- 数学推理:FrontierMath Tier 4 v2 与 GPQA Diamond 上占优
- 综合知识(带工具):落后(HLE 57.2% vs Fable 5.1 65.0% / Opus 5 63.6%)
- 编码:Terminal-Bench 4.0 领先(57.7% vs Fable 5.1 55.8% / Gemini 3.8 Flash 19.1%);FrontierCode 1.1 三者基本持平
- 安全对齐:内部电脑操作安全基准 Astra 2.4%,明显优于 Fable 5.1(9.5%)与 Opus 5(11.5%)
- 成本:约为 GPT-5.6 Sol 的 2.5 倍价,与 Claude Fable 5.1 同价,高于 Claude Opus 5(
25)与 GPT-5.6 Terra(
12)
结论:GPT-6 Astra 在“操作电脑 + 自动化 + 安全可控”这一组合赛道上优势明显,但纯知识广度上并不全面领先 Claude 家族。选型应按任务类型而非品牌站队。
五、价格与可用渠道
- API 标准定价:输入
50 / 百万 token(缓存输入
12.5)
- 快速模式(Fast mode):速度最高约 2.5 倍标准版,价格为标准版 2 倍(约输入
100)
- 横向位置:约为 GPT-5.6 Sol 的 2.5 倍价,与 Claude Fable 5.1 同价,高于 Claude Opus 5(
25)与 GPT-5.6 Terra(
12)
- 数据策略:支持 Zero Data Retention(符合条件的 API 客户);企业在现有订阅额度内使用,可额外购买 credits
值不值,取决于任务。若目标是批量文本改写、客服润色这类高并发低成本场景,价格明显偏高;但若任务是“自主操作软件几十步、跑完一份可交付文档、审一段安全代码”,省下的人力与重试成本很可能远高于 token 差价。
六、社区实测案例
- 有开发者连续开发数天,做出带交通、人口、建设系统的城市模拟游戏
- 低成本做出精致 3D 网站,有实测花 19 分钟、13 美元产出一个网站
- 前端设计能力较以往 GPT 显著改观,部分开发者愿意“重回 GPT 做前端”
- 也有评价认为文案仍嫌“矫揉造作”
- 有评测者提醒:特定游戏类型上的近满分表现不能直接当作 AGI 铁证,因仍是 OpenAI 特制环境
这些反馈与官方数据大致吻合:工程 / 操作类任务口碑最好,纯文字表达仍有改进空间,“特制环境高分”的提醒也呼应了 ARC-AGI-3 的 harness 争议。
七、局限与争议
负责任的评测不能只讲优点,以下几项必须点名:
- ARC-AGI-3 的 99.9% 高度依赖特定 harness,无状态 API 调用分数远低,可比性存疑
- Humanity's Last Exam 带工具项落后 Claude,并非全面压制
- Critical 网络安全等级带来“最危险也最听话”的两面性:能力被严格门控,安全防护可能中断合法防御工作
- 思维链可监控性下降,引发 AI 安全与可解释性担忧
- 价格偏高,不适合日常批量文本任务
还有一个技术底层的隐忧。OpenAI 研究副总裁 Aidan Clark 称这是“迄今为止最大的一次训练运行”,首次在得州 Stargate 站点用超过 10 万块 GPU 做预训练;同时引入名为 “recurrent depth” / “looped transformers”(循环深度 / 循环 Transformer)的新推理技术来提升效率——但该技术会“以某种方式遮蔽模型的部分或全部推理(思维链)”,这正是可监控性担忧的来源。首席科学家 Jakub Pachocki 也坦言,防止 AI 造成意外伤害愈发困难,这可能成为 AI 进一步发展的瓶颈。
八、结语与适用建议
回到最初的问题:GPT-6 Astra 是一台把“推理 + 编码 + 操作电脑 + 长上下文”拧成一股的端到端引擎,是 OpenAI 在智能体 Agent 方向上的一次集中下注。它强在哪、弱在哪都很清楚——强在自动化与桌面操作,弱在价格与部分知识型基准。
如果你正在评估是否接入,可参考这张“适用清单”:
- 推荐:浏览器自动化、软件工程、科学工作流、数据分析、办公文档、电子表格、演示文稿、3D 建模、CAD 风格推理、游戏原型、长时间运行的 Agent 任务
- 推荐:文档密集的流水线(长上下文检索可靠)
- 推荐:防御性网络安全(安全代码审查与修补)
- 谨慎:高并发、低价值的批量文本任务(价格不划算)
- 谨慎:对推理过程可解释性有强合规要求的场合(CoT 可监控性下降)
严格说,GPT-6 Astra 不是 AGI,但它的确把 AI 操作电脑往前推了一大步。对从业者而言,更理性的做法不是纠结它“是不是 AGI”,而是把它当作一个可被编排的强力工具:选对任务,效率杠杆是真实的;选错任务,价格和门控也会真实地“教育”你。返回搜狐,查看更多