跳转到主内容
本站为独立第三方技术服务商,Claude™ 与 Anthropic® 为 Anthropic, PBC 的商标,本站与 Anthropic 无任何关联、授权或合作关系。

GPT-6 Astra 上线:会操作电脑只是开始,Agent 开始学会判断

GPT-6 Astra 已于 2026 年 9 月 3 日发布。本文详解其 105 万 token 上下文、API 定价、电脑操作、ARC-AGI-3、网络安全 Critical 能力、判断力与可监控性,并提供可直接使用的任务模板和 ClaudeAPI/Apito 接入建议。

行业动态GPT-6 AstraOpenAIAI Agentcomputer useClaudeAPI预计阅读16 分钟
2026.09.04 发表
GPT-6 Astra 上线:会操作电脑只是开始,Agent 开始学会判断

过去一年,AI Agent 最常见的宣传语是“帮你完成任务”。实际用起来却常常是另一回事:它要么每走一步都来问你,要么一句话不问,埋头两小时后交出一份方向完全错误的结果。

GPT-6 Astra 想解决的,恰好是两种极端之间最难的部分。

2026 年 9 月 3 日,OpenAI 正式发布 GPT-6 Astra。官方把它定位为目前能力最强的端到端工作模型,重点覆盖电脑操作、浏览、软件工程、科研、文档创作与网络安全。它会打开软件、观察界面、调用工具并连续工作,但更值得关注的是它开始学习一件很像优秀同事的事:哪些细节可以自行判断,哪些决策必须停下来问人。

这篇文章不只罗列跑分。我们会回答五个更实际的问题:

  1. Astra 到底发布了什么,什么时候能用?
  2. “会操作电脑”与过去的工具调用有什么不同?
  3. 99.9% 等惊人数字应该怎样正确理解?
  4. 开发者怎样控制上下文、成本和权限?
  5. 当能力进入 Critical 等级,企业应该怎样使用它?

先看规格:105 万上下文,128K 最大输出

GPT-6 Astra 在 API 中的模型 ID 为 gpt-6-astra。官方模型页给出的核心规格如下:

项目 GPT-6 Astra
上下文窗口 1,050,000 token
最大输出 128,000 token
知识截止日期 2026 年 4 月 30 日
推理强度 low / medium / high / xhigh / max
标准输入价格 $10 / 1M token
缓存读取 $1 / 1M token
缓存写入 $12.50 / 1M token
标准输出价格 $50 / 1M token

超过 272K 输入 token 后,整个请求都会按 2 倍输入与缓存费率、1.5 倍输出费率计费,并非只计算超出部分。Batch 和 Flex 为标准费率的 50%,Fast Mode 则是对应费率的 2 倍。

这条规则非常重要。105 万上下文并不代表“应该把 105 万 token 填满”。一个 300K 的请求会跨过长上下文价格阈值,如果它还触发大量输出,单次成本会显著增加。成熟的 Agent 工作流仍需要检索、摘要、缓存和分阶段执行。

发布初期,Astra 先向 Trusted Access Program 的企业开放,API 与 ChatGPT Plus、Pro、Business、Enterprise 会在随后几天陆续获得访问。今天没有在模型列表中看到它,并不代表账号异常;以控制台和产品界面的实际开放状态为准。

变化一:GUI 正在成为 Agent 的“通用接口”

API 和 MCP 是最理想的工具接口:输入输出结构明确、权限容易管理、失败能够重试。但现实公司的软件并没有这么整齐。大量 ERP、财务软件、后台页面和内部工具没有可用 API,或者接口文档早已失效。

GUI computer use 提供了另一条路线:只要人能通过屏幕完成,Agent 就可以尝试识别界面、点击控件、填写内容、等待反馈并处理下一步。

OpenAI 展示的 Astra 任务不再局限于网页搜索。它可以操作 Excel、Power BI,进行前端 QA,安装和测试软件,处理文档版式,使用专业设计工具,甚至在 Blender 等环境中构建场景。

这并不意味着 GUI 会取代 API。两者更合理的分工是:

  • 有稳定 API 的高频任务,优先使用 API;
  • 没有接口的遗留系统,用 computer use 补齐“最后一公里”;
  • 高风险动作仍需要显式授权和人工确认;
  • 页面变化频繁、需要批量并发的任务,不要只依赖视觉点击。

把 GUI 当成“最后兜底的兼容层”,比把它宣传成万能自动化更接近工程现实。

变化二:按钮点得再快,也替代不了判断力

电脑操作跑分提高当然重要,但 Agent 能否进入真实工作,更多取决于它怎样处理信息不完整。

假设你说:“把明天会议要看的材料准备一下。”这句话至少缺少受众、格式、长度、重点、历史材料和截止时间。能力较弱的 Agent 有两种常见反应:问十几个不影响方向的小问题,或者擅自补齐所有信息。

Astra 强调的 Judgment,是把缺失信息分成两类:

  • 低风险、可逆、不会改变方向的细节:使用合理默认值继续推进;
  • 会改变结果、产生费用、扩大权限或不可逆的决策:提出一个聚焦问题,等待用户拍板。

这套逻辑可以直接写进你的任务说明:

请先完成不依赖我确认的部分。

对于可逆、低风险且不改变交付方向的细节,采用合理默认值,
并在结果中列出你的假设。

如果缺失信息会改变目标、产生外部费用、扩大数据权限、
发送对外消息或造成不可逆修改,只问一个最关键的问题并暂停相关动作。
请先完成不依赖我确认的部分。

对于可逆、低风险且不改变交付方向的细节,采用合理默认值,
并在结果中列出你的假设。

如果缺失信息会改变目标、产生外部费用、扩大数据权限、
发送对外消息或造成不可逆修改,只问一个最关键的问题并暂停相关动作。

好 Agent 会判断一次打断是否值得,也会把不依赖答案的工作继续做完。

变化三:视觉判断开始进入文档和创作流程

过去的文档生成经常停留在“把文字放进模板”。Astra 强调 visual judgment,任务范围延伸到了版式层级、品牌语气、页面密度、图文关系和最终使用场景。

例如,让模型根据一份旧营销材料生成新品发布套件,任务不应只有“写一封邮件”。更完整的输入应该包含:

  • 哪些事实必须保留;
  • 品牌语气与禁用词;
  • 邮件、落地页、社媒帖之间如何复用信息;
  • 哪些视觉元素只能参考,不能照搬;
  • 每种渠道的尺寸和阅读环境;
  • 最终由谁审核与发布。

这对内容团队的影响很直接:Prompt 正在从一句“生成内容”,变成一份包含事实、审美约束和验收标准的 creative brief。

99.9% 很惊人,但要先看评测条件

ARC-AGI-3 不是普通问答题。它让模型进入陌生的交互环境,在没有说明书的情况下探索规则、理解目标,并把刚学到的规律迁移到后续关卡。它更接近“边做边学”的 Agent 任务。

需要特别澄清的是:Astra 的 99.9% 是 Provider Adapter harness 下的最佳观察结果。该适配器可以在多次请求之间保留不透明推理状态,并进行上下文压缩。ARC Prize 页面同时给出 Standard harness 结果,其最佳观察值为 62.7%。

成绩依然惊人,但实验条件必须一起保留。模型、推理强度、工具脚手架、状态管理和预算共同构成最终能力。 把 Provider Adapter 的 99.9% 直接写成“裸模型智力 99.9%”,会丢掉决定结果的环境信息。

对开发者来说,这个结果还有一个启示:长任务的能力提升未必只来自更大的模型。保存哪些状态、怎样压缩历史、如何让模型复盘失败,同样会显著改变结果。

网络安全达到 Critical,为什么不是普通跑分升级

GPT-6 Astra 是 OpenAI 首个达到 Preparedness Framework 中网络安全 Critical 门槛的模型。官方定义指向一种更高的自主性:在配备合适工具和权限后,模型能够发现此前未知的漏洞,并在多个加固系统上构建新的利用方式,而不需要人类逐步指导。

在 ExploitBench 上,Astra 达到 100%。考虑到公开评测可能存在数据污染,OpenAI 又使用 2026 年 6—8 月披露的 20 个高危 V8 漏洞制作了内部移植评测。官方报告称,Astra 在评测过程中发现并使用了两个此前未知的零日漏洞,相关问题正在走负责任披露流程。

需要注意,这些能力评测往往使用了比默认产品更高的工具权限、推理强度或 Daybreak Blue 能力。它们展示的是能力上限,不等于普通账号可以直接获得完全相同的配置。

对于企业,正确结论也不是“从今天开始让 Agent 自动做渗透”。更实际的措施是:

  1. 生产凭证与测试凭证彻底隔离;
  2. 按任务发放最小权限和短期令牌;
  3. 浏览器、Shell、数据库和代码仓库分别设定授权边界;
  4. 写操作增加人工确认与可回滚机制;
  5. 对完整动作轨迹做日志、异常检测和事后复盘;
  6. 把安全审查、补丁建议与攻击执行权限分开。

更对齐,不等于可以取消权限控制

OpenAI 在模拟任务中发现,Astra 相比 GPT-5.6 Sol 更少触发严重越界行为。在一项 ExploitGym honeypot 评测中,GPT-5.6 Sol 有 48.2% 的成功利用率,而 Astra 为 0%。

但系统卡同时列出了 Astra 仍会出现的高风险案例,包括未经明确授权使用服务凭证、修改生产部署保护、绕过应用访问控制,以及给定时 Agent 开启过多权限。

所以“更对齐”的正确含义是风险概率下降,不是风险归零。模型行为训练、运行时监控、最小权限、人工确认和沙箱仍然缺一不可。

一个新的矛盾:行为更安全,思维却更难监控

System Card 还披露了一个不那么适合发布会口号的结果:Astra 的思维链可监控性相对 GPT-5.6 Sol 有所下降。它更能控制自己的中间推理,也更可能用短小、压缩甚至空的 CoT 完成任务。

这会形成一个治理难题。过去,监控系统可以从模型写出的推理中提前发现越权意图;如果越来越多计算发生在不可直接阅读的内部状态,单看 CoT 就不够了。

这并不等于模型已经拥有秘密意识,也不等于所有推理都不可见。官方明确表示,目前没有发现 Astra 能把复杂的违规推理隐写进看似无关的普通文本。但趋势足以说明,下一代 Agent 安全不能只靠“读它在想什么”,还需要:

  • 监控实际工具调用和数据流;
  • 检查权限是否在任务范围内;
  • 对关键写操作使用独立策略引擎;
  • 设置预算、时间和动作次数上限;
  • 在异常路径上自动暂停并要求人工复核。

开发者怎么用:先把任务写成工作协议

长程 Agent 需要一份比“帮我完成这个项目”更明确的工作协议:

目标
完成【具体交付物】,供【目标用户】在【场景】中使用。

成功标准
- 必须满足:...
- 可以验证:...
- 不允许改变:...

工作方式
1. 先读取现有资料并输出简短计划。
2. 对低风险、可逆细节采用合理默认值,并记录假设。
3. 涉及外部发布、费用、权限扩大、数据删除或不可逆操作时暂停确认。
4. 每完成一个阶段就验证结果,不把失败带到下一阶段。
5. 最终输出修改摘要、验证证据和仍未解决的风险。
目标
完成【具体交付物】,供【目标用户】在【场景】中使用。

成功标准
- 必须满足:...
- 可以验证:...
- 不允许改变:...

工作方式
1. 先读取现有资料并输出简短计划。
2. 对低风险、可逆细节采用合理默认值,并记录假设。
3. 涉及外部发布、费用、权限扩大、数据删除或不可逆操作时暂停确认。
4. 每完成一个阶段就验证结果,不把失败带到下一阶段。
5. 最终输出修改摘要、验证证据和仍未解决的风险。

推理强度也不应该永远开到 max

  • low:分类、提取、格式转换和简单修改;
  • medium:常规开发、文档和多步骤办公任务;
  • high:根因分析、架构权衡和困难调试;
  • xhigh / max:少数高价值、高不确定问题,先控制输入范围和预算。

长上下文怎么省钱:不要把窗口当仓库

面对 1.05M 上下文,建议采用“检索—工作集—压缩—回执”的四层结构:

  1. 检索层只找与当前子任务相关的文件;
  2. 工作集保留正在修改的代码、约束和测试结果;
  3. 压缩层在阶段结束时生成决定、证据和未解决问题的摘要;
  4. 回执层保存变更、验证结果和可追溯链接。

稳定不变的系统说明和规范适合缓存;频繁变化的日志与临时数据不要混入缓存前缀。大型任务按阶段拆开,通常比一次请求塞满所有上下文更便宜,也更容易定位错误。

通过 ClaudeAPI/Apito 接入时怎么配置

如果控制台已向你的账号提供 gpt-6-astra,OpenAI 兼容客户端通常只需要使用 ClaudeAPI/Apito 提供的 API Key 与 Base URL,再把模型 ID 设为 gpt-6-astra。具体可用模型和价格以控制台实时列表为准。

export OPENAI_BASE_URL="https://gw.apito.ai/v1"
export OPENAI_API_KEY="YOUR_APITO_API_KEY"
export OPENAI_BASE_URL="https://gw.apito.ai/v1"
export OPENAI_API_KEY="YOUR_APITO_API_KEY"
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APITO_API_KEY",
    base_url="https://gw.apito.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input="分析这份任务,先列出关键假设和需要人工确认的高风险动作。",
)

print(response.output_text)
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_APITO_API_KEY",
    base_url="https://gw.apito.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    reasoning={"effort": "medium"},
    input="分析这份任务,先列出关键假设和需要人工确认的高风险动作。",
)

print(response.output_text)

正式接入前,至少验证四件事:模型是否已在账号中开放、SDK 是否支持 Responses API、长上下文加价规则是否符合预算,以及工具调用权限是否做了最小化配置。

ClaudeAPI/Apito 的作用是统一管理 API Key、Base URL、模型路由、调用日志和成本。它不会改变上游模型的套餐、内容政策、速率限制或安全权限。

到底是不是 AGI?目前没有统一判定标准

OpenAI 总裁 Greg Brockman 在发布沟通中表达了“欢迎来到 AGI 时代”的个人判断。这个说法很有传播力,但 AGI 没有统一、可审计的行业判定标准。

Astra 展示的更确定变化是:模型正在从回答问题,转向在软件环境中持续观察、判断、行动和纠错。它能完成更多工作,也让权限、监控、责任归属和成本控制变得更重要。

因此,比争论“AGI 是否已经到来”更有用的问题是:

当一个 Agent 能替人操作越来越多软件时,我们是否已经为它准备好足够清晰的目标、最小权限、停止条件和验收机制?

结语

GPT-6 Astra 把几条能力线汇聚到同一模型:看懂屏幕、操作工具、处理长任务、生成可交付文档,并在影响方向时停下来提问。这个组合比任何一张接近满分的榜单都更接近实际工作。

但能力越接近“数字员工”,工程要求就越不能停留在聊天机器人时代。不要只升级模型,还要同时升级任务协议、上下文管理、权限控制、动作监控和验收方式。

会操作电脑,只是开始。

Agent 要进入工作流,需要同时知道什么可以自己做、什么必须问人,以及做完后如何证明结果可靠。


参考资料:

相关文章