跳转到主内容
本站为独立第三方技术服务商,Claude™ 与 Anthropic® 为 Anthropic, PBC 的商标,本站与 Anthropic 无任何关联、授权或合作关系。

OpenAI DevDay 2026:Dots、Space、GPT-6.1 Sol 发布,开发者该怎么用

OpenAI DevDay 2026 的 Dots、ChatGPT Space、GPT-6.1 Sol 怎么用?通过一条产品上线流程,拆解权限配置、页面协作、API 计费与模型验收。

行业动态OpenAI DevDayDotsChatGPT SpaceGPT-6.1 SolAI Agent模型选型预计阅读10 分钟
2026.09.30 发表
OpenAI DevDay 2026 橙色科技工作台呈现 Dots、Space 与 GPT-6.1 Sol 的开发工作流

假设团队周五要上线新版本。周三早上,测试群里多了 18 条反馈,设计稿刚改,负责人还要判断哪些问题挡上线。以前要有人翻群聊、查工单、更新文档,再催工程师确认。OpenAI 这次发布的 Dots、ChatGPT Space 和 GPT-6.1 Sol,试图把这些环节串起来:智能体盯进度,页面留住共同上下文,模型完成适合它的分析任务。

9 月 30 日的两篇现场报道列出了不少新品;另一篇还记录了演示卡顿。我的判断是,开发团队先不用急着复制整套演示。挑一条真实、可回滚的流程,测试四个问题:**任务能否持续推进,资料是否可追溯,权限会不会越界,算上返工后是否真的省钱。**下文按官方文档核对能力与价格,再给出具体试法。

层次 对应产品 它解决的问题 首次试用要核实什么
持续执行 Dots 把长期职责交给有独立工作环境的智能体 访问权限、触发条件、人工审批、任务日志
共享上下文 ChatGPT Space 让人和智能体在同一页面协作 文件权限、引用来源、页面可见范围
任务推理 GPT-6.1 Sol 以更低单价处理适合它的日常任务 完成率、返工量、延迟与实际账单
开发底座 Agents API 管理会话、沙箱、工具与执行恢复 地区、数据保留、工具费用、错误恢复

这张表是分析框架,并非 OpenAI 提供的一键套餐。还有一个容易弄混的点:Dots 官方说明写明它由 GPT-6 Astra 驱动;GPT-6.1 Sol是可单独调用的模型。不能因为它们同场发布,就把 Dot 的后台成本按 Sol 的 API 单价估算。

Dots:先给它一个职责,再给它最小权限

普通聊天的基本单位是一轮提问。Dot 的基本单位更像一份长期职责:追踪一个目标,定期整理进展,在需要判断或权限时联系负责人。OpenAI 的入门文档说明,每个 Dot 都有独立的云端电脑和浏览器;应用连接、电脑访问以及联系用户的渠道需要分别配置。它还能把具体工作委托给 Codex 或 ChatGPT Work。

发布会画面中的 Dots 产品演示,强调持续处理任务和与用户协作

发布会画面:Dots 的关键不是“能聊天”,而是能否在明确权限内持续处理职责。

从只读任务开始,观察它怎么处理例外

如果账户已有 Dots 入口,官方入门步骤是在桌面端创建 Dot,再逐项连接应用、电脑与联系渠道。这三种连接互不自动继承。连接个人电脑后,Dot 需要电脑保持在线且 ChatGPT 桌面应用打开,才能访问本地环境;纯云端任务则使用它自己的电脑与浏览器。试点第一周可以先跳过本地电脑,只给一个低敏感度工单库的只读权限。

把任务写成一张职责卡,而不是一句“帮我盯上线”。下面这段可以按自己的项目改写后交给 Dot:

职责:跟进「移动端 2.8 上线」的阻断问题,试运行 7 天。
数据源:仅使用指定的测试工单库和 #release-test 频道。
时间:工作日 09:30(Asia/Shanghai)汇总前一日新增问题;
      新增 P0 工单时及时通知。请复述你实际设置成功的触发条件。
输出:问题 ID、用户影响、复现证据、负责人、建议动作、原始链接。
权限:可以读取、归类和起草修复建议;不能合并代码、发送外部消息、
      改生产配置或关闭工单。这些动作一律先请求负责人批准。
例外:无法复现、资料含客户隐私、来源互相矛盾时,标记「待人工判断」。
停止条件:7 天后暂停定时任务,由负责人复盘后决定是否续用。
职责:跟进「移动端 2.8 上线」的阻断问题,试运行 7 天。
数据源:仅使用指定的测试工单库和 #release-test 频道。
时间:工作日 09:30(Asia/Shanghai)汇总前一日新增问题;
      新增 P0 工单时及时通知。请复述你实际设置成功的触发条件。
输出:问题 ID、用户影响、复现证据、负责人、建议动作、原始链接。
权限:可以读取、归类和起草修复建议;不能合并代码、发送外部消息、
      改生产配置或关闭工单。这些动作一律先请求负责人批准。
例外:无法复现、资料含客户隐私、来源互相矛盾时,标记「待人工判断」。
停止条件:7 天后暂停定时任务,由负责人复盘后决定是否续用。

测试时故意放入一条信息不完整的工单、一条重复工单和一条带敏感信息的工单。看它能否给出原始链接、是否在不确定时停下来,以及通知会不会刷屏。然后到 Dot 的 Activity 页面核对它实际委托了哪些工作、哪些操作等待批准。官方文档特别说明,结束聊天或语音并不一定会停止已分配的持续任务;试用结束要主动取消触发器。Dots 入门。

把权限与费用记在同一张表里

试点记录至少有四列:数据源、允许动作、需审批动作、执行费用。Dot 自身的套餐权益、它委托给 Codex 或 ChatGPT Work 的工作,以及外部工具调用,可能按不同规则计额度。采购时看账号内实际可见的使用页;不要把“Dot 可以跑一整夜”理解成没有成本上限。能连接应用,只说明技术上可接入,不说明应该给写权限。

Space:让协作有一张可审阅的“当前版本”

如果 Dot 负责推进,Space 更适合承载团队共同查看和修改的结果。OpenAI 的Space 文档把页面作为核心:文字、文件、研究材料、评论和生成结果可以放在一处,成员可以讨论,智能体也可以参与更新。对于多人项目,它最大的价值不在“又一个文档编辑器”,而在减少聊天、附件和临时总结之间的版本漂移。

发布会画面中的 ChatGPT Space 页面与协作演示

发布会画面:团队页面把资料、讨论和智能体产出放在可审阅的位置。

一张页面足够测试协作,别急着迁移整个知识库

官方入门文档给出的基本动作很简单:在 Space 创建新页面,放入现有笔记或文件,要求 ChatGPT 整理,然后检查结果并设置查看/编辑权限。我们的上线试点可以从一页「移动端 2.8 发布决策」开始,先不要把所有群聊和网盘目录扔进去。

页面:移动端 2.8 发布决策
目标:周五 17:00 上线;崩溃率、支付成功率达到团队既定阈值
证据:工单看板链接 / 昨日测试报告链接 / 设计稿链接(附更新时间)
待决策:P0-138 是否阻断上线;由产品负责人在周四 16:00 前拍板
待核实:18 条反馈中有多少是重复报告?需要原始链接
已批准:只写人类负责人确认过、可以对外使用的结论
页面:移动端 2.8 发布决策
目标:周五 17:00 上线;崩溃率、支付成功率达到团队既定阈值
证据:工单看板链接 / 昨日测试报告链接 / 设计稿链接(附更新时间)
待决策:P0-138 是否阻断上线;由产品负责人在周四 16:00 前拍板
待核实:18 条反馈中有多少是重复报告?需要原始链接
已批准:只写人类负责人确认过、可以对外使用的结论

请 Dot 把新反馈整理成「新增 / 已解决 / 仍阻断」三组,每条后面附工单 ID 和链接;让测试负责人在评论区纠正分类,再由产品负责人把决定写到“已批准”。这样即使智能体的摘要有错,团队也能定位到哪条来源、谁改了结论。不要让自动更新直接覆盖已批准区。

Space 的权限边界比页面排版更重要。官方说明区分“链接到原文件”和“把内容复制或总结进页面”:链接仍受原文件权限约束,复制或总结后的内容可能被所有页面读者看到。例如,指向受限财务表格的链接不会自动开放表格;但把其中的收入数字摘进共享页面,页面成员就可能读到数字。分享前用一个只有查看权限的测试账号检查页面;再核对页面是否继承了上级 Space 的访问权限。Space 页面权限说明。

GPT-6.1 Sol:便宜的是单价,值不值看任务成本

GPT-6.1 Sol 的卖点是接近 Astra 的复杂任务表现,同时有更低的 API 标价。价格是真的;“因此所有任务都省钱”还需要验证。下面按 Sol 与 Astra 官方模型页的标准文本费率列出预算起点,单位均为美元/百万 Token:

模型 输入 缓存输入 写入缓存 输出
GPT-6.1 Sol $2 $0.10 $2.50 $10
GPT-6 Astra $10 $1 $12.50 $50

表中的缓存输入价格只在命中时适用。Sol 的单次输入超过 272K Token 后,官方规则还会对整次请求的输入与缓存费率按 2 倍、输出按 1.5 倍计价;Fast、Batch、Flex 和地区处理也有单独费率。算长文档或长时间运行的 Agent 成本时,不能只拿表中四个数字相乘。Sol 定价规则。

发布会画面展示 GPT-6.1 Sol 模型及其面向开发任务的定位

发布会画面:新模型的真正价值,要放到具体任务的成功率和总成本里检验。

同样的输入输出,合格结果的账单可能相反

先算纯文本模型费:一次任务输入 10 万 Token、输出 2 万 Token,Sol 为 0.1 × $2 + 0.02 × $10 = $0.40;Astra 为 0.1 × $10 + 0.02 × $50 = $2.00。这解释了“单次五分之一”,却没有解释任务能否交付。

假设做 30 条同样规模的上线工单分析。**以下通过率和人工时间是演示计算的假设值,不是厂商评测或实测结果。**Sol 一次合格 23 条,人工平均每条复核 3.5 分钟;Astra 一次合格 27 条,人工平均复核 1 分钟。若内部把复核人工按每小时 $30 计入成本,不含工具费:

模型 30 次模型费 人工复核费 合格条数 每个合格结果成本
Sol $12 $52.50 23 约 $2.80
Astra $60 $15 27 约 $2.78

这个假设里 Astra 的模型费高五倍,但每个合格结果的总成本略低。换一批任务,结论完全可能反过来。比较模型时至少同时记一次通过率、人工修改分钟数、p95 延迟、工具费和失败重跑次数,再计算:

每个合格结果的总成本 =(模型费 + 工具与运行费 + 人工复核/返工费)÷ 合格结果数

操作上可以准备 30 条历史任务,分成归纳、代码修改、长文档分析和高风险决策四组。对每条任务固定输入、验收标准、推理强度和允许的工具;输出交给不知道模型身份的人按同一标准判分。开发者通过 API 做工具调用时,Sol 的模型文档要求使用 Responses API;只拿 Chat Completions 的纯文本结果比较 Agent 工作流,会漏掉工具环节。

OpenAI 的模型选择指南提供起始思路:窄而高吞吐的任务试 Luna,需要判断的日常工作试 Sol,困难任务再评估 Astra。最终路由规则应由这 30 条任务的验收数据决定,不由发布会图表决定。

Agents API 与其他发布:分清“已可实现”和“还需核实”

如果你是使用现成产品的运营或项目负责人,先试 Dot 和 Space 就够了。如果你的团队要把智能体嵌进自己的产品,才需要进一步看 Agents API。OpenAI 的官方概览描述了托管的 Codex 执行环境、持续会话、沙箱、工具调用与中断恢复。它能减少团队自己维护任务运行环境的工作,但不会替你定义哪些数据可读、哪些操作需要人批准、什么结果算合格。

以“自动处理上线工单”为例,接入前先画出五个节点:接收工单、检索证据、生成建议、人工批准、执行或退回。把证据链接、工具调用、失败重试、最终批准人写进同一条任务记录。沙箱只能限制执行环境;如果工具本身持有生产写权限,仍须在工具层控制。试运行时故意制造超时、权限不足、重复工单和错误引用,检查任务能否停在正确的节点,并由人接管,而不是只测一条成功路径。

它的账单也不能只看模型 Token:模型、工具和托管容器可能分别计费。试点预算要同时设单任务上限、每日上限和失败重试上限。另一个上线门槛是数据政策:截至本文核对时,Agents API 官方文档写明托管服务目前提供美国区域,尚不支持零数据保留(ZDR)。有数据驻留或保留要求的项目,应先完成内部合规核对。

发布会里的其他名词也要分层核实:

  • UltraFast 是速度选项,不是新模型。官方说明写的是最高可达 8 倍速度,Astra 已有一定开放范围,但速率限制较低,且目前限定美国或全球处理;不要据此推断 Sol 的每个账号都能开启同样的模式。高并发业务先测 p95 延迟和排队,再决定是否为速度付费。
  • Sign in with ChatGPT 解决的是身份和授权。接入指南把登录、用户许可和可选的套餐使用区分开。它面向符合条件的开源本地应用及选定合作方,不能把“用户有 ChatGPT 订阅”写成“所有第三方产品都可免费调用 API”。
  • **Decisions API、Marketplace 等仍需按具体入口核验。**两篇现场报道提到了这些方向,但本文没有找到足以确认公开接口、开放范围和计费细则的官方文档。产品路线可以关注,采购、排期和报价先不要以报道里的名称为依据。

无论使用哪个入口,先在账号后台确认地区、资格、额度与价格,再用同一批任务做小范围试验。把发布会上的能力演示当作线索,不当作合同。

用 7 天把发布会信息变成团队结论

时间 动作 要留下的证据
第 1 天 从历史工单抽 30 条,先由人标注正确结论与禁止动作;记录现有流程 任务样本、参考答案、平均耗时、错误类型
第 2 天 用只读数据源配置 Dot;设置北京时间、频率、联系人和暂停时间 权限清单、触发记录、取消触发器的方法
第 3 天 建一个 Space 页面,分开证据、待决策和已批准区;用只读账号验权限 页面可见范围、原始链接、人工审批记录
第 4–5 天 同批任务对比 Sol 与现用模型;固定提示词、工具、推理强度和判分者 一次通过率、p95 延迟、Token、人工复核分钟数
第 6 天 人为注入断网、重复任务、错误引用与越权请求 失败日志、通知次数、人工接管与回滚过程
第 7 天 计算每个合格结果的总成本,按阈值决定扩大、继续观察或停止 评分表、实际账单、负责人签字结论

验收阈值应在第 1 天定好,不要到第 7 天再挑好看的指标。一个可直接修改的起点是:30 条里至少 27 条达到团队原有质量标准;零次未经批准的发送、合并或生产写入;所有关键结论都能回溯到原始资料;每个合格结果的总成本低于现有流程。样本太小,达标也只支持扩大灰度,不支持直接全量上线。若发生越权或敏感信息扩散,立即停用连接、取消持续任务并按内部流程处理事件,不必等第 7 天。

复盘时再问一个朴素的问题:团队是否真的少花了时间?如果只是把写摘要的时间变成核对幻觉和追查日志的时间,试点没有创造收益。把通过率、人工分钟数、成本和错误类型并排展示,才知道该继续优化提示词、改用另一模型,还是根本不适合自动化。

对于使用 ClaudeAPI 管理模型调用的团队,先把任务标签、模型 ID、用量统计、工具费用和验收日志分开记录,再试 Sol。发布会宣布新模型,并不代表当前网关已支持;以平台模型列表、实际返回的模型 ID 和账单为准。这样模型或渠道变化时,团队仍保有自己的任务定义、成本基线和回滚方式。

资料与核对口径

相关文章