Chat Smith 已将 GPT-6 Astra 加入模型阵容——这是 OpenAI 全新的旗舰模型,专为电脑操作、代理式编程和可直接交付的专业成果而构建,所有 Chat Smith Pro 用户现已可用,无需额外付费。
OpenAI 于 2026 年 9 月 3 日发布 GPT-6 Astra,接替 GPT-5.6 Sol 成为其最强模型。Astra 在 FrontierMath Tier 4 上取得 97.6%,在 ARC-AGI-3 上取得 99.9%,几乎饱和了这两项基准,并在电脑操作、网页浏览、软件工程和科学领域创下新的最佳水平。它配备 1,050,000 token 上下文窗口、最大 128K 输出、2026 年 4 月 30 日的知识截止日期,推理强度档位也新增了 max 一级。
GPT-6 Astra 的过人之处
目前最强的电脑操作模型。 在 OSWorld 2.0 上,Astra 以每项任务约 40 分钟的用时取得 72.6%,而 GPT-5.6 Sol 为约 75 分钟取得 65.7%——用时减少约 47% 的同时准确率更高。它在 ScreenSpot-Pro 上达到 92.7%,高于 Sol 的 76.9%;在 Agents' Last Exam 上达到 59.3%,领先 Sol(53.6%)和 Claude Opus 5(55.5%)。
可以直接交出去的成果。 Astra 经过训练,会遵循现有模板,并只把真正相关的上下文写进交付物,因此生成的文档、表格和幻灯片符合公司行文风格,而非泛泛而谈的填充内容。它在 AutomationBench 上取得 41.4%,Sol 为 18.1%;在 BenchCAD 上取得 95.9%,Sol 为 83.3%。
编程更强,长上下文下依然稳定。 在 Terminal-Bench 4.0 上,Astra 从 Sol 的 37.3% 提升至 57.9%,在 DeepSWE v1.1 上达 74.1%。在上下文窗口的远端,回忆依然可靠:在 OpenAI 的 MRCR v2 8-needle 测试中,512K 至 1M token 区间内它取得 96.3%,Sol 为 73.8%。
需求模糊时的判断更好。 当答案可能改变结果时,Astra 会提出一个切中要害的问题;无法提问时则基于合理假设继续推进。任务中途转向时,它也能保持方向,而不是把一条纠偏消息当成全新目标。OpenAI 表示,在其内部幻觉基准测试中,它对自身能力做出误导性陈述的比例为 4.2%,低于 Sol 的 12.2%。
已包含在 Chat Smith Pro 中——无需额外付费
GPT-6 Astra 已向所有 Chat Smith Pro 订阅用户开放。无需升级,也无额外费用——打开模型选择器,选中 GPT-6 Astra 即可开始。
Chat Smith 的目标是把最好的 AI 模型集中到同一个地方,让用户可以把 Astra 与 Claude Sonnet 5 或 Grok 4.5 放在一起对比,不用切换平台就能为每项任务选到合适的工具。
GPT-6 Astra 现已面向所有 Chat Smith Pro 用户开放,访问 https://chatsmith.io/zh/model/gpt-6-astra。









