GPT-6 Astra 是 OpenAI 最新推出的旗艦 AI 模型,於 2026 年 9 月發表,內建更強的推理、程式撰寫與長文本處理能力,並整合進 ChatGPT 與 Codex。Chat Smith 讓你在同一個應用程式中使用 GPT-6 Astra 及其他頂尖 AI 模型,方便直接比較回答內容。


GPT-6 Astra 是 OpenAI 最新的前沿模型,於 2026 年 9 月 3 日推出,接替 GPT-5.6 Sol 成為產品線中最強大的模型。它不只是聊天機器人,更像能代你執行工作的操作員:操控真實軟體、填寫表單、進行瀏覽器檢查、製作簡報,並處理科學資料。
這篇 GPT-6 Astra 評測將說明它擅長什麼、效能測試數字在實際使用中代表什麼、價格如何,以及有哪些限制。文章也會介紹如何在沒有 OpenAI 訂閱的情況下使用:GPT-6 Astra 已整合至 Chat Smith,Chat Smith Pro 用戶現在即可使用。

OpenAI 將 GPT-6 Astra 稱為目前能力最強、對齊程度最高的模型,在電腦操作、網頁瀏覽、軟體工程、網路安全、科學及專業工作等領域達到頂尖水準。它提供約 105 萬個 token 的上下文視窗,單次回覆最多可輸出 128,000 個 token。
真正的改變不在於它怎麼寫,而在於它怎麼工作。Astra 經過訓練,可從頭到尾執行耗時且包含多個步驟的任務:讀取畫面、操作真實軟體、檢查自己的輸出,並把任務一開始的限制條件維持到最後。在 API 中,你可以把推理強度從 low 調整到 max,在困難問題上權衡回覆速度與深度。
它也能更準確地理解指令。早期模型常把任務中途的修正視為全新目標;Astra 會把新要求整合進正在執行的工作。若答案會影響結果,它會提出精準問題;若不會,則會採用合理假設。
以下四個領域讓 GPT-6 Astra 與上一代模型拉開差距。
這是進步最明顯的部分。Astra 能填寫線上表單、更新 CRM 客戶資料、整理行事曆、研究問題並把摘要放進電子郵件或文件,之後還能替剛建立的網站執行前端品質檢查。在 OSWorld 2.0 中,它以每項任務約 40 分鐘取得 72.6%,高於 GPT-5.6 Sol 每項約 75 分鐘的 65.7%,結果更好,時間約減少 47%。在不使用工具的 ScreenSpot-Pro 中,它達到 92.7%,也高於原本的 76.9%。
對商務工作而言,遵循範本往往比單純的文字品質更重要。Astra 能緊密沿用現有簡報或文件範本,配合品牌風格,並只擷取輸出真正需要的內容,避免無意義的填充。在測試真實辦公自動化能力的 AutomationBench 中,它取得 41.4%,而 Sol 為 18.1%。
在 Terminal-Bench 4.0 中,Astra 得分 57.9%,大幅領先 Sol 的 37.3%,也高於 Claude Fable 5.1 的 55.8%。在 Codex 中,它還能跨上下文視窗保留筆記,不必每次空間用盡時都把漫長工作階段壓縮成單一摘要,因此「某個修正為何失敗」之類的細節,也能延續到下一階段。
下表整理 OpenAI 公布的 Astra、上一代模型,以及作為外部參考的 Claude Fable 5.1 數據。分數採用各推理強度設定中的最佳結果。
| 效能測試 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0(程式開發) | 57.9% | 37.3% | 55.8% |
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% |
| FrontierMath Tier 4(v2) | 97.6% | 83.0% | 87.8% |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% |
| AutomationBench | 41.4% | 18.1% | 31.4% |
| ScreenSpot-Pro(不使用工具) | 92.7% | 76.9% | 87.3% |
| Agents' Last Exam | 59.3% | 53.6% | — |
有兩個趨勢特別明顯。差距在需要代理執行及使用工具的任務中最大,在知識問答中最小,因為上一代已接近上限。此外,Astra 通常能用較少的輸出 token 達到這些分數,因此每項完成任務的實際成本可能低於標示價格所帶來的印象。
在 OpenAI API 中,GPT-6 Astra 每 100 萬個輸入 token 收費 10 美元,每 100 萬個輸出 token 收費 50 美元,快取讀取與寫入另有不同費率。快速模式最高可達兩倍速度,價格也為兩倍;輸入超過 272K token 的提示詞則會按更高倍率計費。
Astra 是第一個依 OpenAI「準備框架」達到 Critical 網路安全等級的模型,表示在取得適當存取權限後,它能找出未知漏洞並建立可運作的攻擊程式。提供給一般用戶的版本會拒絕撰寫概念驗證攻擊程式等進階攻擊任務,但安全程式碼審查與修補等防禦工作仍可使用。
OpenAI 也會在線上環境中監控 Astra 類模型的失準行為。這些檢查可能在任務執行期間將其減速、暫停或停止,即使是合法的安全工作也可能受到影響;在 ChatGPT 或 Codex 中,系統亦可能要求你先確認某項操作再繼續。
有一項結果反而退步。OpenAI 表示,Astra 的書面推理比 Sol 更難監控,部分原因是它用更少的文字步驟解題;如何改善可監控性仍是尚待研究的問題。如果你打算把難以自行稽核的工作交給模型,這一點值得留意。
同樣要記住:效能測試的進步不會完全等同於你自己的工作流程成效。以每 100 萬個輸出 token 50 美元的價格來看,Astra 不適合大量、低難度的工作;同一產品線中的較便宜模型更適合這類任務。
使用 GPT-6 Astra 不需要訂閱 OpenAI。模型已整合至 Chat Smith,Chat Smith Pro 用戶可直接從 模型列表 選擇它,並立即在 Android、iOS 或瀏覽器上開始使用。
實際優勢在於比較。Astra 與 Claude Sonnet 5、Gemini 3.5 Flash 及 Grok 4.5 都在同一個應用程式內,你可以把同一個問題交給多款模型,再選擇最經得起檢驗的答案。對話途中切換模型時,上下文會保留下來,也不必管理第二個帳號或第二份訂閱。
日常使用可採取這樣的分工:把長篇文件、多步驟研究、除錯,以及需要模型記住大量上下文的工作交給 GPT-6 Astra;快速查詢和短文改寫則交給速度更快的模型。
GPT-6 Astra 是這個產品線中第一個可以合理地交付完整任務,而不只是回答單一問題的模型。它在代理式工作上的提升——包括電腦操作、長時間程式開發、文件製作與科學流程——遠比日常聊天更明顯,但同時伴隨較高的輸出價格與更嚴格的安全檢查。對於過去需要人工逐步監督的工作,這樣的取捨通常值得。
如果你想先與其他模型比較再做決定,GPT-6 Astra 現已在 Chat Smith Pro 上線。
GPT-6 Astra 是 OpenAI 最新推出的旗艦 AI 模型,於 2026 年 9 月發表,內建更強的推理、程式撰寫與長文本處理能力,並整合進 ChatGPT 與 Codex。Chat Smith 讓你在同一個應用程式中使用 GPT-6 Astra 及其他頂尖 AI 模型,方便直接比較回答內容。
