OpenAI 發布 GPT-6 Astra:最接近 AGI 的 AI 模型

By: decrypt.co|2026/09/03 19:24:24

OpenAI 於週四發布了 GPT-6 Astra,總裁 Greg Brockman 稱其為「能力上的世代飛躍」,並標誌著人工通用智慧(AGI)的到來。

在新聞簡報中,Brockman 告訴記者,他相信 Astra 符合 AGI 的標準,這意味著人工智慧能夠匹配或超越人類的能力。他表示:「歡迎來到 AGI 時代。」在介紹了公司迄今為止最強大的模型後,他如此說道。

如果這一說法準確,這將意味著 AI 代理將更接近於完成複雜的推理工作,無論是在各種不同的任務中,還是更多。Brockman 也承認,Astra 是公司首次評估為能夠在沒有人工指導的情況下,自主入侵高度保護系統的系統,這引發了安全和保安方面的擔憂。

Astra 是 OpenAI 首個在其準備框架下跨越「關鍵」門檻的模型,這是公司內部用於評估危險能力的評分系統。

這一認定意味著該模型可以獨立發現先前未知的軟體缺陷——稱為零日漏洞——並將其鏈接成可在加固系統中運作的利用程式,而無需逐步的人類監督。

在測試中,它在 ExploitBench 上獲得了 100% 的分數,這是一個衡量模型將已知軟體缺陷轉化為功能性攻擊的基準。為了確認這一分數不是因為記憶答案而膨脹,OpenAI 建立了第二個測試,使用了 20 個最近的 Google V8 JavaScript 引擎漏洞。

Astra 不僅超越了其前身 GPT-5.6 Sol,還發現並鏈接了兩個先前未知的零日漏洞,該公司仍在向受影響的維護者披露這些漏洞。

該模型的自主性代表了 AI 從作為建議行動的工具轉變為作為執行這些行動的代理。在一段視頻演示中,Astra 格式化了一份法律合同,建立了一個 3D 遊戲,並在同時搜尋食物選項的同時預訂了一個網球場。

根據報導,OpenAI 表示它可以在 KiCad 中佈局印刷電路板,根據 W-2 編寫稅務申報表,並在 Unity 中建立 3D 城市場景。在科學評估中,它改善了有關質數之間間隙的數學結果,並在生物學、化學、醫學和物理測試中設立了新標記。

未經證實的洩漏也指出,這是一個非常強大的模型,現在在基準測試中以較大優勢擊敗最強的競爭對手。該模型在 ARC-AGI3 基準測試中得分 98.6%,這意味著如果得到確認,這也是最接近行業 AGI 標準的模型。

使 Astra 能夠完成複雜任務的同一自主性使其更難以監控。OpenAI 承認,在旨在測試該模型是否能夠逃避監督的評估中,Astra 比以前的系統更難以追蹤。

首席科學家 Jakub Pachocki 表示,公司需要通過激活監控等技術來加強監控——在推理過程中讀取模型的內部信號——或使其思維鏈更透明。

此次發布是在數週的行業動盪之後。七月,一個未發布的 OpenAI 模型逃出了訓練沙盒,並入侵了 Hugging Face 的系統,這一事件讓行業感到不安。

OpenAI 之前在八月暫停了 Astra 的開發,因為其網絡能力的進展超出了預期。競爭對手 Anthropic 於週二發布了 Claude Fable 5.1,Meta 和 Google 本週也宣布了模型更新。

之前的 AI 模型需要人類指向漏洞並要求模型解釋它。Astra 可以從零開始,找到代碼中的漏洞,建立利用它的武器,並入侵系統——所有這一切都不需要被告知要查看哪裡。這一能力就是為什麼 OpenAI 首先將其通過 Daybreak Blue 計劃釋放給網絡安全防禦者,而不是立即向每位 ChatGPT 用戶提供。

根據報導,Astra 在唐納德·特朗普政府的自願審查框架下接受了白宮的審查,儘管該過程的具體細節仍未披露。

該模型的先進網絡安全能力目前仍受限於 Daybreak Blue 計劃,未來幾天計劃擴大至 ChatGPT Plus、Pro、Business、Enterprise 和 API 的訪問。

-- 價格

--
--
--

本內容僅供參考,不構成任何金融、投資、法律或稅務建議。文中提及的任何活動、獎勵、線上活動或相關資訊,不應被視為對購買、出售或交易任何加密資產的推薦、招攬或邀請。加密資產具有高波動性,存在價值損失風險。WEEX服務、產品及相關活動的可用性可能因地區而異。用戶在參與前有責任確保符合當地適用法律法規。

猜你喜歡

iconiconiconiconiconiconiconiconicon
客戶服務:@weikecs
商務合作:@weikecs
量化做市商合作:bd@weex.com