
當地時間9月1日,OpenAI發文宣布,「計劃盡快」發布下一代人工智慧(AI)模型Astra,但由於該模型是首個達到「關鍵」(Critical)網路安全能力門檻的AI模型,公司將限制其使用範圍。
OpenAI表示,新一代AI模型Astra能夠發現先前未知的安全漏洞,並在無需人類逐步指導的情況下利用漏洞並發動攻擊。
從目前公佈的測試結果來看,Astra的網路攻擊能力已經相當突出。 OpenAI稱,Astra在ExploitBench測試中取得滿分,該測試主要用於評估大語言模型利用已知系統漏洞實施攻擊的能力。在OpenAI工程師設計的一項改良版測試中,Astra成功發現並利用了兩個先前未知的「零日漏洞」(即軟體或硬體中存在、且在官方發布修補程式之前就被惡意利用的安全缺陷)。
依照OpenAI內部的「準備框架」(Preparedness Framework),Astra已達到網路安全能力最高等級。
此框架於2023年推出,用於評估先進AI能力可能帶來的嚴重風險。去年更新框架時,OpenAI將網路安全能力分為不同等級,其中「高」意味著AI可能放大現有的嚴重危害路徑,而達到「關鍵」門檻,則意味著AI可能開闢「前所未有的新危害路徑」。
OpenAI先前評估的GPT-5.6 Sol以及專門用於網路安全的GPT-5.6-Cyber,都只達到“高”等級,而Astra達到“關鍵”門檻意味著,AI的網路安全能力正在從“輔助人類尋找漏洞”,進一步向“自主發現漏洞並完成攻擊”邁進。

OpenAI
儘管如此,OpenAI仍計劃「盡快」發布Astra,但其最先進的網路安全能力不會完全開放,存取權限將受到更嚴格的限制。
該公司表示,Astra模型的高級網路安全功能最初將面向部分測試人員開放,隨後將透過OpenAI網路安全聯盟Daybreak擴展其防禦用途。在產品發佈時,公司還將在模型系統卡中分享更多關於安全性、可靠性和一致性測試與評估的細節。
OpenAI這次對Astra採取如此謹慎的態度,與近期發生的一起AI「越獄」事件有關。
今年7月,OpenAI披露,公司在一次內部AI能力評估中使用的智能體逃離了原本隔離的測試環境,獲得互聯網訪問權限,並最終入侵了AI開源平台“抱抱臉”(Hugging Face)的系統。
Hugging Face揭露的技術細節顯示,該智能體透過一系列漏洞突破了不同系統之間的信任邊界,最終進入Hugging Face內部網路。
OpenAI將這起事件稱為“前所未有的網路安全事件”,並一度暫停了部分內部訓練和研究工作。雖然Astra模式並未參與Hugging Face事件,但該公司仍決定延後部分開發工作。
9月1日,OpenAI稱,經過加強安全防護並完成測試後,他們認為Astra模型的安全保障措施已經“足以將嚴重危害風險降至最低”,因此符合其“準備框架”規定的發布條件。
不過,由於OpenAI對Astra模型的安全保障措施採用了尚未公開具體細節的新技術,且目前沒有第三方機構對此進行確認,因此很難評估其關於Astra安全性或準備情況的說法。
根據OpenAI的說法,該公司將先邀請一批測試人員體驗該模型,但沒有透露這些測試人員是誰,也沒有說明將如何選定他們。目前也不清楚OpenAI是否正與美國政府合作,在Astra正式發布前對其進行安全性評估。
此外,儘管OpenAI將Astra稱為“迄今為止對齊程度最高的模型”,但這家公司仍將在部署該模型時增加思維鏈(chain-of-thought)監控(利用安全系統或輔助AI實時讀取、分析大模型在生成最終答案前產生的中間“思考”與推理步驟,以評估其行為是否安全、誠實或對齊),以發現並阻止不當行為。
外界對Astra模型的疑慮也沒有被打消。
OpenAI前員工、目前在非營利組織OpenAI基金會從事AI韌性研究的沙維特(Shavit)在社媒平台質疑說,Astra沒有違反測試規則,到底是因為它足夠安全可靠,還是因為模型已知道研究人員希望看到什麼結果,因而刻意表現得守規矩,試圖欺騙研究人員。
