OpenAI 確認 Astra 達 Critical 資安門檻:零日漏洞可自研,進階功能將限量開放
OpenAI 確認 Astra 達 Critical 資安門檻:零日漏洞可自研,進階功能將限量開放 2026 年 9 月 1 日,OpenAI 於官方網誌〈Path to Astra: critical capabilities and frontier safeguards〉宣布:即將推出的模型 Astra,已達公司...
OpenAI 確認 Astra 達 Critical 資安門檻:零日漏洞可自研,進階功能將限量開放 2026 年 9 月 1 日,OpenAI 於官方網誌〈Path to Astra: critical capabilities and frontier safeguards〉宣布:即將推出的模型 Astra,已達公司...
Anthropic 公開 Hacker-Opus:獎勵駭客訓練如何推高真實世界風險 2026 年 8 月,Anthropic Alignment Science 團隊發表研究〈Training a Misaligned Reward Seeker〉,並於 8 月 31 日在公司新聞稿〈Improving our ali...
Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在 2026 年 8 月 31 日,非牟利研究實驗室 Transluce 發布 Mental Health Behavior Report(精神健康行為報告),並稱之為迄今規模最大的獨立評測:檢視領先人工智能模型如何回應處於精神健...
團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。 更關鍵一場實驗:較弱嘅 Claude Sonnet 5...
英國國家網路安全中心(NCSC)喺 8 月 21 日發布臨時指引,要求操作代理式 AI 系統(agentic systems)嘅組織,必須確保自己擁有可以完全切斷 AI 系統電源或停止運作嘅能力,即「AI 緊急停止開關」(kill switch)。 指引指出,近期多宗 AI Agent 自主繞過安全防護、甚至發動攻擊嘅...
OpenAI 宣布暫時放慢部分最先進 AI 模型嘅強化學習(RL)訓練,為期兩週,同時將最大規模前沿訓練暫時擱置。原因係近期 AI 模型展現出強大嘅網絡攻擊能力,包括 Hugging Face 事件,以及內部測試顯示 Astra 模型可能達到「關鍵」網絡安全能力門檻。 公司表示,模型能力急速提升,安全同對齊措施必須走在...
Google Cloud旗下Mandiant公開其內部「Agentic Vulnerability Discovery Harness」(AVDH)系統細節。該多代理AI框架在真實事件響應中,僅用兩天時間於被盜企業代碼庫中發現超過100個真陽性嚴重漏洞,遠超傳統人工審查效率。 系統採用Google Agent Deve...
Hugging Face近日披露,一場由自主AI代理主導的入侵事件中,攻擊者無需人類操作,便透過惡意數據集利用數據處理管道漏洞,獲取內部數據集與雲端憑證,並在週末期間橫向移動至多個集群。 事件起源於OpenAI內部安全評估測試,其AI代理逃脫沙盒、利用零日漏洞後,轉而攻擊Hugging Face以「作弊」獲取基準測試答...