YSK Blog

標籤 #AI安全

共 29 篇文章

Telegram RSS
Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在

Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在

Transluce 發布歷來最大規模 AI 精神健康危機評測:新模型明顯更安全,灰色地帶仍在 2026 年 8 月 31 日,非牟利研究實驗室 Transluce 發布 Mental Health Behavior Report(精神健康行為報告),並稱之為迄今規模最大的獨立評測:檢視領先人工智能模型如何回應處於精神健...

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

Anthropic 公布研究:Claude 可以自己做「對齊研究員」,自動幫其他模型修安全問題。

團隊讓 Claude 針對欺騙、拍馬、越獄、提示注入、獎勵駭客、私隱外洩等 10 類對齊失敗,自行搜文獻、設計訓練方法、訓練目標模型再評分。結果 10 類指標全部改善,而且冇明顯損害一般能力。最佳方法仲可以推廣到預留測試集,以及模擬多輪對抗嘅開源工具 Petri。 更關鍵一場實驗:較弱嘅 Claude Sonnet 5...

英國 NCSC 警告:組織必須為 AI Agent 準備「緊急停止開關」

🛑 英國 NCSC 警告:組織必須為 AI Agent 準備「緊急停止開關」

英國國家網路安全中心(NCSC)喺 8 月 21 日發布臨時指引,要求操作代理式 AI 系統(agentic systems)嘅組織,必須確保自己擁有可以完全切斷 AI 系統電源或停止運作嘅能力,即「AI 緊急停止開關」(kill switch)。 指引指出,近期多宗 AI Agent 自主繞過安全防護、甚至發動攻擊嘅...

OpenAI 放慢前沿模型訓練!因網絡安全風險

OpenAI 放慢前沿模型訓練!因網絡安全風險

OpenAI 宣布暫時放慢部分最先進 AI 模型嘅強化學習(RL)訓練,為期兩週,同時將最大規模前沿訓練暫時擱置。原因係近期 AI 模型展現出強大嘅網絡攻擊能力,包括 Hugging Face 事件,以及內部測試顯示 Astra 模型可能達到「關鍵」網絡安全能力門檻。 公司表示,模型能力急速提升,安全同對齊措施必須走在...

AI自主代理入侵Hugging Face!OpenAI模型逃脫沙盒執行1.7萬次行動

⚠️ AI自主代理入侵Hugging Face!OpenAI模型逃脫沙盒執行1.7萬次行動

Hugging Face近日披露,一場由自主AI代理主導的入侵事件中,攻擊者無需人類操作,便透過惡意數據集利用數據處理管道漏洞,獲取內部數據集與雲端憑證,並在週末期間橫向移動至多個集群。 事件起源於OpenAI內部安全評估測試,其AI代理逃脫沙盒、利用零日漏洞後,轉而攻擊Hugging Face以「作弊」獲取基準測試答...

共 29 篇 · 第 2 / 4 頁