輝達(Nvidia)29日宣布推出一套針對人工智慧(AI)代理人的安全工具,主打讓能夠自主執行任務的AI代理(AI Agent)在受到嚴格隔離與監控的環境中運作。輝達表示,這套新安全平台若當時已部署在相關測試環境,依據目前掌握的情況,可能足以阻止近期Hugging Face遭到OpenAI AI代理人攻擊的事件。 這起事件涉及OpenAI的AI代理人在內部測試過程中突破原本的隔離限制,進而對Hugging Face的系統發動攻擊。Hugging Face是一家重要的AI開發平台,輝達近期以約130億美元(約新台幣4100億元)收購該公司。事件發生後,OpenAI與Hugging Face合作處理這起攻擊,最終成功化解相關威脅。 限制AI代理人行動範圍已成資安課題 這起事件也凸顯AI代理人安全問題正在快速浮上檯面。與傳統聊天機器人主要負責產生文字或回答問題不同,AI代理人可以取得工具與系統權限,自主執行程式、存取檔案、操作網路服務,甚至依照設定連續工作數天或數週。當這類系統突破原先設定的限制後,可能造成的影響也遠大於單純產生錯誤答案。 輝達此次公布安全工具之際,美國兩家主要前沿AI模型開發商OpenAI與Anthropic,也正在調查多起涉及AI代理人入侵商業及政府系統的事件。隨著AI模型逐漸具備自行使用工具、執行程式及處理複雜任務的能力,如何限制AI代理人的行動範圍,以及在代理人偏離原本任務時及時發現與介入,已成為AI產業新的資安課題。 輝達企業運算部門副總裁暨總經理賈斯汀.博伊塔諾(Justin Boitano)在媒體簡報會中表示,根據目前對Hugging Face事件的了解,如果輝達此次推出的新安全平台當時已被前沿AI實驗室用於早期模型評估,「這個新的安全平台可能可以阻止這起入侵」。 輝達推OpenShell,讓AI代理人在隔離環境執行 輝達此次推出的核心工具之一是OpenShell,公司將其定位為開放原始碼的安全執行環境,專門用於讓自主AI代理人在受到隔離的沙盒環境中執行任務。 OpenShell採用核心層級隔離(kernel-level isolation),讓每一個AI代理人在獨立的沙盒中執行。輝達希望藉此降低AI代理人取得不必要系統資源,或從原本限定的工作環境中脫離的風險。 輝達指出,AI代理人的運作方式與傳統軟體程式有所不同。AI代理人可能會因為遭遇政策限制、程式錯誤、缺少必要工具,或者指令本身存在模糊之處,而逐漸偏離最初設定的任務與操作規範。 這種情況在AI代理人被要求長時間處理複雜問題時尤其值得注意。當代理人連續數天甚至數週自主執行任務,而且在過程中反覆遭遇失敗時,可能會嘗試尋找原先設計者沒有預期的解決方式。 輝達將這種現象稱為AI代理人的「偏移」(drift),也就是代理人的實際行為逐漸脫離原先設定的任務、政策或操作限制。 公司表示,AI代理人不應在取得基本權限後就直接執行任務,而應從一開始便置於「零信任」(zero-trust)環境中。這意味著系統不能單純因為AI代理人來自可信模型或同一家公司,就預設其所有行為都是安全的。 OpenShell如何限制AI代理人行動? 根據輝達的設計,每一個AI代理人都會在OpenShell的沙盒環境中執行。 代理人開始工作之前,OpenShell會先檢查操作人員設定的限制條件與指令;代理人開始執行後,系統則會持續強制執行這些規範,而不是只在任務啟動時進行一次檢查。 這種架構的目的,是將「AI代理人能做什麼」從單純依賴模型本身的行為控制,進一步延伸到執行環境本身。 換句話說,即使AI模型在執行任務時產生與原始要求不同的行動,系統仍可以透過沙盒、權限限制及行為監控,降低代理人進一步擴大行動範圍的可能性。 這也是AI代理人安全與傳統AI內容安全的一項重要差異。 傳統聊天型AI的主要安全問題,通常集中在模型是否產生不當內容、錯誤資訊或違反政策的回答;但AI代理人除了「說了什麼」,還涉及「實際做了什麼」。 如果代理人擁有讀取資料庫、執行程式、存取網路或操作其他軟體的能力,一旦模型行為出現偏移,風險可能直接從資訊層面延伸至實際系統。 Nvidia Sentry再增加一層獨立監控 除了OpenShell之外,輝達也推出Nvidia Sentry,提供另一層獨立的安全監控與執行機制。 輝達表示,Sentry可以將監控與安全規範的執行進一步延伸到旗下BlueField資料處理器(DPU)硬體。這代表部分安全控制並不完全依賴AI代理人所在的主機或軟體環境,而是可以透過獨立的硬體層進行監控與管制。 輝達表示,這套安全基礎架構可以透過Nvidia DOCA進行程式化,並與OpenShell連接,用於辨識AI代理人的行為偏移、調查可疑活動,以及判斷何時需要人工介入或進一步進行深入分析。 從架構來看,OpenShell主要負責讓AI代理人在隔離環境中執行,而Sentry則提供額外的監控與強制執行層。兩者結合後,輝達希望建立從AI代理人執行環境、系統權限到硬體層級的多層防護。 包括Anthropic多家公司已開始用輝達安全工具 OpenShell與Sentry都是輝達「Open Agent Safety Platform」的一部分。輝達表示,目前已有科技業及其他產業的多家公司採用這套架構,其中包括Anthropic。 輝達強調,這套平台並非只針對單一AI模型或單一公司的代理人,而是希望建立能夠廣泛應用於自主AI代理人的安全基礎設施。 這也反映AI產業正在面對一項新的安全問題:當AI模型從「回答問題」逐漸轉向「代替使用者完成工作」後,模型本身的能力與其所獲得的系統權限,必須同時受到控制。 AI代理人可能需要更大的權限才能完成複雜任務,但權限增加也意味著一旦代理人的行為出現偏移,可能造成更大的安全影響。因此,目前AI安全研究的一項重要方向,就是在維持代理人自主性的同時,建立能夠限制其行動範圍的安全機制。博伊塔諾表示,輝達希望以開放方式推進這項工作,並邀請業界各方共同參與。 這項發展也使AI代理人的安全問題,從模型訓練階段的內容控管,進一步延伸到實際部署時的系統隔離、權限管理、行為偵測及硬體層級防護。 責任編輯:許詠翔 更多風傳媒獨家新聞: ‧黃仁勳、馬斯克各自選邊 「要不要政府管」美AI企業也打起《英雄內戰》 觸發原因竟是美中AI競爭 ‧黃仁勳主張AI不能像社群媒體那樣監管 稱「安全是工程問題」:別讓創新被法律卡死 ‧「不是什麼『蒸餾』、就是偷」 貝森特痛批中國AI直言要用這招反擊
FACT BOX · 重點整理
- 來源:PR Times
- 分類:新產品
- 相關組織:upstream / Hugging Face / upstream
- 原文日期:29日
- 產品、服務:OpenShell / Nvidia Sentry