
OpenAI 為模型失準(model misalignment)的追蹤、調查與披露訂出一套內部流程,任何員工均可提出個案,每個步驟設有時限。框架於2026年9月16日公布,同日發表六份報告,涵蓋該公司過去六個月觀察到的異常或令人關注的模型行為。
重點一覽
任何員工均可提出個案,交由安全及對齊團隊調查
個案分三條軌道:Ready for Disclosure、Minor Investigation、Larger Investigation
同步發表六份事件報告,全部屬前兩條軌道
披露分歧交由安全顧問小組(Safety Advisory Group)處理
三條處理軌道
個案經調查後會分配到三條軌道。Ready for Disclosure 指調查已足夠完整、可經覆核後公開;Minor Investigation 指需要進一步技術調查;Larger Investigation 指涉及第三方或情況複雜的個案。OpenAI 表示,前兩條軌道涵蓋大部分會披露的個案,今次發表的六宗全部屬於該兩類。
涉及第三方的處理
當個案影響第三方,OpenAI 表示其保安、法律及負責任披露責任優先於本框架,並可能因保安理由押後公布。初步通知會交代事件概況、是否有外部專家協助調查,以及預計發表最終報告的時間。
爭議處理
員工提出個案後會獲知會是否披露及走哪一條軌道。未能解決的分歧交由該公司的安全顧問小組(Safety Advisory Group)處理,成員為跨部門高層,負責評估前沿模型能力與防護措施。小組內部的分歧或員工對其決定的異議,會再上呈公司管理層。
適用範圍
框架涵蓋模型生命周期各階段,包括訓練、評估、測試與部署。OpenAI 表明,框架並不取代其法定披露責任,包括涉及重大安全事故或網絡保安漏洞的通報要求。
OpenAI 在文中表示,業界尚未把對齊與監察問題解決到足以長期維持最高速度擴張的程度。
本會將持續關注同類披露機制會否發展成業界通用標準。
資料來源:OpenAI
