OpenAI發布最新研究成果，CoT監控可阻止大模型惡意行為_快訊

OpenAI發布最新研究成果，CoT監控可阻止大模型惡意行為

2025-03-12 15:41 OpenAI

3月11日消息，OpenAI發布了最新研究，用CoT（思維鏈）監控的方式，可以阻止大模型胡說八道、隱藏真實意圖等惡意行為(wei) ，同時也是監督超級模型的有效工具之一。據悉，OpenAI使用了最新發布的前沿模型o3-mini作為(wei) 被監控對象，並以較弱的GPT-4o模型作為(wei) 監控器。測試環境為(wei) 編碼任務，要求AI在代碼庫中實現功能以通過單元測試。結果顯示，CoT監控器在檢測係統性“獎勵黑客”行為(wei) 時表現卓越，召回率高達95%，遠超僅(jin) 監控行為(wei) 的60%。