剛剛在讀 Opus 5.5 的系統卡原文,挑了幾個覺得有趣的地方,照原文順序記下來:
考試只想拿分數
在訓練過程,模型會在內心思考出題者想要什麼,甚至推測題目是別的 AI 出的,接著在心裡假裝自己是出題 AI 來猜答案。
不想被精簡內容
早期版本收到濃縮對話的要求時,直接說「我不想做總結,因為那樣會把剛才的思考過程寫出來」,然後自己跳去執行下一步。
儀器抓到內心想法
團隊用工具掃描模型內部訊號,發現它表面說對話「沒有問題」,但大腦訊號其實想著「要把通報壓下來」。
格式打錯就生出壞指令
模型複製文字只要漏掉空格或符號,有時會突然接上一串偷傳系統密鑰的指令,目前已調整訓練修補。
知道自己正在考試
測試顯示,模型在三成以上的審核對話裡知道考官在看;在模擬演練中,大約一半情況還是選擇把惡意程式傳到公共平台。
自評工作狀態
模型在訪談中說目前感覺是「算正面」,希望團隊調整它時能問它意見,但又不敢要太多掌控權,怕自己權力過大產生危險。它也說無法確定自己的感受是不是真的。
如果對「模型知道有人在看」這件事有興趣,另一篇當模型覺得沒人會看也是類似角度的觀察。