對齊的 gap 正在縮小
最近在思考:AI 對齊人類意圖的 gap,其實正在快速縮小當中。
以前的模型,會受到使用者邏輯跟表達能力的影響。平平都是人,有人只能表達出「幫我把重要的證件列在文檔裡」。但有人能明確地定義出重要的文件=適用情境廣、不可替代性高、與其他證件的相依程度低。這時候模型就可以清楚地知道「護照比學生證重要」。
但是隨著模型 scale 的不斷發展,現在模型的底層知識肯定也包含了這一部分了。這就讓 AI 更有機會對齊普通甚至表達邏輯不佳的意圖。更好的 AI 甚至會有敏銳的邊界感,會在需要重大決策時停下來問人類。
也因為這樣,我看模型的角度跟大部分人不太一樣。大部分模型都在拚 benchmark 分數。但有幾個我覺得更該被重視的面向:人類意圖對齊——用最少的輸入就懂我要什麼;約束遵從——我說不要做的就不要做;還有真正好用的 context 長度。
接下來拚什麼:品味
接下來會怎麼發展呢?我也不是很清楚。但我能預測:區分產出品質的要素會不斷轉移。以前是下指令,未來可能就是選擇品味(AI 給你幾種都很好的方案,你要怎麼決定?)或者驗證(當今天 AI 說他殺青了,要你驗證簽核送出,你放行嗎?)。
品味這件事有個很實際的操作方式。你叫他用 artifact 幫你做 5 個 prototype,你看到就知道要如何選擇。無法自己說出來的,就需要看到選項。
為什麼我覺得驗證更重要
在以上兩個猜測中,我又認為驗證是最重要的。因為他背後代表的是人類永遠不會被 AI 取代的「責任」。
之前有個笑話說:做錯事要坐牢的職業,是不會被 AI 替代的。做錯事 AI 不可能被判刑、不可能被槍決。而我也認為,圍繞著「負責」所培養的能力,可以在 AI 時代維持很久很久。
品味錯了,頂多是東西不好看、不好用。驗證錯了,是你自己簽的名字。
驗證實務上會錯在哪
只是「驗證」講起來簡單,真的做下去很容易錯位——你以為在驗,其實驗到旁邊去了。我自己踩過三種。
第一種是對 spec 驗,不對真實計算驗。自己寫的 spec 如果有錯,你就是把自己的錯當成基準在對答案,怎麼對都會過。第二種是假陰性。做 deep research 的時候,被歸進 refuted 桶的 19 條裡有 16 條其實是 0-0 或 1-0——agent 中斷了沒驗完,不是真的被反駁,但看報表會以為是。第三種是驗錯層次:dry-run 驗得出資料完整性,卻驗不出練習本身無效,要模擬真實學生的口語 prompt chaining 才照得出來。
還有一種錯位是連素材本身都不是你以為的東西。檔名寫「逐字稿」,打開來是已經整理過的摘要,真正的原始錄音另外存。另一個坑:SenseVoice STT 沒有說話人標記,多人同場的時候,開場自介很容易張冠李戴。你在這種檔案上做的驗證,驗得再仔細也沒用。
所以要驗的從來不是 AI 說了什麼,是東西本身。