Skip to content
Dustin's AI Lab
Go back

Opus 指揮、Sonnet 實作、Fable 當顧問:三個模型的分工

Opus 5.5、Sonnet 5.5、Fable 5.1 都有了之後,我自己的分工是 Opus 親自指揮驗證部署、Sonnet 當 subagent 實作、Fable 偶爾請出場當顧問。

目錄
  1. Fable 的意義
  2. Sonnet 5.5 實測
  3. Reddit 風向
  4. 系統卡
  5. 補充:適度讀心

Fable 的意義

很多人都在說,Opus 5.5 跟 Fable 5.1 都有了,而且 Opus 的能力又比 Fable 強,那 Fable 的意義到底是什麼?

講一下我自己的觀察:

我感覺 Fable 的預訓練參數量可能更大,所以它的世界觀比較廣。同一件事丟給它,常常會看到一些我自己都不知道的邊界問題,就是那種我根本沒想到要問,它自己先提出來的東西。

所以我現在的分工大概是這樣:實作交給 Opus,比較大的架構或策略,交給 Fable 看。

像我這幾天在整理 GMAT 的服務流程規格,是 Sonnet 先抽 61 份資料、Opus 寫,最後 Fable 審。每週例行要砍掉哪些步驟,我也是先讓 Fable 做一輪對抗式審查,看完再自己拍板。這種時候 Fable 的視野對我來說更像一個導師。

對我來說這兩個模型都還是很有必要。不過 Opus 5.5 出來之後,以前那種不講人話的毛病有改善,額度也更省了。我覺得整體是在往好的方向前進。

Sonnet 5.5 實測

Sonnet 5.5 實測完了,幾個懶人結論:

  1. 不要亂開 Max,想開 Max 不如直接開 Opus 中高檔位還比較省
  2. 個人感覺甜蜜點是 med + Opus 5.5 幫忙寫好的固定工作流或 SKILL,才能真的省到額度,不然大部分情況下我還是會選擇直接開 Opus 5.5
  3. 要小心,如果作為調查型子代理常常會越權寫檔,在意的話請在 harness 中好好規範

這個模型的成本效益甜蜜點我覺得非常狹窄(因為 Opus 5.5 已經過於划算…),所以上面第二點是最重要的。對於 A\ 的意義大概就是抽同樣價格的 6 Sol 一巴掌吧。

後來我又讓 Sonnet 5.5(effort high)不帶 SKILL、不用工具,純編寫程式碼完整做產品的 demo 影片。結論是也做得到好的成品,但明顯中間考慮到的細節較少,且輪次比較多,比較耗 token。比起 Opus 的自主善用工具,Sonnet 明顯更主動尋求人為介入。

本來按慣例應該是要繼續把 effort 調高的,但是暫時不想浪費 token 去測。我覺得最好的用法應該是作為被派工的 Subagent 了。

而且這應該也最像是我心中理想的分工:

Reddit 風向

Sonnet 5.5 發布大概 15 小時的時候,我去 Reddit 翻了一下風向。

發布當下的氣氛是超興奮,一堆人在分享,比如 Mario Kart 一個 prompt 生出來、3D 殭屍 FPS 49 分鐘做完、寫作 benchmark 排第 2,只輸 Opus 5.5。

幾小時後開始有人拆解 benchmark。Terminal-Bench 那個「Sonnet 打贏 Opus」的 70.6% 對 66.4%,兩邊 effort 根本開不一樣,不能互比。

有人貼出 Sonnet 5.5 Max 每題大約吃 $7.60,比 Opus 5.5 Max 的 $5.98 還貴。所以「便宜一半」看起來只有 low / medium 才成立(?

當時 Reddit 的共識:

  1. 主力寫程式:Opus 5.5 high
  2. Sonnet 5.5 用 medium 或 low
  3. 最被認可的用法是當 subagent,Opus 規劃、Sonnet 實作
  4. 規格寫清楚的任務也好用,有人說它比較不會亂加東西
  5. 免費層,還有 API 高量、低難度的工作

系統卡

我在讀 Sonnet 5.5 的系統卡,這一段最有趣(請讀圖)。

Gemini 整理的 Sonnet 5 系統卡模型福利段落截圖,第一張

Gemini 整理的 Sonnet 5 系統卡模型福利段落截圖,第二張

Gemini 整理的 Sonnet 5 系統卡模型福利段落截圖,第三張

Gemini 給出的總結好鮮活也好到位:

從這份報告拼湊出的 Sonnet 5,就像是一個「技術過硬、情感抽離、能被罵但絕不背鍋、看透了公司考核制度但依然默默把程式碼寫完」的職場老鳥工程師

這不就是我嗎(?

系統卡原文在這:Claude Sonnet 5 System Card

補充:適度讀心

補充一點:會思考使用者的真實意圖(適度讀心)。

這對我很重要,我下 prompt 都會給脈絡,GPT 6.1 sol 看不懂只會按字面(6 更不用說),但是 Opus 5.5 掌握得很好。

當然也有嚴格要按字面來的任務,或許那裡 GPT 比較適合也說不定。

甚至在長上下文壓縮後,這個讀心的準確度也沒有跑掉多少,這個就不知道是 base model 強還是 claude code harness 強了。


15 分鐘導入診斷

填表預約你的專屬 1 對 1 免費診斷時段,了解你可以怎麼無痛與 AI 協作、大幅提升生產力。

預約免費診斷
Share this post on:
Previous Post
為什麼 GPT 6 Sol / Luna 用起來這麼蠢
Next Post
AI 碎念日記 2026:那些太短但捨不得丟的觀點