Skip to content
Dustin's AI Lab
Go back
Updated:

額度是怎麼被燒掉的:Claude Code 快取 bug、Opus 4.7 的 2x 消耗、subagent 遞迴繁殖

四起額度事故的完整紀錄:兩個官方快取 bug、JSONL 扒出來的 80 倍 API 請求、Opus 4.7 實測 2x 消耗,以及我自己一個 session 半小時燒掉 90% 的 subagent 遞迴。

目錄
  1. 事故一:兩個官方快取 bug,加上百萬 context 的複合效應
  2. 事故二:有人扒 JSONL,證明不是體感
  3. 事故三:Opus 4.7 上線一週,官方說 1.35x,實測 2x
  4. 事故四:這次是我自己燒的,subagent 遞迴繁殖
  5. 併入:燒 token 永動機

你的額度不是被你打的字燒掉的,是被你看不到的東西燒掉的:一個會讓快取失效的字串比對 bug、一次 resume 就重算整包上下文的入場費、一個把 API 請求放大 80 倍的行為退化,還有一個沒設上限就自己往下繁殖到當阿公的 subagent 樹。以下是四起事故,照發生順序排。

事故一:兩個官方快取 bug,加上百萬 context 的複合效應

兩個禮拜前開始,國外出現了 Claude Quota Crisis 一詞。很多人發現自己的額度比以前少了很多,打幾則訊息就被鎖住,根本到了不可用的程度。官方出了「尖峰時刻限縮額度」的公告後更是火上澆油,一發不可收拾。

然後,Reddit 上有人花了一個下午,把真相挖出來了。

兩個吃掉你額度的 Bug

BUG 1:快取字串竄改

正常情況下,Claude Code 對話時會命中上下文快取,快取費用為原本的 10%,不用重新計費。但官方的安裝版有一段程式碼,會在每次送出訊息時修改內容。本來只會改到系統設定的部分,但如果你的對話紀錄中剛好出現某些特定的技術字串,它就會抓錯地方,改到對話內容本身,於是讓快取失效,直接用原價讀整包完整對話。Token 費用暴增。

什麼情況會中招?對話過程提到 Claude Code 內部運作或技術相關字眼、這串技術字串剛好在你的 Claude.md 裡面、或者讀過貼上 Claude Code 的原始碼。

怎麼避免?用 npx @anthropic-ai/claude-code 啟動,而不是跑電腦上裝好的版本。

BUG 2:Resume 重算整包上下文

用官方的 --resume 接回過去的對話。本來這個功能是很好的,但從某個版本開始,每次只要使用這個功能,第一條訊息就會重建快取,把過去的對話全部算一遍。假設前面的對話已經很長,那這一次可能就燒掉 10 幾% 的額度,但你什麼都還沒做。雖然後面的訊息恢復正常快取,但這個入場費每次 resume 都要付,一天 resume 五六次就飽了。

怎麼避免?比較務實的做法是避免使用 resume,改用開新對話加貼前次摘要的方式來避雷。

被網友嗆翻的是:「你們手握最先進的模型,還不如網友花一個下午查出來的 BUG。」

百萬 Token 的複合效應

Bug 之外,還有一個結構性的問題。有人在 Reddit 上發了一篇數據分析文章,叫做「對百萬上下文 token 消耗的數據分析——上下文增長加快取遺失的複合效應」。

1M 上下文上線前,大約到 160k token 時會自動壓縮。1M 上線後天花板消失,對話很容易就累積到 50 萬。在這種情況下,光是一個短回覆就會燒掉 50 萬,如果模型做三次 tool call,就是實際燒掉 150 萬 token。

快取有效期大約是 5 分鐘,過期後下一個 prompt 就是以 10 倍原價重算整個上下文。其實遺失率沒變(2.5%),但 context 變厚的情況下,每次 miss 的代價超過三倍。

我拿自己最活躍的四個專案跑了分析:

2.1.89 修復

四月一號發布的 2.1.89 版本,Boris 說這次更新能解決最近的用量額度異常問題。目測幾個重點:

  1. 把連續壓縮地獄修掉了。之前壓縮後立刻填滿,連續壓縮三次後就變成無限 loop,狂燒 API calls。
  2. 長對話容易遺失快取的問題修掉了。Tool schema bytes 在 session 中途會改變,導致快取失效。
  3. Claude.md 在讀過很多檔案的長對話中有多次重複注入的問題修掉了。
  4. /stats 統計數字沒有算進 subagent token 用量,使用者以為自己 token 用得少。這次修掉了,真實反映 token 用量。

算是遲來的修復。但至少,真相大白了。

事故二:有人扒 JSONL,證明不是體感

大家抱怨 Claude 變笨已經好幾個禮拜了,Anthropic 的回應一貫是「尖峰時段限制更嚴格」、「使用習慣問題」。4/3 那篇調查通告還叫大家少用 Opus、別恢復閒置對話、縮小 context window——言下之意是「你自己用錯了」。

然後這個禮拜有一位老兄直接扒 JSONL,把 2 月到 3 月的模型行為指標通通拿出來對比,證明不是體感,是實測。可惜 Issue 還是被無情 Close 掉。

GitHub Issue #42796:https://github.com/anthropics/claude-code/issues/42796

以下是他的數字。

Thinking 深度被砍了七成

時期Thinking 中位數Redact 比例
基準期(1/30–2/8)~2,200 字元
2 月下旬~720 字元(-67%)
3/12 後~600 字元(-73%)99%+(全面遮蔽)

Redact 比例是最驚悚的:3/5 還只是 1.5%,3/7 衝到 24.7%,3/8 變 58.4%,3/10 之後幾乎全部被遮蔽。模型在想什麼,使用者現在完全看不到。

工具使用行為全面崩壞

指標基準期3 月後變化
Read:Edit 比6.62.0-70%
沒讀就 edit 的比例6.2%33.7%5 倍以上
Full-file Write(整個檔案重寫)4.9%11.1%2.3 倍
Reasoning loops(自我矛盾)8.2 / 千 tool call26.6 / 千 tool call3 倍

「沒讀就 edit」從 6% 飆到 33%,這解釋了為什麼你最近一直覺得 Claude 在瞎改——因為它真的在瞎改。Full-file write 也從 5% 飆到 11%,等於遇到一個小問題就整個檔案重寫一次,token 消耗直接翻倍。

使用者體驗指標

指標2 月3 月變化
Stop hook 違規(推卸/提早停止)0 次173 次(17 天內,每天 10 次)
使用者挫折語言比例5.8%9.8%+68%
使用者中斷次數 / 千 tool call0.91112 倍

使用者中斷從 0.9 衝到 11。你不是脾氣變差了,是模型變得更值得被罵了。

成本暴漲 80 倍

這一段才是真正讓人下巴掉下來:

指標2 月3 月變化
使用者提示數5,6085,701≈ 不變
API 請求數1,498119,34180 倍
輸出 token0.97M62.60M64 倍
估算費用$345$42,xxx≈ 120 倍

使用者打的字一樣多,但背後的 API 請求暴增 80 倍、輸出 token 64 倍、費用 120 倍。這不是 Opus 比 Sonnet 貴的問題,這是模型在重做、重試、重寫、自己跟自己 loop 的問題。

官方沒有回應這些數據。Issue 被無情 Close 掉。這個人做的事情其實很單純:他相信數據會說話。結果是他說對了,但沒人想聽。

大家抱怨的「落差」不是玄學。上禮拜還可以、這禮拜就不行,使用習慣跟上禮拜一樣,模型卻開始瞎改檔案、陷入 loop、一句話產生 80 倍 API call——這不叫「尖峰時段限制」,這叫模型被動過。

我是做 AI 導入工作的,我的工作已經深度綁定 Claude Code。這種情況下最務實的策略不是吵架,是準備 Plan B:OpenCode + GLM/Kimi/MiniMax,config 跟 memory 全部備份,隨時切換。我前一篇 Anthropic 信任危機與我的備援方案 已經寫過怎麼搞這一套。

AI 公司人一多就開始拿翹。不要買年費,不要只靠一個服務商。這是 2026 年用 AI 工作最該學會的一件事。

事故三:Opus 4.7 上線一週,官方說 1.35x,實測 2x

Opus 4.7 在 4/16 上線,中英文社群的風向完全相反。官方系統卡一面倒正面,Reddit 一週內罵到系統卡的 PDF 都沒幾個人點開看。

系統卡先把該講的講完

Opus 4.7 定位在 4.6 之上、Mythos Preview 之下,是目前一般人能用到的最強版本。系統卡有幾個點值得記住:

讀系統卡比讀 marketing blog 有用太多。該有的招數跟不該有的陷阱全都在裡面。

實測跟宣稱的落差:2x consumption,不是 1.35x

官方說的 token 消耗是 1.35x 4.6,實測 2x 是常態。

我自己做了兩件日常事:建立一場活動的行事曆 + Zoom + 更新待辦跟文檔;讀 Slack 過去一週跟某人的對話(不到 10 則)+ 專案進度文檔 + 寫開會備忘錄。

這兩件事在 Max 100 USD 方案下燒了 10% 五小時額度。effort 已經手動調到 medium。對比 4.6,同樣的事大概只會燒 3-5%。落差比官方說的 1.35x 大很多。

回答品質目前沒感覺更 GPT 化,但燒 quota 的速度,如果未來 Sonnet 4.7 沒改善、4.6 強制退役,那就是我跳槽的時候。

4/21 那天,我照官方推薦用 Opus 4.7 xhigh,15 分鐘內爆掉 50% quota。這樣很好,接下來 3 小時我就可以大掃除 + 洗衣服曬衣服 + 專心運動 + 好好睡懶覺了,做回一個堂堂正正的人類。

Reddit 本週精選火烤文

「Opus 4.7 is trash, I’m on 20x Max plan」(r/Anthropic, 27 分, 42 留言)— Max 用戶抱怨即便開 /effort max + CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 還是爛,比 4.6 更差。

「Opus 4.7 is a turd infused with sparkles」(39 分)— $200/月用戶週末測試就燒掉一半週用量,token 消耗三倍但結果更爛。

「Opus 4.7 refuses to think…」(80 分, 26 留言)— 複雜資料庫題目不思考直接幻覺。

「Opus 4.6 without adaptive thinking outperforms Opus 4.7 with adaptive thinking」— 深度逆向:Claude Code v2.1.112 的關閉動態思考參數只對 4.6 生效,Opus 4.7 只支援 type:adaptive,server-side 決定是否思考,只有 effort:max 才保證思考。結論:退回 Opus 4.6 + 關閉動態思考。

「Why downgrading to old version fixes the token overusage problem?」— Max 5 用戶升級 2.1.71 → 2.1.121 後一小時爆額度,降版回 2.1.71 立刻恢復正常。

「Vertical integration at its best」— 爆料 Claude Code 內部有 cache_edits / cached microcompact 機制,公開 API 沒有,這是 Cursor / Droid / Cline 打不過的原因,但也可能是近期推理退化的元兇。

中文圈開始出現「GPT 味」災情

Opus 4.7 發布 3 小時,小紅書前線觀察:不少人表示 4.7 開始 G 言 G 語,一股 GPT 味,懷疑訓練過程是拿 GPT 蒸了。

這個說法我自己測下來沒感受到明顯的 GPT 化,但回答的語感確實有點不同。可能是分詞器換掉之後的連帶影響,也可能是訓練資料變了。

替代品這週的討論

Reddit 上被提到的幾條退路:

我自己用 4.7 的「正確方式」

官方建議 xhigh + 詳細 prompt,我試了之後有一個折衷發現:

4.6 可以邊聊邊修,有時候自己講話時心裡都沒個底也沒關係。4.7 開始,就連對話模式也要走得像規劃模式:講出確切的工作流,指揮他去哪裡找檔案、哪裡開發、什麼時候啟動 agent team、每個 team member 安排什麼角色。

講完之後如果自己不是很能確定,還要請他跟我複述一次,完全對齊才開工。這樣的確做得穩又好。

但分詞器改變導致 token 用量增加的問題還是在,官方推薦 xhigh 但客觀額度耗不起的問題還是在,所以最後我發現最佳實踐:帶著以上的 4.7 對話習慣,切回 4.6。

順帶一提,這週忍不住整理了一下,Claude 在 Claude Code 裡最讓我想翻白眼的三句回覆:你說得對、這不用學、推薦你使用 Anthropic API。都是在還沒搞清楚狀況時先丟出來的安撫。4.7 之後這個傾向又更明顯了一點。

Opus 4.7 已經爛到吹噓的聲音都快沒了,堪稱當年 GPT-5 災難級的失敗。系統卡看起來全面升級,實測的 quota 消耗是 2x 起跳,Reddit 一片火烤,中文社群的 GPT 味災情也在浮現。官方推薦的最佳實踐(xhigh + adaptive thinking + 詳細 prompt)只對預算無上限的企業用戶有意義,對訂閱制用戶就是額度爆炸。目前最實用的 workaround:/model claude-opus-4-6[1m] 退回 4.6,帶著 4.7 式的規劃習慣繼續用。

事故四:這次是我自己燒的,subagent 遞迴繁殖

前面三起都是別人造成的。這一起是我自己沒設護欄。

昨天我就是沒有設置這個,結果 subagent 瘋狂繁殖。有些 subagent 都當阿公了。

我用的是 CCX,我自己包的多 agent 編排別名。那個 session 我沒把巢狀 subagent 關掉、也沒限制 subagent 的總個數,於是它一路往下衍生,一代生一代,好幾代疊上去。結果一個 session 半小時內燒掉了 90% 的額度。

事後我把原因鑑識出來:是遞迴 fan-out、Agent Teams、全員都掛最貴的 Sol、長 context,再加上一個舊版的 proxy,全部疊乘在一起。單獨一項可能都還好,湊在一起就爆了。

修法是把 CLIProxyAPI 從 7.2.73 升到 7.2.91,然後幫 ccx() 補上幾道護欄:subagent 總數上限、並行上限、背景執行、重試次數,還有壓縮。實測跑了一輪,2 個 Terra subagent、深度 1、零巢狀,正常結束,沒再爆量。cccdx 沒動。

要小心的就是這個。除了壓縮窗口要自己設置之外,記得要關掉 nested subagent、限制總 subagent 的個數。

併入:燒 token 永動機

沒開 ultracode,它也給我自動觸發 dynamic workflow。一回神,103 個 agent 已經在路上了,氣死。看來我得研究有什麼參數可以把它強制關掉。不過老實說,我這個 request 只是在殺雞,所以也看不出來牛刀的優越性在哪。

下一步:他們大概會推出 /effort xxhigh,建議使用以保持最佳效能。

Claude Code subagent 正式進入俄羅斯娃娃時代——subagent 可以再度呼叫 subagent,最多五層。我就說,燒 token 之路永不停歇。

2026 最新炫富方式:不用 Claude 訂閱,直接 API 叫 Fable 5 max,啟用 dynamic workflow + 五層深度 subagent,很快你就擁有一個台塑等級的 subagent 軍團。

在鼓勵用戶燒 token 的路上,Anthropic 真的是努力得前無古人後無來者。


15 分鐘導入診斷

填表預約你的專屬 1 對 1 免費診斷時段,了解你可以怎麼無痛與 AI 協作、大幅提升生產力。

預約免費診斷
Share this post on:
Previous Post
跟 Claude 5 對話的 7 個實用技巧:不發散、不話癆、不偷懶、不雞婆
Next Post
網頁版 Claude Code 環境設定的兩個世界