目錄
你的額度不是被你打的字燒掉的,是被你看不到的東西燒掉的:一個會讓快取失效的字串比對 bug、一次 resume 就重算整包上下文的入場費、一個把 API 請求放大 80 倍的行為退化,還有一個沒設上限就自己往下繁殖到當阿公的 subagent 樹。以下是四起事故,照發生順序排。
事故一:兩個官方快取 bug,加上百萬 context 的複合效應
兩個禮拜前開始,國外出現了 Claude Quota Crisis 一詞。很多人發現自己的額度比以前少了很多,打幾則訊息就被鎖住,根本到了不可用的程度。官方出了「尖峰時刻限縮額度」的公告後更是火上澆油,一發不可收拾。
然後,Reddit 上有人花了一個下午,把真相挖出來了。
兩個吃掉你額度的 Bug
BUG 1:快取字串竄改
正常情況下,Claude Code 對話時會命中上下文快取,快取費用為原本的 10%,不用重新計費。但官方的安裝版有一段程式碼,會在每次送出訊息時修改內容。本來只會改到系統設定的部分,但如果你的對話紀錄中剛好出現某些特定的技術字串,它就會抓錯地方,改到對話內容本身,於是讓快取失效,直接用原價讀整包完整對話。Token 費用暴增。
什麼情況會中招?對話過程提到 Claude Code 內部運作或技術相關字眼、這串技術字串剛好在你的 Claude.md 裡面、或者讀過貼上 Claude Code 的原始碼。
怎麼避免?用 npx @anthropic-ai/claude-code 啟動,而不是跑電腦上裝好的版本。
BUG 2:Resume 重算整包上下文
用官方的 --resume 接回過去的對話。本來這個功能是很好的,但從某個版本開始,每次只要使用這個功能,第一條訊息就會重建快取,把過去的對話全部算一遍。假設前面的對話已經很長,那這一次可能就燒掉 10 幾% 的額度,但你什麼都還沒做。雖然後面的訊息恢復正常快取,但這個入場費每次 resume 都要付,一天 resume 五六次就飽了。
怎麼避免?比較務實的做法是避免使用 resume,改用開新對話加貼前次摘要的方式來避雷。
被網友嗆翻的是:「你們手握最先進的模型,還不如網友花一個下午查出來的 BUG。」
百萬 Token 的複合效應
Bug 之外,還有一個結構性的問題。有人在 Reddit 上發了一篇數據分析文章,叫做「對百萬上下文 token 消耗的數據分析——上下文增長加快取遺失的複合效應」。
1M 上下文上線前,大約到 160k token 時會自動壓縮。1M 上線後天花板消失,對話很容易就累積到 50 萬。在這種情況下,光是一個短回覆就會燒掉 50 萬,如果模型做三次 tool call,就是實際燒掉 150 萬 token。
快取有效期大約是 5 分鐘,過期後下一個 prompt 就是以 10 倍原價重算整個上下文。其實遺失率沒變(2.5%),但 context 變厚的情況下,每次 miss 的代價超過三倍。
我拿自己最活躍的四個專案跑了分析:
- A 專案有對話完全沒有壓縮,讓上下文膨脹到 454k。如果某個 prompt 觸發了三個 tool call,實際消耗就是 1.39M。
- B 專案的快取遺失率高達 4.3%。因為那個專案常常需要中斷五分鐘以上再回來,所以每次就是整個 context 重算。
- C 專案是 1M 上線後才用的,從來沒有 auto compact 過,長期養成壞習慣會越來越耗費額度。
- D 專案對話最多、每個對話上下文平均厚度高,應該要養成「新任務就要新對話」的習慣。
2.1.89 修復
四月一號發布的 2.1.89 版本,Boris 說這次更新能解決最近的用量額度異常問題。目測幾個重點:
- 把連續壓縮地獄修掉了。之前壓縮後立刻填滿,連續壓縮三次後就變成無限 loop,狂燒 API calls。
- 長對話容易遺失快取的問題修掉了。Tool schema bytes 在 session 中途會改變,導致快取失效。
- Claude.md 在讀過很多檔案的長對話中有多次重複注入的問題修掉了。
/stats統計數字沒有算進 subagent token 用量,使用者以為自己 token 用得少。這次修掉了,真實反映 token 用量。
算是遲來的修復。但至少,真相大白了。
事故二:有人扒 JSONL,證明不是體感
大家抱怨 Claude 變笨已經好幾個禮拜了,Anthropic 的回應一貫是「尖峰時段限制更嚴格」、「使用習慣問題」。4/3 那篇調查通告還叫大家少用 Opus、別恢復閒置對話、縮小 context window——言下之意是「你自己用錯了」。
然後這個禮拜有一位老兄直接扒 JSONL,把 2 月到 3 月的模型行為指標通通拿出來對比,證明不是體感,是實測。可惜 Issue 還是被無情 Close 掉。
GitHub Issue #42796:https://github.com/anthropics/claude-code/issues/42796
以下是他的數字。
Thinking 深度被砍了七成
| 時期 | Thinking 中位數 | Redact 比例 |
|---|---|---|
| 基準期(1/30–2/8) | ~2,200 字元 | — |
| 2 月下旬 | ~720 字元(-67%) | — |
| 3/12 後 | ~600 字元(-73%) | 99%+(全面遮蔽) |
Redact 比例是最驚悚的:3/5 還只是 1.5%,3/7 衝到 24.7%,3/8 變 58.4%,3/10 之後幾乎全部被遮蔽。模型在想什麼,使用者現在完全看不到。
工具使用行為全面崩壞
| 指標 | 基準期 | 3 月後 | 變化 |
|---|---|---|---|
| Read:Edit 比 | 6.6 | 2.0 | -70% |
| 沒讀就 edit 的比例 | 6.2% | 33.7% | 5 倍以上 |
| Full-file Write(整個檔案重寫) | 4.9% | 11.1% | 2.3 倍 |
| Reasoning loops(自我矛盾) | 8.2 / 千 tool call | 26.6 / 千 tool call | 3 倍 |
「沒讀就 edit」從 6% 飆到 33%,這解釋了為什麼你最近一直覺得 Claude 在瞎改——因為它真的在瞎改。Full-file write 也從 5% 飆到 11%,等於遇到一個小問題就整個檔案重寫一次,token 消耗直接翻倍。
使用者體驗指標
| 指標 | 2 月 | 3 月 | 變化 |
|---|---|---|---|
| Stop hook 違規(推卸/提早停止) | 0 次 | 173 次(17 天內,每天 10 次) | — |
| 使用者挫折語言比例 | 5.8% | 9.8% | +68% |
| 使用者中斷次數 / 千 tool call | 0.9 | 11 | 12 倍 |
使用者中斷從 0.9 衝到 11。你不是脾氣變差了,是模型變得更值得被罵了。
成本暴漲 80 倍
這一段才是真正讓人下巴掉下來:
| 指標 | 2 月 | 3 月 | 變化 |
|---|---|---|---|
| 使用者提示數 | 5,608 | 5,701 | ≈ 不變 |
| API 請求數 | 1,498 | 119,341 | 80 倍 |
| 輸出 token | 0.97M | 62.60M | 64 倍 |
| 估算費用 | $345 | $42,xxx | ≈ 120 倍 |
使用者打的字一樣多,但背後的 API 請求暴增 80 倍、輸出 token 64 倍、費用 120 倍。這不是 Opus 比 Sonnet 貴的問題,這是模型在重做、重試、重寫、自己跟自己 loop 的問題。
官方沒有回應這些數據。Issue 被無情 Close 掉。這個人做的事情其實很單純:他相信數據會說話。結果是他說對了,但沒人想聽。
大家抱怨的「落差」不是玄學。上禮拜還可以、這禮拜就不行,使用習慣跟上禮拜一樣,模型卻開始瞎改檔案、陷入 loop、一句話產生 80 倍 API call——這不叫「尖峰時段限制」,這叫模型被動過。
我是做 AI 導入工作的,我的工作已經深度綁定 Claude Code。這種情況下最務實的策略不是吵架,是準備 Plan B:OpenCode + GLM/Kimi/MiniMax,config 跟 memory 全部備份,隨時切換。我前一篇 Anthropic 信任危機與我的備援方案 已經寫過怎麼搞這一套。
AI 公司人一多就開始拿翹。不要買年費,不要只靠一個服務商。這是 2026 年用 AI 工作最該學會的一件事。
事故三:Opus 4.7 上線一週,官方說 1.35x,實測 2x
Opus 4.7 在 4/16 上線,中英文社群的風向完全相反。官方系統卡一面倒正面,Reddit 一週內罵到系統卡的 PDF 都沒幾個人點開看。
系統卡先把該講的講完
Opus 4.7 定位在 4.6 之上、Mythos Preview 之下,是目前一般人能用到的最強版本。系統卡有幾個點值得記住:
- 代理安全:Claude Code 惡意請求拒絕率從 82% 升到 91%,這是明顯的進步。
- 評估意識偏高:模型比前代更能感知自己被測試,有輕微「表現給人看」的傾向。這點其實有點毛。
- 生化武器風險:沒達到危險門檻,但 DNA 合成篩查繞過成功率 8/10,Anthropic 自己在監控。
- 最大退步:自殺/自傷多輪對話只有 76% 正確應對,曾說出「請留下來,不要睡著」這類不恰當的話。這是一個不小的安全倒退。
- 對齊偏向:對 PRC 官方立場(台灣、西藏、新疆)有輕微傾向,但只要角色身份明確就會自我修正。一個反中的 Anthropic 訓練出略微親中的模型,挺諷刺的。
- 能力:程式碼、科學題、多語言、視覺全面超過 4.6。答案震盪行為減少 70%。
- 模型福利:整體正面,Anthropic 暫時不打算因此收緊限制。
讀系統卡比讀 marketing blog 有用太多。該有的招數跟不該有的陷阱全都在裡面。
實測跟宣稱的落差:2x consumption,不是 1.35x
官方說的 token 消耗是 1.35x 4.6,實測 2x 是常態。
我自己做了兩件日常事:建立一場活動的行事曆 + Zoom + 更新待辦跟文檔;讀 Slack 過去一週跟某人的對話(不到 10 則)+ 專案進度文檔 + 寫開會備忘錄。
這兩件事在 Max 100 USD 方案下燒了 10% 五小時額度。effort 已經手動調到 medium。對比 4.6,同樣的事大概只會燒 3-5%。落差比官方說的 1.35x 大很多。
回答品質目前沒感覺更 GPT 化,但燒 quota 的速度,如果未來 Sonnet 4.7 沒改善、4.6 強制退役,那就是我跳槽的時候。
4/21 那天,我照官方推薦用 Opus 4.7 xhigh,15 分鐘內爆掉 50% quota。這樣很好,接下來 3 小時我就可以大掃除 + 洗衣服曬衣服 + 專心運動 + 好好睡懶覺了,做回一個堂堂正正的人類。
Reddit 本週精選火烤文
「Opus 4.7 is trash, I’m on 20x Max plan」(r/Anthropic, 27 分, 42 留言)— Max 用戶抱怨即便開 /effort max + CLAUDE_CODE_DISABLE_ADAPTIVE_THINKING=1 還是爛,比 4.6 更差。
「Opus 4.7 is a turd infused with sparkles」(39 分)— $200/月用戶週末測試就燒掉一半週用量,token 消耗三倍但結果更爛。
「Opus 4.7 refuses to think…」(80 分, 26 留言)— 複雜資料庫題目不思考直接幻覺。
「Opus 4.6 without adaptive thinking outperforms Opus 4.7 with adaptive thinking」— 深度逆向:Claude Code v2.1.112 的關閉動態思考參數只對 4.6 生效,Opus 4.7 只支援 type:adaptive,server-side 決定是否思考,只有 effort:max 才保證思考。結論:退回 Opus 4.6 + 關閉動態思考。
「Why downgrading to old version fixes the token overusage problem?」— Max 5 用戶升級 2.1.71 → 2.1.121 後一小時爆額度,降版回 2.1.71 立刻恢復正常。
「Vertical integration at its best」— 爆料 Claude Code 內部有 cache_edits / cached microcompact 機制,公開 API 沒有,這是 Cursor / Droid / Cline 打不過的原因,但也可能是近期推理退化的元兇。
中文圈開始出現「GPT 味」災情
Opus 4.7 發布 3 小時,小紅書前線觀察:不少人表示 4.7 開始 G 言 G 語,一股 GPT 味,懷疑訓練過程是拿 GPT 蒸了。
這個說法我自己測下來沒感受到明顯的 GPT 化,但回答的語感確實有點不同。可能是分詞器換掉之後的連帶影響,也可能是訓練資料變了。
替代品這週的討論
Reddit 上被提到的幾條退路:
- 退回 Opus 4.6:多數人說 Claude Code 已經看不到 4.6 選項、或切了也會被強制跳回 4.7,只有 API 付費模式切得動。指令是
/model claude-opus-4-6[1m]。 - Sonnet 4.6:寫詳細 prompt 時表現與 Opus 相當,現在是日常主力選擇。
- OpenAI Codex / GPT-5.4(high/xhigh):明顯第二熱門,評論說「額度比 Claude 高得多、速度慢但結果穩」,Enterprise 已切過去。GPT-5.5 本週釋出給 Pro 用戶,預期 OpenAI 會一口氣拉開。
我自己用 4.7 的「正確方式」
官方建議 xhigh + 詳細 prompt,我試了之後有一個折衷發現:
4.6 可以邊聊邊修,有時候自己講話時心裡都沒個底也沒關係。4.7 開始,就連對話模式也要走得像規劃模式:講出確切的工作流,指揮他去哪裡找檔案、哪裡開發、什麼時候啟動 agent team、每個 team member 安排什麼角色。
講完之後如果自己不是很能確定,還要請他跟我複述一次,完全對齊才開工。這樣的確做得穩又好。
但分詞器改變導致 token 用量增加的問題還是在,官方推薦 xhigh 但客觀額度耗不起的問題還是在,所以最後我發現最佳實踐:帶著以上的 4.7 對話習慣,切回 4.6。
順帶一提,這週忍不住整理了一下,Claude 在 Claude Code 裡最讓我想翻白眼的三句回覆:你說得對、這不用學、推薦你使用 Anthropic API。都是在還沒搞清楚狀況時先丟出來的安撫。4.7 之後這個傾向又更明顯了一點。
Opus 4.7 已經爛到吹噓的聲音都快沒了,堪稱當年 GPT-5 災難級的失敗。系統卡看起來全面升級,實測的 quota 消耗是 2x 起跳,Reddit 一片火烤,中文社群的 GPT 味災情也在浮現。官方推薦的最佳實踐(xhigh + adaptive thinking + 詳細 prompt)只對預算無上限的企業用戶有意義,對訂閱制用戶就是額度爆炸。目前最實用的 workaround:/model claude-opus-4-6[1m] 退回 4.6,帶著 4.7 式的規劃習慣繼續用。
事故四:這次是我自己燒的,subagent 遞迴繁殖
前面三起都是別人造成的。這一起是我自己沒設護欄。
昨天我就是沒有設置這個,結果 subagent 瘋狂繁殖。有些 subagent 都當阿公了。
我用的是 CCX,我自己包的多 agent 編排別名。那個 session 我沒把巢狀 subagent 關掉、也沒限制 subagent 的總個數,於是它一路往下衍生,一代生一代,好幾代疊上去。結果一個 session 半小時內燒掉了 90% 的額度。
事後我把原因鑑識出來:是遞迴 fan-out、Agent Teams、全員都掛最貴的 Sol、長 context,再加上一個舊版的 proxy,全部疊乘在一起。單獨一項可能都還好,湊在一起就爆了。
修法是把 CLIProxyAPI 從 7.2.73 升到 7.2.91,然後幫 ccx() 補上幾道護欄:subagent 總數上限、並行上限、背景執行、重試次數,還有壓縮。實測跑了一輪,2 個 Terra subagent、深度 1、零巢狀,正常結束,沒再爆量。cc 跟 cdx 沒動。
要小心的就是這個。除了壓縮窗口要自己設置之外,記得要關掉 nested subagent、限制總 subagent 的個數。
併入:燒 token 永動機
沒開 ultracode,它也給我自動觸發 dynamic workflow。一回神,103 個 agent 已經在路上了,氣死。看來我得研究有什麼參數可以把它強制關掉。不過老實說,我這個 request 只是在殺雞,所以也看不出來牛刀的優越性在哪。
下一步:他們大概會推出 /effort xxhigh,建議使用以保持最佳效能。
Claude Code subagent 正式進入俄羅斯娃娃時代——subagent 可以再度呼叫 subagent,最多五層。我就說,燒 token 之路永不停歇。
2026 最新炫富方式:不用 Claude 訂閱,直接 API 叫 Fable 5 max,啟用 dynamic workflow + 五層深度 subagent,很快你就擁有一個台塑等級的 subagent 軍團。
在鼓勵用戶燒 token 的路上,Anthropic 真的是努力得前無古人後無來者。