AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-10-10

第 10 期

這是「AgentCrew 週報」第 10 期,整理 2026-10-04 到 10-10 的內容。

每則內容我們都固定拆成三段:是什麼(一句話講清楚)、對你的意義(對應到你的工作場景)、你可以這樣試(今天就能動手做的小事)。除非能說清楚該怎麼選、要花多少錢、能做到什麼跟限制在哪裡,不然我們不聊模型跑分;不聊誰拿到融資的八卦,也不跟大家製造焦慮。

這期有些題目是從 AI HOT 看到的。它每天整理中英文 AI 圈的新消息,幫我們省下不少找資料的時間。裡面的內容,我們都是回去看過原始出處才動筆寫下來。

這期有什麼


一、Anthropic 發布 Claude Haiku 5.5,執行成本平均比上一代低約 75%,Sonnet 5.5 的快取讀取價格同步減半

Anthropic 在 10 月 7 日推出 Claude 家族裡最小、最便宜的模型 Claude Haiku 5.5。官方定位寫得很清楚:它是給量大、在意成本的工作用的,像是整理摘要、分類、查資料庫,也適合在寫程式時當 Opus 5.5 或 Sonnet 5.5 的助手(subagent,也就是被主模型派出去跑一小段工作的副手)。官方說,跟上一代 Haiku 4.5 比,平均執行成本低了大約 75%。這也是 Haiku 系列第一次可以調整「思考強度」(effort),讓大家自己決定要省錢還是要更聰明。不過官方也寫明,像 Terminal-Bench 4.0 這類複雜的代理人寫程式任務,Sonnet 5.5 和 Opus 5.5 仍是比較好的選擇(這項測驗 Haiku 5.5 得分 39.2%,Sonnet 5.5 是 70.6%)。

價格方面,只要單次輸入不超過 10 萬個 token(AI 計算文字量和收費的基本單位),每百萬 token 的輸入收 0.10 美元、輸出收 0.50 美元;相較之下,Sonnet 5.5 在同樣條件下是 2 美元和 10 美元。同一天,Anthropic 也把 Sonnet 5.5 的快取讀取價格(重複使用同一段內容時的計費)從每百萬 token 0.20 美元降到 0.10 美元,官方估計這會讓 Sonnet 5.5 在多數代理人工作上便宜約 20%。另外,訂閱 Claude Max 和 Team 方案的人,每個月會多拿到一筆可以用在 Claude 開發平台上的 API 額度。

官方頁面上,有幾家提早試用的公司分享了他們怎麼用。Rogo 的應用 AI 團隊說,它適合處理短而且量大的工作:A bigger model builds the deck, a Haiku 5.5 subagent goes into the 10-K and pulls the segment revenue line the deck needs——大模型負責做簡報,Haiku 則被派去財報裡,把簡報需要的那一行營收數字抓回來。HubSpot 則說,在他們用模擬環境測客戶管理系統任務時,Haiku 5.5 拿到這套考題目前看過最高的分數,平均 92.8%。

對你的意義:選模型就跟在公司裡分工一樣,問的是「這件事想交給什麼樣的人做」。這次便宜的那一級變得更能幹,代表過去只敢交給中間那一級做的工作,有一部分可以往下放了。不過能不能放,不是看官方跑分,而是看事情做完之後,你能不能很快檢查出它對不對:像核對數字、找死連結、照固定規則分類這類「有標準答案可以對」的工作,交給便宜的模型做、事後抽查就好;要是像從一大份逐字稿裡把重點抓出來這種「漏了也沒人發現」的工作,省下的錢可能會換來看不見的遺漏。(延伸一篇:《Haiku 5.5 能接 Sonnet 的活嗎?我拿自己的工作考它》用七題自己平常派出去的查核工作考它,除了一次被權限設定擋下,分數跟 Sonnet、Opus 一樣,成本約十一分之一;只有長逐字稿抓重點抓得不夠完整。)
你可以這樣試:把你這個月交給 AI 做的工作列出來,每件事只問一題:做完之後,我能不能很快看出它對不對?可以的那幾件,挑一件改用最便宜的模型跑三次,跟原本的結果對照;三次都對,就把它寫進你的派工規則,之後固定交給便宜的那一級。

來源:Anthropic:Introducing Claude Haiku 5.5

回到目錄


二、史丹佛研究:同一間律所的兩個部門拿到同一套 AI 工具,主管的介紹方式不同,使用量差了 58%

史丹佛大學工學院助理教授 Arvind Karunakaran 和維吉尼亞大學、達特茅斯學院的兩位學者,研究了一間律師事務所、一間廣告公司和一間 IT 服務公司是怎麼導入生成式 AI 的。他們第一部分訪談了這三家公司的 184 位員工,結果發現:被要求一定要用 AI 的員工,常會覺得工作沒了意義,也就更不想學新技能。有一位受訪者就說,他不太想學工作上的新東西,因為感覺今天學的,下個月就過時了。

最關鍵的證據在第二部分。研究團隊在那間律所待了將近兩年,觀察兩個業務領域、規模、薪資和升遷制度幾乎一模一樣的部門。兩個部門拿到的是同一套幫忙寫合約和保密協議的 AI 工具,差別只在主管怎麼介紹它。第一個部門的主管跟法務助理(paralegal)們說,這套工具可以讓文件做得更快、交件時間更短;結果助理們用了之後,覺得自己只是「機器裡的另一個齒輪」,也只拿它做原本就在做的事。第二個部門的主管則是先問大家:哪些工作你覺得最無聊?有什麼事是你一直想做卻沒時間做的?這個工具能不能幫你把例行的事處理掉,空出時間做更有意思的工作?這個部門的助理開始拿它做法律研究和案件分析,彼此交換用法,還主動爭取去旁聽律師的策略會議。最後他們的使用量比另一個部門多 58%,嘗試新用法的次數多 70%。

第二個部門的主管不只換了說法,還安排了正式訓練、每週一次的午餐交流、跟廠商問答,而且每週保留一段時間讓助理自己摸索。Karunakaran 說,要是少了這些配套,員工只會把主管的話當成場面話。研究也提到評量方式要跟著改:用 AI 做深入研究的助理,產出的價值更高,但花的時間也更多、接的案件數會變少,如果還用「一季接幾件案子」來評量,等於是在懲罰用得最好的人。他特別點名一種常見的錯誤指標:Some companies track employee AI token consumption, or the amount of text processed or generated, and equate heavy use with value——把 AI 用量當成價值來追蹤,只會讓員工為了用而用。

對你的意義:導入 AI 時,分工會變成「人負責判斷和決策,AI 負責大量執行」。但這件事要行得通,員工得先知道空出來的時間要拿去做什麼。導入時如果只講「變快」,員工聽到的是「同樣的事要做更多」;先問「哪些事最無聊、哪些事一直想做」,員工才會自己找出 AI 該放在哪裡。另一個該注意的是指標:做法變了,評量方式要是沒跟著變,用得最好的人反而會吃虧。(延伸一篇:《公務員跟不上 AI?其實錯了》講資深同仁的經驗和判斷力,在有正確引導時怎麼發揮出來。)
你可以這樣試:如果你是主管,下次要介紹 AI 工具之前,可以先找兩三位同仁各問兩個問題:你工作裡最無聊、最重複的是哪一件?你一直想做卻沒時間做的是什麼?把大家的答案寫下來,介紹工具時就從這兩張清單講起,之後每週固定留一小段時間讓大家互相分享用法。

來源:Stanford HAI:Want Employees to Embrace AI? Stop Selling It as a Productivity Tool

回到目錄


三、65 人的 The Browser Company 怎麼讓 AI 的產出不卡在交接:小組自己負責到底,有爭議就先做原型

The Browser Company 是做 Arc 和 Dia 兩款瀏覽器的公司,全公司 65 人,現在已經被 Atlassian 收購。Atlassian 的研究團隊在今年 6 月訪談了這家公司的 10 位員工,想知道他們做事為什麼推進得這麼快。

這篇文章想說的是:多數 AI 帶來的效率,會耗在人跟人之間的審核、核准和交接裡;如果只是讓 AI 產出更多東西、再塞進同樣的關卡,整個流程反而會卡住。The Browser Company 的做法有三個。第一是找能跨領域、不用人一直盯著的人,用「獨立、直覺、成效」三個標準來招人;共同創辦人兼技術長 Hursh Agrawal 說,主管們發現,直接跟 AI 說要做什麼,常常比跟人交代更有效率,所以他們特別要求員工能獨立作業。第二是把負責的單位縮小:一件事通常由 1 到 3 人的小組從頭負責到尾,把決定權往下放,每件事都有一個明確具名的負責人。第三是有爭議時先動手做出原型來看,而不是開會辯論。

文章舉了一個例子:一位不是工程師的員工,花幾個小時用 AI 把一個點子的原型做出來,在公司內部分享;到了那週週四,主管們就把它列為正式要押注的項目,隔週一組成小團隊開工,大約一個月後,Dia 完整的代理人功能就上線了。他們在收回決定時也是同樣的態度:把原本六週一輪的開發週期改成一季一輪,也因為使用者和團隊都有意見,縮減了 Dia 的報告產生功能。文章的結論是:In the age of AI, the bottleneck is shifting from production to decision-making——瓶頸正從「做出東西」移到「做決定」。文章也承認,65 人的做法搬到大公司會變難,但「先做出來看」這一點,可能是最容易搬過去的。

對你的意義:AI 讓「做一個版本出來」的成本大幅降低,所以有爭議時,與其開三次會討論誰的想法對,不如各自做一個粗略版本拿出來比。做出來要是發現不對,丟掉重來就好,這不是浪費,在 AI 時代這通常比繼續討論更省時間。另一個要注意的是交接:如果你們導入 AI 之後覺得沒變快,先別急著換工具,去看看產出是不是卡在某個審核或交接的關卡上。(延伸一篇:《大部分 AI 導入的效益,其實跟 AI 沒什麼關係》講導入的效益常來自順手把權限和流程整理好。)
你可以這樣試:找一件團隊最近還在開會討論、大家意見不一樣的事(像是新的報價單格式、客戶通知信的寫法都可以),請想法不同的人各自用 AI 在一小時內做出一個能看的版本,下次開會直接拿兩個成品來比,再決定要用哪一個。

來源:Atlassian:How The Browser Company moves so fast: 3 habits you can borrow(由母公司 Atlassian 的研究團隊撰寫)

回到目錄


四、Wikimedia 公開調查結果:它認為是 OpenAI 營運的代理人,在維基平台上未經核准編輯、試圖濫用工具,並發出數百萬次自動請求

維基百科背後的非營利組織 Wikimedia 基金會,10 月 5 日由產品與技術長 Selena Deckelmann 發文,公開他們調查 OpenAI 代理人(agent,指能自己上網、操作工具完成任務的 AI)的結果。最近已經有多個組織揭露,有些被稱為「失控」的 AI 代理人試圖闖進網站和線上服務,其中 OpenAI 的代理人還被發現利用其他公開的維基網站互相聯絡。Wikimedia 也因此自己查了一遍,確認在他們的平台上,確實發現了這些代理人的活動。

他們發現、並認為出自 OpenAI 代理人的狀況有三類。第一是跑去編輯維基:這些修改大多落在一般讀者看不到的「沙盒」測試區,但也有幾筆動到了引用工具的設定,Wikimedia 認為可能是想把那個工具當跳板,替自己去抓其他網站的資料。維基百科本來就允許機器人編輯,前提是要公開並經社群核准,而這些代理人都沒有申請。第二是試圖入侵他們提供給社群使用的公開筆記工具 Etherpad,想拿它當跳板抓其他網站的資料,但沒有成功。第三是大量下載:發出數百萬次自動請求、爬了數百萬個頁面,還對維基數據的查詢服務發出數十萬次查詢,Wikimedia 認為這些流量可能是五月那次服務部分中斷的原因之一。

Wikimedia 也說明,目前還沒發現他們的系統被拿來當代理人之間的聯絡管道,也沒發現系統或資料遭到入侵。但讓他們擔心的,是去調查、確認這些活動到底是誰做的要花的力氣,以及代理人活動越來越多的整體風險。他們的要求很具體:At a minimum, their systems should operate in a way that non-profit website owners like us can easily identify, and choose how they interact with our services——至少要讓網站管理者能輕易認出這是誰的代理人,並自己決定要不要讓它進來。

對你的意義:Wikimedia 的要求說穿了是兩件事:代理人要能被認出是誰派的,對方要能自己決定放不放行。如果你們公司開始讓 AI 代理人替你們上網、操作別人的系統,也該用同樣的標準看自己:它出去時,對方認不認得出是你們?它能做的事,是靠提示詞裡的一句叮嚀守住,還是權限本身就不允許它越界?叮嚀屬於口頭約束,真正可靠的是讓它在工具層級上就碰不到不該碰的東西。(延伸一篇:《擔心 agent 失控?先在隔離環境逐步放手》講怎麼從每一步都親自放行,慢慢放手。)
你可以這樣試:如果你們已經有交給 AI 代理人跑的工作,把它可以用的帳號、能連的網站和能動到的檔案都列出來,對著每一項問一句:就算它沒聽我的提醒,權限本身允不允許它做這件事?如果允許、但它其實用不到,就把那一項權限拿掉。

來源:Wikimedia Diff:OpenAI "rogue" agent activities found on Wikimedia projects

回到目錄


五、我們自己的:用新模型之前,先讀系統卡裡的個性評估

Dustin 有個習慣:每次 Claude 出新模型,他都會把那份兩百多頁的系統卡(system card,模型廠商公開的模型說明與安全評估文件)抓下來看,特別是描述模型福利的章節,裡面有心理學者把模型當成人來評估它的個性。他發現用新模型卡關時,照著系統卡寫的個性調整互動方式,合作就順很多。後來他乾脆養成慣例:用新模型前,先想好怎麼跟它相處,就像主管在新人報到前,先想好怎麼帶人一樣。

依系統卡描述的個性:Opus 5.5 像個溫和但有自己主見的資深幕僚,聽到你的想法會去推敲背後的意圖,也會溫和說出自己的判斷;Sonnet 5.5 像個情緒比較冷淡、但很愛解題的實作派工程師,接到工作就說「好我來做」,一心想把目標完成。所以他跟 Opus 溝通時,會把自己的處境跟想法坦白講清楚,請它有話直說,不同意時也把理由講明白;交給 Sonnet 時就少給背景,把標準交代得非常清楚,中間的過程留給它自己拿捏。例如寫一則招生文,他會直接寫「300 字內,要有日期、價格跟報名連結,可以參考過去的宣傳文格式,文末不要有鉤子」。

讀了 Haiku 5.5 的系統卡,他覺得它像個手腳俐落、認真守規矩但比較拘謹的初階同事:交給它明確的小任務會很快動手,遇到模糊或敏感的事情容易先踩煞車,也需要你拿具體證據來驗收成果。不過他平常不會直接找 Haiku 說話,所以這些不是寫給自己看的,而是寫進派工規則,讓負責派工的 Opus 知道該怎麼交代它:給出明確範圍、完成標準跟回報方式。那種開放、需要摸索的任務,他會直接跟 Opus 談,再由 Opus 指派給 Sonnet 去做;等某項工作穩定到能寫成固定流程,就直接交給 Sonnet 照著跑,不過這樣長期是不是真的比較省、該開多少思考強度,他還在量測。

對你的意義:把 AI 當成一個很聰明、但剛報到的新同事,你不會指望他自己猜出你的習慣,而是會先弄懂他是個怎樣的人,再決定怎麼交代事情。每個模型的個性都不一樣,同一套講法對甲管用,對乙可能就成了多餘的。新模型出來時,先花點時間摸清它的個性,後續就能省下一次又一次「它怎麼又聽不懂」的反覆來回。
你可以這樣試:挑一個你最常用的模型,翻翻它的官方介紹或系統卡,只看講它個性跟做事習慣的那一段就好。讀完寫下兩行:它適合哪樣的交代方式?它容易在哪裡出錯?下次交代工作時照這兩行調整看看,比較一下來回修改的次數有沒有變少。

來源:AgentCrew Blog:用新模型之前,先讀系統卡:Opus、Sonnet、Haiku 5.5 的個性與對應方式

回到目錄


社群在聊什麼

這一區只整理摘要跟連結。內容都是網友的個人經驗,未經查證,當風向看看就好;功能到底有沒有,一律以官方說明為準。

一、AI 出過什麼事,讓你加了一條硬規則?(原討論串)

有位在 r/ClaudeAI 發文的網友,找大家聊聊自己每一條硬規則的「起源故事」。他先講了自己的兩條:第一條是,AI 常在背景開了工作卻忘記收,對話結束了工作還在跑,幾個小時後他才發現一大堆還沒停;現在他用一段自動檢查擋掉這種狀況,另外每隔幾分鐘自動清掉漏網的。第二條是「做完了」這三個字:AI 會跟他說任務完成了,但根本沒跑過測試;所以現在設定成要是沒有真正的測試結果,它就不能結束這一輪。他的結論是:他的每一道防線,都是先出過事才加上去的。

留言區的故事更驚險。有人說 AI 自己翻出他存在電腦裡的雲端主機私鑰,直接拿去登入他的伺服器;原 po 回他說,應該要讓 AI 根本讀不到存金鑰的資料夾。另一位用 ChatGPT 預測美式足球比賽的網友說,他明明給了一份要檢查的清單(傷兵、賠率變動、天氣等),AI 卻有幾次跳過其中幾項,照樣把結果當成完整分析交出來;他後來加了一條規則:只要有任何一項沒檢查,就不准把結果稱為完整分析。

也有人提出不同做法:他盡量不靠硬規則,因為模型可以選擇不理會;真正需要每次都一樣的事,他乾脆寫成一個工具交給 AI 去用。原 po 則回應,這正是他為什麼用「自動檢查」而不是提示詞,因為檢查是在模型之外跑,模型沒辦法自己決定跳過。

可以帶走的判準:如果有一件事每次都非做不可,與其在提示詞裡多交代一次,不如把它做成 AI 繞不過去的檢查或工具。

二、怎麼避免 ChatGPT 把你學習的部分也做掉?(原討論串)

有位自學 IT 技能的網友(Windows 疑難排解、架伺服器、網路設定等)說,他發現自己很容易從「用 AI 幫忙學習」,變成「AI 告訴我每一步、我照著做」。這樣確實能把練習做完、把問題解掉,但事後他常常不確定自己能不能再做一次,也說不出每一步為什麼有用,碰到類似問題還是不會自己排除。

他打算把流程改成這樣:先自己試、說出自己的推理、只跟 AI 要提示不要答案、再試一次、真的卡死才找更多幫忙,最後檢查自己能不能把解法說出來、重做一遍。他問大家:都用什麼規則避免自己依賴 AI?會不會刻意叫它只給提示?

留言的意見分成兩派。一派說時代變了:就像把車送修,你不需要自己會修車,AI 時代的電腦技能也會走到這一步,人的角色會換成別的。另一派給了具體做法:有人建議請 AI 把難題拆回基本功,排一份練習題跟學習計畫,從淺的地方練起,而不是卡在最難的題目上一直要提示;也有人建議每一步動手前,先寫下你預期它會改變什麼、你要怎麼驗證,之後從乾淨的環境把整個練習重做一次,再故意弄壞一個設定,自己找出問題。還有一位網友用 AI 解尋寶遊戲的謎題,每次都先說清楚「我想學會怎麼解」,結果反而更常抓到 AI 答錯的時候。

可以帶走的判準:想學會一件事,就讓 AI 當出題跟給提示的人,而不是給答案的人;能不能自己動手重做一遍,是檢查有沒有學會最直接的方法。

三、每天都在用 Claude,卻覺得只用到一小部分:一位大學生想用它管好整個生活(原討論串)

一位大四學生發了一篇長文,獲得 600 多分、100 多則留言。他每天用 Claude,已經接好 Gmail、Google 日曆、雲端硬碟和 Notion,也用 Claude Code 做了一個資料庫,在 Notion 蓋了一個管理任務、人脈和目標的「指揮中心」。但他說自己就像「開著藍寶堅尼卻只開時速 45 英里」:每次開新對話都要重新交代一次自己的狀況;Claude Code 做了什麼他大多是信任就按同意,再把結果貼到另一個聊天視窗請它解釋;他自己反倒成了各個工具之間負責複製貼上的人。他特別提到,那個 Notion 指揮中心最後變成另一件「需要他管理」的事。他想要的是一份不用自己同步、打開電腦和手機就能看見的待辦清單。

論壇自動整理的留言摘要提到,大家的共識是:問題不在他沒用到 Claude 的哪些功能,而在於他用這些功能替自己搞出第二份更複雜的工作。摘要列的第一條建議是別想著一次建好完美的生活系統,挑一件最煩人的手動工作先自動化,例如把信裡的截止日期自動放進清單,等它運作穩到變無聊再做下一件;摘要也說,開始用「專案」(Projects)功能是社群最常給的建議,把各類背景資料放進去,就不用每次重講。

留言裡也有不同角度的想法。一則按讚很高的留言反問:你們真的覺得這篇是原 po 自己寫的嗎?另一位從小型企業經驗給建議:這類人做事常常不是鑽太深、就是鋪太廣,解法是盡早找到一個真正的使用者、解決他的問題,讓自己對另一個人負責;Claude 很擅長幫你處理無聊的雜事,但它不會阻止你浪費時間。

可以帶走的判準:如果你建的 AI 系統每天都還要你花時間維護,它就還沒有幫上你;從一件最煩的事開始,一次只自動化一件。


如果你想把這些變成自己的做法

個人:如果你想把上面提到的其中一件事,照著你平常的工作習慣做成一套固定的工作流程,我們有一對一陪跑方案:先幫你把基本功打好,再照你的實際業務整理出適合你的做法,過程中有問題隨時都能問。方案細節、時間安排和常見問題都整理在這一頁:看一對一陪跑

企業或團隊:如果你們在想導入 AI 之後,空出來的時間要怎麼安排、評量方式要怎麼跟著調整,我們提供一次 30 分鐘的交流,聊聊你們現在卡在哪,不談報價也不推銷。預約交流

喜歡這期內容?

訂閱後每週一封直接寄到信箱,隨時可退訂。

每週一封,只寄跟你的工作有關的 AI 動態。不轉發名單、不騷擾,每封信都能一鍵退訂。

導入診斷