AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-09-19
第 7 期
這是「AgentCrew 週報」第 7 期,整理 2026-09-13 到 09-19 的內容。
每則內容固定分三段:是什麼(一句話講清楚)、對你的意義(對應你的工作場景)、你可以這樣試(今天就能動手做的小事)。除非能講清楚選型、成本、能力或限制,否則我們不提模型跑分;不聊融資八卦,也不製造焦慮。
這期有些題目來自 AI HOT。它每天彙整中英文 AI 圈的新消息,省下我們很多翻找時間。所有內容我們都讀過原始出處才動筆。
這期有什麼
- 一、Vercel 說進來的業務詢問九成由 AI 處理,團隊從 10 人變成 1.25 人
- 二、GitHub 讓 AI 把四十三萬行程式改寫成另一種語言,連逐行比對也大多是 AI 做的
- 三、一個不輸出文字的新模型 Jev:只做分類、路由與評分
- 四、一位教授說:現在的模型能做的事,多數人還沒用到
- 五、三家企業因為一項資料保留政策,限縮了某個 AI 模型的使用範圍
- 六、我們自己的:AI 訂閱的預算該怎麼分
- 社群在聊什麼:32% 的公司今年不買現成軟體改自己做、有人發現用了 AI 會議記錄反而記不住事情、以及一串在吵同一家公司的三個工具到底差在哪
一、Vercel 說進來的業務詢問九成由 AI 處理,團隊從 10 人變成 1.25 人
Vercel 是一家做網站部署服務的美國公司。營運長 Jeanne DeWitt Grosser 九月在 The Information 的節目上講了他們自己的內部數字:主動找上門的業務詢問(inbound),有九成由 AI 處理掉;他們自己做的客服助理,處理掉九成三的客服案件。她的原話是 We had 90% automation of sales development for inbound. And our support agent that we've home-built handles 93% of all support cases.
負責這一段的團隊規模,從 10 個人縮到 1.25 個人。整套東西一年的基礎建設帳單,落在「個位數的幾千美元」;她把這支業務助理的投資報酬率算成 32 倍,原話是 Our sales development agent is a 32x ROI.
寫這篇的創投 Tomasz Tunguz 補了一句判斷:卡住的地方不是模型,是流程有沒有被寫下來(the bottleneck is not the model, it is the codified workflow)。同一批模型大家都買得到,差別在你有沒有把「這種詢問要怎麼回、要問哪三件事、什麼情況要轉給人」講成一份說明書。
對你的意義:這則真正的門檻不在預算,在於你們公司那套「老鳥都知道、但沒人寫下來」的判斷。AI 這個新來的同事學得很快,但你不會期待新人自己猜出公司規矩,你會寫下來教他。所以先別問「要買哪套工具」,先問「這件事的判斷標準,公司內部說得出來嗎」——說不出來的部分,換哪一家模型都一樣卡。(延伸兩篇:《大部分 AI 導入的效益,其實跟 AI 沒什麼關係》談為什麼效益常來自順手整理掉的流程;《我卡在 AI 導入的 2.5 階段》談從手動到自動中間最難的那一段。)
你可以這樣試:挑你們最常收到的三種客戶詢問,各找一封實際的往來信,把「我們當時是怎麼判斷的」寫成三到五行規則。寫完先不要接任何系統,拿這份規則去讓 AI 試回十封舊信,自己比對它跟當初真人回的差在哪。差在哪,通常就是你規則裡沒寫清楚的那一句。
來源:Tomasz Tunguz:The Single-Digit-Thousand Dollar AI SDR
二、GitHub 讓 AI 把四十三萬行程式改寫成另一種語言,連逐行比對也大多是 AI 做的
GitHub 九月公開了一份內部紀錄:他們把 Copilot 的核心程式,從一種程式語言(TypeScript)整個換成另一種(Rust)。原本大約四十三萬行,改寫完成後是八十多萬行。時間大約十四週半,五月做到八月,期間發了 135 個版本,平均一天 1.3 個。
關鍵的一句是分工:AI agents wrote most of the code, spanning 128 pull requests that landed in main——程式大部分是 AI 寫的,分成 128 批修改進到正式版。
審查那一層也不是靠人力硬扛。作者 Stephen Toub 把它拆成三段:The agents did the exhaustive old-versus-new comparisons; tests and static analysis checked mechanically enforceable properties; human reviewers concentrated on architecture, API contracts, risk, and any suspicious places surfaced by those other layers——逐行比對新舊行為由 AI 做,機器驗得出來的性質交給測試與靜態分析,人集中在架構、介面約定、風險,以及前兩層標出來的可疑處。他自己那句是 For my review, I focused on architecture, design, conventions, and approach.
他們也沒有隱瞞代價:過程中出現數十個已知的功能退化,後來逐一修好。出問題的地方集中在語意模糊、生命週期管理與搬一半沒搬完的部分。做法上他們不是一次整包重寫,而是一個元件一個元件換。
對你的意義:他們敢一路交出去,靠的不是有人特別厲害,是把審查分層:機器驗得出來的(跑不跑得起來、測試過不過、新舊行為一不一樣)就別用人去看,人只留在機器驗不了的那一層——架構、介面約定、風險。這裡也示範了一件常被忽略的事:抓自己錯誤的不能是原作者,要換一個沒有預設立場的第二方,即使那個第二方也是 AI。(延伸兩篇:《擔心 agent 失控?先在隔離環境逐步放手》談怎麼一步步放;《派更多 subagent 不會讓你更快》談瓶頸其實是審的那個人。)
你可以這樣試:拿你手上一件想交給 AI 的事,把檢查拆成兩欄:一欄是機器或另一個 AI 就能查的(數字對不對、格式對不對、跟上一版差在哪),一欄是只有你能判斷的(這樣做對不對、風險在哪)。第一欄別自己看,交出去;你的時間全部留給第二欄。
來源:GitHub Blog:Migrating the GitHub Copilot runtime to Rust
三、一個不輸出文字的新模型 Jev:只做分類、路由與評分
TypeSafe AI 九月發布了一個叫 Jev 的模型。創辦人 Diogo Almeida 是前 OpenAI 研究員,參與過 ChatGPT,也是 RLHF(用人的回饋來訓練模型的那套方法)的發明者之一。
它跟你熟悉的那些模型最大的差別,是它不寫字。TechCrunch 的描述是 It doesn't output text, but instead produces probabilities, or what the company calls "calibrated decisions."——它輸出的是機率,公司稱之為「校準過的決定」。你要先把可能的答案定義好(例如這封信是詢價、客訴還是垃圾信),它回給你的是各個選項的機率。因為選項是你先定的,它沒有編造新答案的空間。
用在哪裡:安全性判斷、信件分類、幫其他 AI 的輸出把關、決定一個任務該送給哪個模型、流程裡的自動判斷。TechCrunch 的結論是 Jev appears most useful for software automation。速度與成本是它的賣點——Vercel 的 Pranit Sharma 實測它比 OpenAI 的 Luna 5.6 快五到十八倍;計費方式也跟一般模型相反,輸出免費,輸入以十億個字元為單位計價而不是百萬(output tokens are free, and input tokens are metered by the billion, not the million)。另一份技術整理把它定位成 structured classifiers / judges / routing policies,也就是專門做分類、當裁判、決定路線這三件事。
限制要一起記住:它不是通用的語言模型,不能寫文案、不能陪你想事情,輸出格式必須事先定義。它替代的不是你現在用的助理,是你現在拿助理去做的那些一句話判斷。
對你的意義:很多人把最貴的通用模型拿去做「這是 A 還是 B」這種一秒鐘的判斷,一天幾千次。判斷與拍板那 10% 值得用最好的,剩下 90% 的分類與轉手該用便宜的——這則的價值不在它是新東西,而在它讓這條界線變得很好畫。(延伸一篇:《AI 的用量經濟學》談按量與訂閱的實際差別。)
你可以這樣試:先不必換工具。把你這週丟給 AI 的事情抓出來,圈出那些「答案只有幾個選項」的——分類、判斷要不要轉單、標記優先級。數一數它們佔了多少次數,那個比例就是你目前把貴的模型拿去打雜的程度。
來源:TechCrunch:A new kind of AI model from a ChatGPT inventor(人物、機制與計費);Latent Space:Jev, a System One Model(用途分類與倍數整理)
四、一位教授說:現在的模型能做的事,多數人還沒用到
華頓商學院教授 Ethan Mollick 九月寫了一篇文章,主題是他說的「能力懸差」:The capability overhang between what those models can do today and what most folks are using them for is massive——今天的模型做得到的事,跟大多數人實際拿它來做的事,中間差了非常多。
他舉了自己的三個例子。他把 1977 年的文字冒險遊戲 Zork 交給模型,讓它改寫成可以玩的 3D 動作冒險版本,連遊戲裡那隻怪物長什麼樣都由模型決定。他讓模型從影片與照片重建義大利作家艾可(Umberto Eco)在米蘭公寓裡那批藏書:模型辨識出約五千本書名,把它們安放在約兩萬七千個書架格位上,並替每一本標上「確定、推測、不確定」。他把自己即將出版的新書給模型,請它以「AI 的視角」做一支預告片,模型在 Blender 裡自己完成 3D 場景、腳本、配音、音樂與音效,花了四十五分鐘。
他的結論是限制換了位置:The constraint was always making enough stuff. Now making is fast and cheap.——以前的限制是產出不夠多,現在做東西又快又便宜,稀缺的變成你的專業知識、廣度、品味與主動性。
對你的意義:這則不是要你去做遊戲或預告片,而是提醒一件很實際的事——你能不能用得深,取決於你原本就懂什麼。任何協作卡住的時候,回到同一個問題:這件事人是怎麼做的、AI 是怎麼做的,差在哪一步。差在資料、差在判斷、還是差在你沒告訴它的那些常識,答案都不一樣。(延伸一篇:《大部分 AI 導入的效益,其實跟 AI 沒什麼關係》談效益從哪裡來。)
你可以這樣試:挑一件你做了很多年、閉著眼睛也知道好壞的事,出一題給 AI,然後用你的專業去挑它的毛病,一次講一個地方要它改。你會發現真正學到的不是提示詞,是「你的標準怎麼講給別人聽」。
五、三家企業因為一項資料保留政策,限縮了某個 AI 模型的使用範圍
the-decoder 本週整理了 The Information 的報導:Anthropic 在今年六月調整 Fable 的資料保留做法,宣布會保存三十天的使用紀錄,理由是需要用來防禦「複雜而新型的攻擊」。這項政策適用於所有 Fable 使用者,於是幾家大型企業客戶開始限縮用途。
三家的做法各不相同。Nvidia 把 Fable 限制在敏感度較低的工作,內部工作改用自家模型,該公司一位副總的說法是零資料保留應該預設開啟。國防與政府顧問公司 Booz Allen Hamilton 禁止員工在自家資安軟體相關的工作上使用 Fable,擔心的是模型「從我們的程式碼學走東西」。Palantir 則是暫停透過自家平台把 Fable 佈到客戶端,原文寫的是 Palantir is blocking Fable deployment through its own software to customers until Anthropic grants irrevocable zero-data-retention guarantees——要等到對方給出不可撤回的零保留保證為止。
後續是廠商修正:在客戶壓力與 OpenAI 八月的政策調整之後,Anthropic 於今年秋天推出對應方案,讓部分客戶可以自行保管安全紀錄。這篇也提醒了一件事:就算標榜零保留,中繼資料與技術性使用資料通常仍會被收集。
對你的意義:這裡真正變動的不是模型能力,是合約條款——而條款會在你沒注意的時候改。「我們沒有把資料送出去」是一個否定句,否定句不能憑印象,要有實際查證:查現行條款、查預設值、查你們這個方案適用哪一版。三家公司的反應也示範了不必全有全無:可以照用、可以只用在低敏資料、也可以先擋住等條件談妥。(延伸兩篇:《你的 AI 工具已經是攻擊媒介》談安裝前該做的檢查;《你的電腦才是攻擊面》談本機殘留的金鑰與隨手開的權限。)
你可以這樣試:列出公司目前在用的 AI 服務,每一個查三件事:現行方案的資料保留期限是多久、預設有沒有拿去訓練、條款改版會不會通知你們。查完把工作分成兩層——可以放心送出去的,與只能留在自己機器上處理的,先把第二層的名單寫出來。
來源:the-decoder:AI labs have a data trust problem that their policies havent solved(引述 The Information 報導)
六、我們自己的:AI 訂閱的預算該怎麼分
有人在社群上問 Dustin,市面上這幾家 AI 訂閱該怎麼分配預算。那篇回覆本週整理成文章,結論很短:付費買的不是額度,是判斷力。
原文的一句是:理由不是額度大小,而是他們家最大的優勢在 Fable。同一筆錢,一邊拿去買「幫你想清楚架構與意圖」的那顆模型,另一邊拿去買「便宜、耐操、負責執行」的組合——瀏覽器操作、電腦操作這類重複勞動,找性價比最高的那一個就好,不需要每件事都用最貴的。
這個分法其實跟人怎麼配團隊一樣:判斷與拍板的人少而精,執行的人手可以多。真正該省的是把貴的模型拿去做打雜的事。
對你的意義:把預算對齊分工,而不是對齊品牌。你花錢買的那 10% 是判斷——架構怎麼切、這個方向對不對;剩下 90% 的執行,誰便宜好用就用誰。實務上多數人的浪費不在買貴,而在整天用同一個工具做所有事,貴的拿去打雜、便宜的拿去做需要判斷的事。
你可以這樣試:把你這週交給 AI 的工作列出來,分成兩堆:需要判斷的(要不要這樣做、方向對不對)和純執行的(照著做、改格式、抄資料)。下週刻意換配置跑一次:判斷那堆用你手上最強的,執行那堆用最便宜的,月底看帳單與成果的差別。
社群在聊什麼
這一區只做摘要與連結。內容是網友的個人經驗,未經查證,當風向看就好;功能是否真的存在,一律以官方說明為準。
一、32% 的公司今年不買現成軟體了,改自己做(原討論串)
有人在 r/artificial 貼出麥肯錫《State of AI 2026》調查裡的一個數字:32% 的組織今年決定不買現成軟體,改用 AI 寫程式工具自己做一套;科技業這個比例是 41%。發文的人問的是實話問題——有沒有人真的因此砍掉一筆採購,還是這只是問卷上好看。
留言裡有人給了肯定的答案。一位管理者說他們今年砍掉好幾筆軟體採購,起因是團隊裡一位參與過選型的成員,用一個週末做出高度客製的工作流程,「連那些要另外花好幾千美元的企業版功能都有」。他原本一直是「買」派,今年改成「自建」派,但他也留了一條線:像法遵這種做錯代價很高的,還是買。
另一位的反問更值得記下來:那個 32% 旁邊應該再放一個數字——「一年後還在跑的有幾套」。他的說法是,做一個能展示的東西只要一週,難的是上游系統改了格式之後還維持正確;而那一段的成本,買現成的產品是幫你吸收掉的。他的結論是:也許誠實的說法是,公司只是把授權費換成了工程人力。另一位的實況介於兩者之間——沒有特地自建替代品,只是團隊自然而然不用了,所以今年是最後一次續約那套分析工具。
可以帶走的判準:自建划不划算,別看做出來的那一週,看接下來一年誰負責維護。
二、用了 AI 會議記錄之後,有人發現自己反而記不住了(原討論串)
一位上班族在 r/ChatGPT 說,現在每場會議都有 AI 在錄音轉逐字稿,公司甚至鼓勵大家不要再做筆記。結果他發現每次會議結束後幾乎想不起來講了什麼,連自己被指派了什麼事都要回去翻逐字稿。他後來改回一邊開會一邊手寫,哪怕要請對方停個幾秒,記憶力就回來了,而且會議品質也比較好,因為他注意到的東西變多了。
留言區分成兩派,但兩派其實不衝突。一派說這是科技一貫的樣子:以前大家背得出電話號碼、記得住路怎麼走,有了通訊錄與導航就不背了,這不代表變笨,是該換一套把筆記納進來的工作方式。另一位補充了關鍵的那一半:差別在注意力。做筆記的時候你不會逐字抄,你會判斷哪句重要才寫下來,而「當場處理過一次」本身就決定了事情有沒有被記住。
也有人是相反的處境:一整天背靠背的會議,以前的筆記回頭看根本想不起前後文,現在把逐字稿交給工具自動整理成待辦與追蹤單,反而好用;他也順帶說平台預設產出的會議摘要品質很差。另一種折衷做法是:照樣錄,但自己先寫一份,再問 AI「我有沒有漏掉什麼、哪裡前後矛盾」。
可以帶走的判準:AI 幫你留下紀錄,不等於幫你留下理解。需要你之後做判斷的會議,自己還是要動手寫下當下判斷了什麼。
三、同一家公司的三個工具,到底什麼時候用哪個(原討論串)
一位重度使用者在 r/ClaudeAI 問了個很多人都想問的問題:Cowork、Claude、Claude Code 這三個到底差在哪,他一直沒用過 Cowork,不知道自己是不是錯過了什麼。
留言裡被引用最多的是一個三句話的分法:聊天是「回答我」、Cowork 是「幫我做這件事」、Code 是「做一套會自己跑的東西」。另一位說他把 Cowork 當成請來處理專案雜務的顧問,Code 當成請來寫程式的工程師,兩者能力其實重疊,差在介面與預設配置適合誰。也有人給了很直白的決策樹:只是要答案、要查資料、改一份文件,用聊天;要動到一堆檔案、要它上網、要它有個地方可以開檔存檔,用 Cowork。
不過對這位發問者的結論是反過來的:他本來就熟悉終端機,所以幾位回覆者直接說,對他而言沒有非用 Cowork 不可的理由;比較常被提到的例外,是要讓它接手操作瀏覽器的時候。
可以帶走的判準:選哪個工具不是看功能表,是看你這件事要的是答案、是代勞,還是一套之後會重複跑的流程。
如果你想把這些變成自己團隊的做法
企業或團隊:我們提供一次 30 分鐘的交流,談的是你們現在卡在哪、哪一段適合先動,不談報價也不推銷。預約交流
個人:可以從錄影課開始,隨時能看,含一次 30 分鐘的一對一諮詢;想跟直播梯次的話是線上 Zoom 小班。看課程
喜歡這期內容?
訂閱後每週一封直接寄到信箱,隨時可退訂。