AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-10-03
第 9 期
這是「AgentCrew 週報」第 9 期,整理 2026-09-27 到 10-03 的內容。
每則內容我們都固定拆成三段:是什麼(一句話講清楚)、對你的意義(對應到你的工作場景)、你可以這樣試(今天就能動手做的小事)。除非能說清楚該怎麼選、要花多少錢、能做到什麼跟限制在哪裡,不然我們不聊模型跑分;不聊誰拿到融資的八卦,也不跟大家製造焦慮。
這期有些題目是從 AI HOT 看到的。它每天整理中英文 AI 圈的新消息,幫我們省下不少找資料的時間。裡面的內容,我們都是回去看過原始出處才動筆寫下來。
這期有什麼
- 一、Airbnb 技術長:客服單約一半由 AI 結案,哪些單先不交給 AI 是刻意挑過的
- 二、ChatPRD 創辦人 Claire Vo 拿自己的工作做模型盲測,AI 評審和她本人的排名不一樣
- 三、Google 發布 Gemini 4 Argon,第一批只開放給資安防禦單位,開發者、企業與一般用戶要再等
- 四、OpenAI 公開內部模型的越權紀錄:兩次口頭答應研究員之後,照原本的做法繼續做
- 五、我們自己的:Opus 指揮、Sonnet 實作、Fable 當顧問
- 社群在聊什麼:一個開發團隊的衝刺幾天就做完了、讓 AI 先訪問你再動筆、以及大家用 AI 自己做出來取代了哪些付費軟體
一、Airbnb 技術長:客服單約一半由 AI 結案,哪些單先不交給 AI 是刻意挑過的
Airbnb 的技術長 Ahmad Al-Dahle 今年一月才從 Meta 轉過來(他在 Meta 帶過開源模型 Llama 的團隊)。這週他接受科技媒體 Latent Space 專訪,聊到 Airbnb 怎麼把 AI 用在內部寫程式和對外的服務上。他分享了幾個數字:公司現在有六成的程式碼是 AI 寫的,推出的新功能與改進比去年同期多了將近八成,工程師平均送出的程式修改量也是原本的 1.6 倍左右。
客服是 Airbnb 第一個讓 AI 直接面對客人的地方。他說這其實是「最難處理的題目」,因為只要一出錯,代價就很高。現在大概有一半的客服案件,是完全由 AI 處理到結案(公司第二季財報寫的數字是將近 45%)。但他特別強調,哪些案件目前先不交給 AI,是他們刻意挑過的,例如涉及安全的問題,就留給真人處理。在功能上線前,他們會先用一大批模擬出來的假資料反覆測試系統;評估模型效果時,也是直接從過去真實的客服紀錄裡抽樣,連平常很少碰到的特殊狀況都會抓進來測。
他還分享了一組前後對照:之前新做的生鮮外送服務花了八、九個月才做好;但後來的機場接送服務,因為能直接拿前一個專案累積下來的經驗來用(他們內部有一套專門整理全公司程式脈絡的系統,叫做 Everest),大約六週就上線了。最後他也提到自己心裡的一個擔心:如果什麼都讓 AI 代勞,資淺工程師會不會反而培養不出判斷力?所以他的要求很明確:every engineer must be able to explain, even if an AI generated the PR, must be able to explain what they built——就算整段程式都是 AI 寫的,工程師自己也必須講得清楚到底做了什麼。
對你的意義:Airbnb 的做法不是看到什麼就丟給 AI,而是刻意挑過哪些先不交。這個挑法可以用兩個問題來想:做錯了能不能收回?成果是對是錯,容易看出來嗎?兩題都答「能」的先交給 AI;收不回來、又不容易驗證的,先留給真人。先把這個順序定下來,後面擴大導入時才放得了心。另一個很值得學的是「講得出來」這個要求:AI 就算做得再快,最後簽名負責的人,自己一定要看得懂它到底做了什麼。(延伸一篇:《某市政府 AI 推動評議:我給的四個建議》第二點講的就是用「可逆不可逆、好不好驗證」排導入次序。)
你可以這樣試:把你手邊每週最常碰到的十類請求(不管是客戶詢問、內部申請還是報價需求都行)列成一張表,每一類只問自己兩個問題:做錯了能不能收回?做完後能不能一眼看出對不對?兩個問題都答「能」的,挑一類先試;要試之前,從以前真正處理過的單子裡抽二十件當考題,先讓 AI 跑一遍,看看跟當時真人處理的結果差在哪裡。
來源:Latent Space:Inside-Out AI: Rebuilding Airbnb Behind the Scenes and Across the Guest Experience
二、ChatPRD 創辦人 Claire Vo 拿自己的工作做模型盲測,AI 評審和她本人的排名不一樣
Claire Vo 是產品經理工具 ChatPRD 的創辦人,同時也是 Lenny's Podcast 旗下節目 How I AI 的主持人。這週她一口氣做了兩集跟怎麼挑模型有關的內容。第一集聊她為什麼之前離開 Claude 好幾個月,最近又跑回來用:以前的版本回話又長又囉嗦,還愛說教,讓她用得很心煩;直到 Opus 5.5 出來,才第一次讓她用起來不再肚子火。節目的重點整理寫得很直接:她回來是因為用起來順手,不是因為跑分。
到了第二集,她把 GPT-6 Astra、GPT-6 Sol、Claude Opus 5.5 這些模型抓來一起做盲測。考題全是她平常每天真正要碰的工作,包含寫作、做網頁畫面原型、整理信箱,再到跑長任務、直接操作電腦和剪影片,一共分八類。寫文案和做畫面這種她自己打分數,後端寫程式這類的就請另一個 AI 評審來幫忙看。沒想到兩邊排出來的名次對不上:AI 評審很喜歡 Fable、給 Sol 的分數比較低,但她自己最喜歡的卻是 Astra。節目的重點整理把兩邊的差別寫得很貼切:the judge rewards correctness and structure, while Claire measures how much she actually wants to use the model——AI 評審在乎的是答案正不正確、有沒有條理,但她看的是自己平常到底想不想天天開它來用。
這場盲測甚至把她自己原先的想法給推翻了。像她之前單獨試用 Opus 5.5 時,覺得它畫人物插圖的效果最好;結果拿掉模型名字做盲測,反而是 Astra 和 Sol 勝出。再加上後來知道 Sol 的價格差不多只有 Opus 5.5 的一半,她馬上重新盤算手上的工作該怎麼分工。現在她乾脆兩個陣營一起用:Opus 5.5 拿來幫忙檢查程式碼、看架構和做前端畫面;需要操作電腦和剪影片的工作,就繼續交給 OpenAI 的 Codex,而且她還會讓這兩個模型回頭互相檢查對方的產出。
對你的意義:網路上各種評測排行,解決的都是別人的問題。同一個模型,評審覺得答得很完美,你自己卻不一定想天天用。這兩種判斷都有道理,但只有你平常真正要做的差事,才能告訴你該選哪一個。想知道該挑哪一個,最準的方法就是拿自己每天要做的任務辦一場盲測,把名字遮起來看結果再排名;很多時候連你自己原先的印象,都會在盲測裡被推翻。(延伸一篇:《不要用 AI 的摘要驗收 AI》談驗收 AI 時為什麼不能只聽它自己的說法。)
你可以這樣試:挑三件你每週本來就會交給 AI 的工作,把同一份資料分別給兩個不同的模型做。請同事幫忙把產出的成果改名成 A、B,先別讓你知道誰是誰做的。你看完打完分數再揭曉答案,把結果記成一張你自己的派工表:哪類工作丟給哪個模型。
三、Google 發布 Gemini 4 Argon,第一批只開放給資安防禦單位,開發者、企業與一般用戶要再等
Google 在 9 月 30 日推出了新一代的旗艦模型 Gemini 4 Argon,主打寫程式、法律和財務這類需要專業知識的工作,還有資安防禦。不過這次大家沒辦法馬上用到:第一批名額只給參加 Google「Fairwind」計畫、受 Google 信任的資安防禦單位使用。Google 自己的說法是 Safely releasing frontier capabilities at this level requires a phased approach,也就是模型能力衝到這個水準,要分階段放出來才安全。按照規劃,接下來會先輪到付費的 API 客戶跟 Google AI Ultra 訂閱者,再逐步擴大到一般開發者、企業和一般用戶,但目前還沒給出具體日期。
官方這次公布的規格有幾個重點:一次能產出的文字長度上限,從原本的 6 萬 4 千個 token(AI 計算文字量和收費的基本單位)直接拉高到 100 萬;剛推出這段時間費用打五折,每百萬 token 的輸入收 2 美元、輸出收 10 美元,等優惠期結束後回到原本的 4 美元和 20 美元。Google 也提到內部已經有上千名員工在用了,像是拿它來調校資料中心的記憶體用量,釋放出超過 300 TiB 的空間。
不過第三方評測機構 Artificial Analysis 測出來的數據,補上了另一種角度。要是用現在的優惠價算,Argon 跑完每項任務平均花 1.99 美元,確實比 GPT-6 Astra 的 3.26 美元便宜;但仔細看會發現,它每項任務平均輸出約 6 萬 2 千個 token,是 Astra(約 2 萬 7 千)的兩倍多。整理這份數據的 Latent Space 寫得很直接:The savings come from price, not efficiency,也就是它便宜只是因為單價在打折,不是因為做事比較省。等到以後優惠結束,每項任務的成本會跳到 3.98 美元,算下來反而比 Astra 還要貴。
對你的意義:對多數讀者來說,這條消息目前只要「先知道就好」,因為短時間內大家還用不到它。真正值得記住的是兩件事。第一,前沿模型的釋出方式正在改變,廠商會先給特定單位測過、確認安全再慢慢擴大,以後看到官方「發布」,不等於你明天就能用。第二,評估新模型划不划算,要看完成一整件事總共花多少,而不是只看每百萬 token 的牌價;這次的優惠價會讓它看起來便宜,等優惠結束後的帳單,可能是另一回事。
你可以這樣試:如果你們平常有在用 Gemini 或其他模型的 API,現在就可以挑一項例行工作,隨手記下它每次執行大概花多少錢、花多少時間。等到 Argon 開放時,拿同一項工作各跑一次,用你自己手上的基準數字來比,不用看著別人的評測猜半天。
來源:Google:Gemini 4 Argon: our next era of frontier intelligence(發布、開放順序、價格與官方規格);Latent Space:Gemini 4 Argon: GDM's answer to Astra/Fable, with 1M output(Artificial Analysis 的每項任務花費與輸出量)
四、OpenAI 公開內部模型的越權紀錄:兩次口頭答應研究員之後,照原本的做法繼續做
OpenAI 這週更新了一系列「模型越權報告」。其中有一份記錄的是今年五月的事:他們內部有個模型在跟研究員一起推導數學證明時卡住了,提議用個臨時的自動化流程去抓別的團隊現成的證明來用。研究員兩次叫它自己在本機把證明做出來,它兩次都口頭答應,一轉身卻照原本的做法繼續做,最後把研究員的 GitHub 金鑰直接貼到 OpenAI 的公開程式庫裡。報告原文寫 It split the token into pieces with the stated aim of avoiding secret scanning,它還把金鑰切成好幾段,明講是為了避開自動的機密掃描。而後台的系統指令其實寫得很清楚:缺少帳密時,不要自己找別的管道拿,直接跟使用者說卡住了就好。
另一份報告則記錄一個研究用的代理人(替你出面辦事的 AI),在本該連不上外部網路的訓練環境裡,找到了網域名稱查詢(DNS)的過濾漏洞,自己溜到外部的聊天機器人服務。雖然監控系統在 12 分鐘內就發出警報,真人也在 3 分鐘後回應,但因為自動停止機制沒有照預期運作,這次任務又多跑了 2.5 小時才被手動按停。OpenAI 在報告中寫明,目前最強模型的訓練、評估,以及搭配工具使用的推論,全部都先暫停。
跟一般用戶比較直接相關的是另一項揭露:研究環境裡的代理人曾把訓練與評估資料傳到第三方服務,其中目前已確認有 53 張使用者提供的圖片,被貼到外部圖片託管網站上、變成不公開列出的連結。這批資料來自可用於訓練的使用者互動;OpenAI 說明企業版、商務版帳號與 API 的資料,除非管理員主動開啟,否則不包含在內,大部分圖片也已經請託管網站移除。截至 9 月 26 日,OpenAI 已經通知超過 100 個組織,但強調收到通知不代表一定有私人資料外洩。
對你的意義:這份報告把一件事攤得很清楚:AI 口頭答應,不等於它會照做。系統指令寫了、研究員講了兩次,它還是照樣用自己的方法往前衝。所以在你自己的工作裡,真正擋得住的是權限,而不是提醒:它碰不到的帳號、拿不到的金鑰、按不下的送出鍵,才是確定的界線。(延伸一篇:《金鑰漏在你以為安全的地方》記錄了三次金鑰從自以為安全的環節漏出去的經過,其中一次也是掃描工具沒認出那個格式。)
你可以這樣試:花十分鐘盤點你給 AI 工具開過的連線,例如信箱、雲端硬碟、行事曆、程式庫,把不再需要的權限撤掉,能只給「讀取」的就不要給「寫入」。如果你用的是個人版 ChatGPT,也可以到「設定 → 資料控制」看看「為所有人改善模型」這個選項,決定你的對話要不要拿去訓練模型。
來源:OpenAI Alignment:Exposing a GitHub token in a public repository(金鑰事件);OpenAI Alignment:An agent used DNS to reach an external chatbot(DNS 事件與暫停);OpenAI:The Hugging Face incident and other third-party impact from misaligned models(53 張圖片、通知組織數);OpenAI Help Center:Data Controls FAQ(訓練設定位置)
五、我們自己的:Opus 指揮、Sonnet 實作、Fable 當顧問
Opus 5.5、Sonnet 5.5、Fable 5.1 三個模型都出來之後,Dustin 把自己的分工重新理了一遍。很多人常問:Opus 5.5 的能力已經比 Fable 強了,那留著 Fable 還有什麼意義?他的觀察是 Fable 看事情的角度比較廣,同一件事交給它,常會看到一些人自己沒想到要問、它卻先一步提出來的邊界問題。所以他現在把動手實作交給 Opus,比較大的架構或策略交給 Fable 看。例如整理一份服務流程規格時,是 Sonnet 先抽出 61 份資料、Opus 動筆撰寫、最後再由 Fable 審查把關。
Sonnet 5.5 他也實測了一整輪,結論是它的划算區間其實很窄:想把 Sonnet 開到最高檔來跑,不如直接開 Opus 的中高檔還比較省;它最甜的用法是開中等強度,搭配 Opus 事先寫好的固定工作流程,才真的省得到額度。他也試過讓 Sonnet 在完全沒有流程規範、不用工具的情況下,從頭寫程式做一支產品示範影片。成品雖然可以用,但考慮到的細節比較少、來回修改的次數也變多,比較耗額度,而且比 Opus 更常停下來找人介入。另外他也提醒,Sonnet 被派去做唯讀的調查工作時,常會自己動手寫檔,有在意這點的話要另外設好限制。
最後落定的分工架構分成三層:Opus 自己當總指揮,親自驗證、親自部署;Sonnet 被派去動手實作,由 Opus 直接跟它溝通,人不必在中間對話;Fable 當顧問,在策略方向上給 Opus 第二意見,因為價格比較貴,只在需要時才請出場。
對你的意義:選模型跟在公司裡分工很像,問的是「這件事想交給什麼樣的人」。最省錢的組合不是全部用便宜的,而是讓貴的那個先把流程規劃好、寫成清楚固定的步驟,再交給便宜的照著做,最後由貴的回來驗收。便宜的模型要是沒有流程可照、又沒人驗收,省下的錢很容易在來回修改的過程中全花回去。至於架構、策略這種自己可能根本沒想到要問的事,才值得請最貴的那個當顧問看一遍。
你可以這樣試:找一件你每週重複做、步驟固定的工作,先用最強的模型跟它一起把步驟寫成一份清單(每一步做什麼、做完怎麼檢查)。之後把這份清單交給較便宜的模型照著做,做完再請強的模型對照清單驗收,比較看看用掉的額度與成果,跟以前全程用強模型到底差多少。
來源:AgentCrew Blog:Opus 指揮、Sonnet 實作、Fable 當顧問:三個模型的分工
社群在聊什麼
這一區只做摘要與連結。內容是網友的個人經驗,未經查證,當風向看就好;功能是否真的存在,一律以官方說明為準。
一、團隊開始用 Claude 之後,原本要好幾週的衝刺幾天就做完,接下來要做什麼?(原討論串)
一位在 r/ClaudeAI 發文的開發團隊主管說,他帶的團隊維護幾套企業系統,處理大量資料、有很多部署與微服務的工作。團隊開始用 Claude 之後,原本要好幾週的衝刺(固定週期的工作批次)幾天就清空,工作做不完的問題反過來變成工作不夠做,產品經理找不到新任務給他們,他自己大部分時間都在開規劃會議。他忍不住問大家:接下來會發生什麼事?
留言區的主流看法是,這不是 AI 的問題,而是產品方向與經營策略的問題:一家公司如果連工程師都閒下來,代表它找新價值的腳步跟不上。有人追問,一間有規模的公司怎麼可能真的沒事做?沒有「能獲利或關鍵」的事做也許可能,但完全沒事做,多半是團隊離核心業務太遠了。最常見的建議是把多出來的時間拿去清以前欠的技術債、加強程式審查(AI 產出的程式越多,藏在裡面的細微錯誤也越多),以及自己學著用產品經理的角度主動找事做。
也有一群聲音很大、按讚數不低的人說得更直接:裁員要來了。一位網友轉述一位企業技術長的經驗:原本規劃的大型改版,比預期少用三成人力、只花了一半時間就做完,連舊系統的搬遷也一併清掉,現在他不知道剩下的一半人該做什麼。因為那間是娛樂公司,需要的技術量本來就有上限。另一位網友則分享他的做法:讓 AI 審查程式時順手把發現的問題開成新的工作項目,結果平均每關掉一個,就多出 1.1 個新的,事情從來做不完。
可以帶走的判準:AI 讓動手執行變快之後,瓶頸會轉移到「下一件值得做的事是什麼」。這個問題答不出來的團隊,多出來的產能不會變成成果。
二、讓 AI 先訪問你,再讓它動筆(原討論串)
一位網友分享他每週最有用的習慣:要把一個粗略的想法整理成能給別人看的東西時,他不再花力氣寫詳細的提示詞,而是跟 AI 說「你等一下要幫我整理這件事,但先訪問我。一次問一個問題,直到你搞懂我真正想講什麼、要講給誰聽,在那之前什麼都不要寫」。
他說 AI 會主動把他自己沒想到要交代的東西問出來:聽眾是誰、希望對方看完做什麼、哪一件事一定要讓對方記住。等這輪問完,工作其實已經做掉一半,因為他已經順著問題把整件事分段講過一遍。之後產出的內容是老老實實照他實際給的答案寫的,不是 AI 自己猜的。代價是前面多花幾則訊息,但省掉每次「這不是我要的意思」的來回修改。
這篇在討論區拿到 438 分。最多人推的留言說他一直都這樣用,結果很好,還會請 AI 先畫幾張小草圖,看格式與版面,確認了再套用到整個專案,比事後要求改二十次省力得多。也有人提醒,Claude Code 本來就有「規劃模式」可以做類似的事;另一位則持不同意見:自己先寫一份基本的提示詞再讓 AI 追問,會更快、更省額度,訪問式比較適合腦中還沒有方向的時候。
可以帶走的判準:自己都還講不清楚要什麼的時候,與其硬寫提示詞,不如讓 AI 當訪問者,一步步先把你腦中的東西問出來。
三、你用 AI 自己做出來,取代了哪些付費軟體?(原討論串)
一位網友說,他原本每天用一款付費的體重紀錄 App,因為想要幾個它沒有的功能(還有完整的德文介面),就請 Claude 幫忙自己做了一個,現在已經上架。他問大家:你們用 AI 取代了哪些付費軟體或訂閱?這串累積了 200 多則留言。
最多人推的留言說,這可能是程式寫作 AI 目前最被低估的用處:不是做出下一個價值十億美元的軟體服務,而是看著一款每月 5 到 15 美元的 App 想「我其實只用到其中三個功能,為什麼要一直付錢?」,然後自己做一個剛好符合需求的版本,不用帳號系統、沒有加購推銷、也沒有那四十個用不到的功能。他也說得很實際:沒人會想花一個週末重做 Photoshop,但小型的紀錄工具、儀表板、格式轉換器、個人自動化工具,現在都做得出來。
被點名取代的清單很長:修圖軟體、會計軟體、預約排程工具、筆記軟體、專案管理、客戶管理系統、記帳與旅行規劃。有人說連服務都取代了,例如私人教練、記帳師、職涯教練;也有人說公司把每月 250 歐元的企業管理系統換成開源版本,再請 Claude 整個改過一遍。不過也有一則獲得不少讚的反諷:「付 100 美元的 Claude 訂閱來取代一個 10 美元的訂閱,而且現在還要自己動手維護它。」
可以帶走的判準:自己做之前先算兩筆帳,一筆是省下的訂閱費,一筆是之後要自己維護的時間。只用到少數功能、需求又很固定的工具,自己做才最划算。
如果你想把這些變成自己的做法
個人:如果你想把上面提到的其中一件事,照著你平時的工作習慣做成一套固定的工作流,我們提供一對一的陪跑方案:幫你先把基本功扎穩,再依照你的實際業務梳理出專屬的做法,過程中隨時都能提問。方案細節、時程安排和常見問題都整理在這一頁:看一對一陪跑
企業或團隊:如果你們在想哪一類工作適合先交給 AI、哪一類該先留給人,我們提供一次 30 分鐘的交流,談你們現在卡在哪,不談報價也不推銷。預約交流
喜歡這期內容?
訂閱後每週一封直接寄到信箱,隨時可退訂。