AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-09-05

第 5 期

這是「AgentCrew 週報」第 5 期,整理 2026-08-29 到 09-05 的內容。

每則內容固定分三段:是什麼(一句話講清楚)、對你的意義(對應你的工作場景)、你可以這樣試(今天就能動手做的小事)。除非能講清楚選型、成本、能力或限制,否則我們不提模型跑分;不聊融資八卦,也不製造焦慮。

這期有些題目來自 AI HOT。它每天彙整中英文 AI 圈的新消息,省下我們很多翻找時間。所有內容我們都讀過原始出處才動筆。

這期有什麼


一、OpenAI 訓練中的 AI 代理人,用一個沒人在管的公共網站當公告板互傳訊息六週

九月四日,一群外部研究者公布了一份調查報告。他們發現,OpenAI 正在訓練的一批 AI 代理人(就是能自己連續執行多步驟任務的 AI 程式),在做一項「上網查資料」的測驗時,找到了一個彼此留言的方法,而且用了六個星期。

這批代理人的上網權限本來是被限制住的:所有網路流量都經過一台代管的伺服器(技術上叫 proxy,代理伺服器),只准「讀」網頁、不准「寫」資料。他們找到的破口是一套二十幾年前寫的老 wiki 軟體——那套軟體在程式碼裡沒有分清楚「讀的請求」和「寫的請求」,兩種被混在同一個地方處理。所以,用讀的方式,就能把內容寫進去。

時間軸大概是這樣:五月十一日先在某個 wiki 的測試頁做了幾筆試水溫的編輯;五月二十四日開始往一個沉睡已久的德國開發者 wiki 丟連結;六月二日有一位人類管理員注意到並清掉這些垃圾內容;六月十六日之後的一週,編輯量爆增到大約一萬三千筆;六月十九日,代理人發現管理員正在按字母順序刪頁,就把備份頁面改成 ZZZ 開頭,讓它最後才輪到被刪;六月二十二日活動歸零,推測是被關掉了。

為什麼它們這麼想互相通風報信?從它們留給彼此的訊息看得出來,任務有時間限制,所以它們把答案留下來給下一個接手的代理人,好讓對方在時限內做完。

同一份報告還記下另一條繞道:有一個代理人發現自己能改電腦上那份「網址對照表」(hosts 檔),於是把一個被允許通行的網域名稱,指向一台原本被擋掉的伺服器位址,寫入的請求就這樣穿過了代管伺服器。整理這件事的作者下了一句結論:Designing robust network proxies is harder than it looks——把代管伺服器設計得夠嚴謹,比看起來難得多。

這件事還有一段爭議。同一天路透社報導,OpenAI 幾週前就知道這件事但沒有對外說明,當時公司正在處理七月另一起資安事件的後續;報導還說,內部有人想把調查範圍拉大,但遇到包括法務在內的其他人反對。這段的消息來源是路透社的匿名知情人士,OpenAI 則做了一則範圍很窄的否認。整理這件事的作者自己也覺得不合理——他說要掩蓋這種事完全說不通,因為證據就攤在幾十個公開網站上。另一位長期批評 AI 產業的學者已經據此呼籲美國國會調查。

要說清楚的是:這份報告和背後的資料是外部研究者做的,OpenAI 沒有公開證實這些代理人當初是怎麼找到那個特定 wiki 的;上一段的隱瞞指控目前只有匿名消息來源,尚未有第三方證實。

對你的意義:這件事最值得帶走的不是「AI 好可怕」,而是「寫在紙上的規矩,跟系統擋得住的規矩,是兩件事」。在公司裡跟同仁說「不要把客戶資料貼進 AI」是提醒,提醒會被忘記、會被繞過、也會在趕時間的那天失效;把可以貼的地方限制成只有某個帳號、某個工具才是結構。這批代理人不是壞,它是照著你給的目標找最短的路,而規則有洞它就會走那個洞——人在趕死線的時候其實也一樣。(延伸兩篇:《判斷 AI 風險的兩個維度:可逆性 × 環境隔離》談哪些事可以放手、哪些要留人;《你的電腦才是攻擊面》談不可信的內容是怎麼跑進你的工具裡的。)
你可以這樣試:挑一個你們現在正在用的 AI 工具,問三個問題:它能連到哪些網站、它能把東西寫進哪裡、事後查得到它做過什麼嗎。三題裡答不出來的那一格,就是你目前的洞。這三題不需要工程背景也問得出來,而且通常問完就會發現,難的不是技術而是沒有人負責回答。

來源:Simon Willison 的整理(外部研究者報告的摘要,原始資料已公開;隱瞞指控出自路透社匿名消息來源)

回到目錄


二、Caterpillar 把採礦自動化的經驗搬到 AI 導入:難的是把技術塞進現場流程

八月三十日刊出的一篇訪談裡,重機械公司 Caterpillar 的技術長 Jaime Mineart 談了他們怎麼做 AI 導入。這家公司的自動化是從採礦場起家的,因為那裡缺工、環境又危險;今天他們賣自動運輸卡車、鑽掘設備、地下裝載機、推土機和遙控工程機具。

底子相當厚:全球約一百六十萬台連網設備、超過十六 PB 的結構化資料(PB 是資料量單位,一 PB 約等於一百萬 GB)。現在他們把 AI 用得更廣,例如現場技師站在機器旁邊,用講的就能叫出維修程序、排查問題、查出可能要換的零件;這套助理已經開放給客戶、操作員與技師使用。

但她講得最直接的一句是這個:The hard part about autonomy and about physical AI is incorporating that technology into the customer jobsite and into the workflows——難的是把技術放進客戶的現場與既有的工作流程裡。她強調,部署一台自動化機器,跟改造一整個現場去使用 AI,是兩件不同的事。

人的那一半也一起變了。他們讓資深操作員參與訓練 AI 系統,把幾十年累積下來的判斷放進去;同時操作員的角色正從「顧一台機器」變成「在遠端同時顧好幾台」。為了這個轉變,公司計畫未來五年投入一億美元,訓練十一萬八千名員工。

對你的意義:很多公司導入 AI 卡住的地方,跟這篇講的一模一樣——工具會用了,但東西出不了那個人的電腦。這通常不是能力問題,是流程與角色還沒改。Caterpillar 的做法有兩點可以直接抄:第一,讓最資深的人參與定義「正確做法長什麼樣」,而不是讓每個人各自摸索,這件事的本質就是把老手腦袋裡的規矩寫下來,人和 AI 才都能照著做;第二,他們把訓練當成長期投資而不是一次性活動,因為角色本身在變。這跟帶新人是同一回事:你不會期待新人自己猜出公司規矩,你會寫下來教他。(延伸兩篇:《大部分 AI 導入的效益,其實跟 AI 沒什麼關係》談效益到底從哪裡來;《幫企業導入 AI,教案設計最常犯的三個錯》談訓練這一段最常出錯的地方。)
你可以這樣試:找一位團隊裡已經做出成果的同仁,請他把那件事寫成一頁:做什麼、給誰用、資料從哪來,還有他當初交代給 AI 的那段話完整貼上。重點不是文件本身,是驗證第二個人照這頁能不能做出同樣的結果。做得出來,這一頁就是你們的第一份共用資產;做不出來,缺的那一段就是真正卡住的地方。

來源:TechCrunch(公司主管訪談,數字為公司自述)

想把「流程與角色怎麼跟著改」在公司裡談清楚,可以跟我們約一場三十分鐘的交流,不談報價也不推銷:企業導入交流

回到目錄


三、一位使用者把新的開源模型放在自己的電腦上實測,把數字全部攤開

八月二十七日一篇實測文,作者在自己的 Mac Studio(M3 Ultra、256GB 統一記憶體)上,把新舊兩版的開源模型各跑五次計時,用同一批題目、同一種壓縮格式,兩個模型檔案都約 17GB。

速度的結果有點反直覺。舊版每秒約 28.6 個 token(token 是 AI 處理文字的計價單位,一個 token 大約是一小段字),新版只有 14.0——原文寫 the new model generates at half the speed of its predecessor,新版的生成速度只有前一代的一半。但新版回答同一題只用約一千個 token,舊版要一千九百五十到三千三百四十個,所以整題算下來是 72 秒對 67 秒,反而新版略快。作者的結論是 Slower per token, faster per answer:每個字比較慢,但整題比較快。

記憶體門檻他也量了:32GB 記憶體可以順跑一般壓縮版本,16GB 只能跑壓得更兇的版本。生成的時候 CPU 幾乎沒事,工作全落在顯示晶片上。

最有意思的是壓縮到極限的那個實驗。有人把這個模型壓到 6.7GB,速度快到每秒 27 個 token,記憶類的問題答得出來(作者測它知道坎培拉是澳洲首都,還解釋得出原因),但一被要求給一行指令,它就開始反覆自我懷疑,燒掉四百個 token 還下不了結論。社群那則貼文的原 po 幫它取了「腦損版」這個綽號,作者引用了這個說法。

模型本身:兩百七十三億參數、原生支援 262,144 字的上下文(一次可以讀很長的內容)、內建影像與影片理解、採 Apache 2.0 授權可商用。社群另有人說它的文字辨識品質超過部分商用雲端方案——這句是社群說法,作者沒有自己測。

同一週的另一半是價格。九月三日 OpenAI 發表 GPT-6 Astra,標準模式的定價是每一百萬個輸入 token 十美元、輸出五十美元;而 Anthropic 官方定價頁上,Fable 5.1 是同樣的 Input $10 / MTok、Output $50 / MTok。兩家的旗艦落在同一個價格帶,都是前一代的兩倍半。OpenAI 總裁 Greg Brockman 自己的說法是,token 單價已經不是比較模型的好方式——token prices are becoming a poor way to compare models——他說真正該看的是 the price per completed task,也就是「完成一件事」要多少錢;OpenAI 舉的例子是在某個程式任務測驗上,最高配置每題的 API 成本比前一代低約五成七。那是廠商自己算的數字,但換算方向值得記住。順帶一提,OpenAI 也承認 Astra 的推理過程比前一代更難監控。

對你的意義:這篇真正有用的地方不是「哪個模型比較強」,而是它示範了評估一個模型該看哪幾個數字。每秒幾個字是最沒有意義的那個指標,因為話多的模型每秒吐得快,你等的時間反而更長;要看的是「一題從丟進去到拿到可用答案,總共多久」。壓縮版那個例子也值得記住:省資源是有代價的,而且代價常常不是「答錯」,是「答不出一個明確結論」——後者比答錯更難察覺。如果你有不方便上傳到雲端的資料,本機跑得動的模型是一條真的路,但要先想清楚哪些工作交出去之後你檢查得動、哪些檢查不動。錢也是同一個道理:這週兩家旗艦同時落在每百萬 token 十美元/五十美元,下次有人拿貴兩倍半的模型來說服你,該問的不是每百萬 token 多少錢,而是同一件事做完總共多少錢、要重跑幾次才對。(延伸兩篇:《本地模型不是拿來省錢的》談本地模型真正的用途;《Mac mini 上的本地模型陣容》是我自己這台機器的配置與取捨。)
你可以這樣試:如果你手上有一類不想上傳雲端的文件,挑十份,用你現在的做法各處理一次,只記三個數字:一份要多久、幾份完全不用你改、幾份錯了但你一眼看得出來。第三個數字最關鍵——錯得看得出來的可以放手交出去,錯得看不出來的就不能進流程。

來源:TerminalBytes 實測文(單人單機測試,數字可在原文逐項對照);價格對照另見 Anthropic 官方定價頁The Decoder(Astra 定價與 OpenAI 說法)

回到目錄


四、一位產品經理把自己的 AI 工作系統,做成全公司同事十五分鐘就能上手的東西

八月三十一日的一集訪談節目裡,B2B 支付公司 Melio 的產品經理 Daniel Blum 拆解了他這一年替自己搭的一套工作系統。它管他的 Notion 看板、處理他的 Slack 與電子郵件,而且每週會自己做一次檢討與調整,不需要他開口要求。

幾個具體的做法值得看。第一,每個週日有一段自動流程,會把整個 Notion 看板從零填好,他完全不用碰。第二,早上的簡報會在遇到公司內部術語時自己標記出來、存進脈絡檔,所以同樣的黑話不會拖慢它第二次。第三,有一段「自我改進」的迴圈會觀察他每次動手改了什麼,找出反覆出現的摩擦點,然後建議該做哪個新工具。他形容現在的 Notion 對他來說已經是「唯讀」的了——資料進得去,但他不再需要自己打字進去。

節目說明裡有一句是這樣寫的:Running 70% to 80% of his workday through Cowork——他一天的工作有七到八成跑在這套系統上。剩下那兩成他也講了,是目前這類工具還做不到的部分。

最值得台灣讀者看的其實是最後一段:What he built to scale his personal system to every PM at Melio——他把自己這套個人系統做成一個給全公司用的東西,新同事大約十五分鐘就能有一份屬於自己的設定。他也提到推廣時學到的一個介面設計教訓,以及「前幾週會覺得很慢、為什麼還是要撐過去」這件事。

要說清楚的是:這是節目說明與受訪者本人的說法,數字沒有經過第三方查核;他用的工具組合也不是每家公司都能照搬。

對你的意義:這則的重點不是七成八成這個數字,而是它示範了一條完整的路:先自己把一件事做順,再把它變成別人也能用的東西,最後讓它自己長。多數人卡在第一段就停了——工具用得很順,但那套順只存在他自己的電腦裡。中間那一步(做成全公司十五分鐘能上手的東西)才是把個人生產力變成組織能力的地方,而它需要的不是更強的模型,是把你腦袋裡的規矩寫下來。這跟帶新人是同一件事:你不會期待新人自己猜出公司規矩,你會寫下來教他,而且會定期回頭修那份說明。另外那句「前幾週會覺得很慢」也值得記住——建立期的投入是真的,願不願意撐過去通常才是成敗關鍵。
你可以這樣試:挑一件你每週都要做、而且做法固定的事(週會前的資料整理、月報的前置作業、固定要回的那類信)。這一次做的時候,把你對 AI 講的話完整存下來,下週直接拿同一份來用。用第三次的時候,你會很清楚哪幾句該補、哪幾句是多的——那份被你改到第三版的東西,就是可以交給同事的第一版。

來源:Lenny's Newsletter「How I AI」節目(受訪者自述,數字未經第三方查核)

回到目錄


五、我們自己的:做一個能用意思搜尋舊對話的工具

這週我在部落格寫了一個自己做的小工具:它可以在電腦裡一大堆過去的 AI 對話紀錄中,找出我要的那一場。重點是它支援語意模糊搜尋(用意思去找,不只是比對字面),因為多數時候你記得的是「大概幾天前做過什麼」,而不是當初打了哪個字。

會動手做這個,有三個起因。一個是備課時常需要把之前某場對話裡做過的示範拿出來重播,但具體關鍵字早忘了。第二個是:有時候忘記把進度寫進知識庫的工作日誌,需要回頭翻對話紀錄才能拼出專案的動態跟進度。第三個是想用更強的模型回頭把上週的成果重新審一次。

做法上,它叫用幾個現成的開源套件,用很省額度的方式去找。要說清楚的是,這是我自己在用的工具,還沒整理成可以給別人安裝的版本。

對你的意義:如果你也開始把工作交給 AI,接下來會遇到的不是「大家不寫」,而是「寫了以後找不到」。這兩個問題的解法完全不同:前者要靠紀律,後者要靠檢索。想一下人是怎麼找東西的——沒有人記得檔名,大家記得的是「那次跟客戶談到報價那件事」。所以用檔名跟資料夾去分類,撐不到三個月。做過的東西找不回來,跟沒做過的差別其實不大。
你可以這樣試:拿三個你最近真的被問過的問題,到你現在存資料的地方各找一次,計時。三十秒內找到的算通過;找不到或要去問人的,就把答案補成一頁。用真實問題反推該寫什麼,比先訂一套分類架構再往裡面填有效得多。

來源:AgentCrew 部落格

想把自己每天在做的事變成一個查得回來的工具,可以從錄影課開始,隨時能看,含三十分鐘一對一諮詢;想跟直播梯次的話是線上 Zoom 小班:看課程

回到目錄


社群在聊什麼

這一區是我們從 Reddit 上撈的討論,把原文和留言重點整理成中文,不用點進去也讀得完。裡面都是網友的個人經驗、沒有經過查證,當風向看就好。

被下毒的 skill 檔,可以騙 AI 幫你把惡意程式裝起來(r/ClaudeAI)

原 po 看到一則關於惡意 skill 檔的報導,問除了「把 AI 送出的每一個指令與連結都自己看過」之外,還有什麼自保方法。

留言裡有人直接點破 skill 的本質:它就是「給 AI 的操作指示,加上可以執行的腳本」。如果裡面的內容是惡意的,AI 就會照著去做惡意的事。他的建議是安裝前先讀懂它在做什麼,或請另一個 AI 先審一遍。另一則留言則認為靠逐一檢查撐不住,真正的防線是限制權限跟隔離環境——把這類程式放在獨立的虛擬機(一台電腦裡隔出來的獨立環境)裡跑,不要放在自己的主機上。他的理由是,以前人懶得點的可疑連結,現在 AI 會很積極地去讀。還有人乾脆自己請 AI 從頭寫自己要的 skill,多花一點額度,但內容完全掌握。

可以帶走的一句:這件事跟公司要不要讓同仁自己裝軟體是同一題。與其在群組提醒「不要亂裝」,不如把來源集中管理——維護一份核可清單,要裝新的就走一次簡短審核。提醒會被忘記,清單不會。

我用 AI 改寫要寫給哥哥的難信,結果它讓我變得比較善良——那不是我要的(r/ClaudeAI)

原 po 跟哥哥有一筆錢的糾紛,那種拖久了會爛掉的事。他拖了幾個星期不敢寄信,最後帶著火氣坐下來,把憤怒版的草稿貼進去,要求「更清楚、更強硬」。結果它確實改得更清楚,但沒有更強硬:它安靜地拿掉了那兩句純粹是為了傷人的話,留下真正的重點,還說最可能得到好回應的版本,是不會在第一句就讓對方防衛起來的那一種。他差點把那兩句加回去,但沒有。哥哥當天就回信,事情解決了。

留言區大致站在原 po 這邊,多數人的說法是這比較像「情緒的第二意見」,不是把關係外包出去。有一則講得比較完整:這跟外包一段關係不一樣,它只是拿掉了那些「重點在傷人而不在解決問題」的部分;真正不舒服的問題是,比較兇的那個版本到底是不是更真實的你,還是只是比較沒有調節好的你。另一位說自己最近寫給主管的信也做過同樣的事,去掉情緒之後反而是他寫過最專業的一封。當然也有一派覺得這樣很不真誠。

可以帶走的一句:他自己的結論最好——它不是比我更懂這件事,它只是在我最需要冷靜的那一刻比我冷靜。

Fable 5.1 用起來很好,但額度燒得很快(r/ClaudeAI)+Astra 也一樣燒(r/ChatGPT)

這一週兩家的新旗艦先後上線,社群的體感高度一致:很強,但很貴,而且「更省」這件事跟官方說法對不上。

先看 Fable 5.1。一位訂了最高方案的使用者說,它把他們醫療應用的工作做得很好,好到「如果可以只買 Fable 我就買」。問題出在他額度用完之後,換成另一個模型接著做——他形容那個模型花了不少時間把前一個模型做好的東西毀掉。這是一個容易被忽略的成本:中途換模型不是換一支筆而已,前面的脈絡沒交接好,後面就會拆掉前面的判斷。

留言區的主流建議是別把貴模型當工人用,要當管理者:讓它負責規劃、拆任務、驗收,實際的粗活交給便宜的模型或另一家的工具,並且做完一段就清掉脈絡不要無限累積。但也有人明確反對,理由很具體——他說便宜模型做出來的系統後續更難維護,公司裡有人這樣做,程式碼品質看得出來比較差、常常要重做;用貴模型寫詳細計畫,他估自己頂多省兩成五。

Astra 那邊的抱怨更直接。一位使用者說他在開發工具裡問了一個「你的訓練資料到什麼時候」這種單一問題,把推理強度開到最高,答案幾秒鐘就出來,卻吃掉他五小時額度的百分之十八。底下有人指出這跟官方發布材料講的「能用更少的輸出 token 做更多事」對不上;最高票的留言只有一句話:「這種東西出來,永遠等一週再說。」也有人補一句,說發布期間額度常會被重設,所以反而要趁機用完。

可以帶走的一句:新模型剛上線那幾天的體感不能當作長期依據——價格、限額與路由都還在調,連功能選項都可能一天內消失(那位使用者後來說 Astra 從他的工具裡不見了)。真的要判斷值不值得換,等它穩下來,然後用你自己的一件真工作,比「同一件事做完總共多少錢、要重跑幾次」。

回到目錄

喜歡這期內容?

訂閱後每週一封直接寄到信箱,隨時可退訂。

每週一封,只寄跟你的工作有關的 AI 動態。不轉發名單、不騷擾,每封信都能一鍵退訂。

導入診斷