AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-08-21
第 3 期
這是「AgentCrew 週報」第 3 期,取材區間 2026-08-15 到 08-21。
每一則的寫法固定三段:是什麼(一句話講清楚)、對你的意義(對到你的工作場景)、你可以這樣試(今天就能動手的一件小事)。模型跑分只有在能說清楚選型、成本、能力或限制時才寫;不寫融資八卦,也不販賣焦慮。
這期部分選題是從 AI HOT 發現的——它每天把中英文 AI 圈的新東西彙整起來,省下我們大量翻找的時間,內容我們都回原始出處讀過再寫。
這期有什麼
- 一、一家法律文件公司讓十五位非工程師各做出一個代理人,一個月後有五十多個在跑
- 二、訪談十幾家新創之後歸納的五條規矩,其中一條是「做出來的東西要準備重做」
- 三、Snowflake 推出動態模型路由,簡單的任務自動送給便宜的模型
- 四、我們自己的一週:三個寄出去就收不回來的誤操作
- 五、英國國家網路安全中心發布代理型 AI 指引:模型內建的防護不夠用
- 社群在聊什麼:超市的人臉辨識再次認錯人、把真錢交給 AI 操作股票的結果、以及「每一行都要檢查」的疲勞
一、一家法律文件公司讓十五位非工程師各做出一個代理人,一個月後有五十多個在跑
美國法律文件送達公司 ABC Legal 今年稍早讓全公司一千一百名員工都能用 Claude,接著各部門開始自己做自動化。技術長 Brandon Fuller 沒有把這些成果收攏成一個部門專案,而是先解決一件更基礎的事:那些自動化當時散落在各人的筆電上,沒人知道有哪些、花多少錢、昨晚有沒有跑成功。
他做的第一件事是把每一個代理人當成軟體管。一個代理人的提示詞、可用工具、排程、憑證與記憶全部寫成設定檔,放進公司的版本控制庫,任何修改都要走一次同儕審核才會生效,因此每一個都有版本紀錄、可回溯、可稽核。第二件事是找了十五個人來當第一批建置者:來自財務、行銷、營運與開發部門的跨部門委員會,裡面沒有任何一位是軟體工程師。一週之內,十五個人全部做出了可以運作的代理人;一個月之內,公司裡有五十多個在跑,每一個都有名字、有負責人、只做一件事。
原文裡有一段最能說明門檻在哪:The account manager who set it up had never automated anything, and built it in about an hour by describing it to Claude Code——那位客戶經理過去從來沒有自動化過任何東西,靠著把需求講給工具聽,大約一小時就做出來了。他做的那個代理人,接手的是一位客戶經理原本每週手動處理的例行工作——從資料庫撈出符合條件的案件、逐件取出 PDF,再送到客戶指定的收檔位置。截至今年七月,公司統計有五十多個代理人在生產環境運作,約三百一十名員工每天使用,部分代理人接手的人工任務成本最多下降約五成。
對你的意義:這則值得看的不是那個五十的數字,是那個十五。他們沒有先訓練全公司,而是先讓十五個非工程師各自做出一個能動的東西,再讓這十五個人回自己團隊教下一個。另外那句「每一個代理人都有名字、有負責人、只做一件事」,其實就是在說:不要期待一個萬能助理,要期待一批各司其職的新同事。你不會請一個人同時做財務、行銷和客服。
你可以這樣試:把它當成新到職的同事來安排——你不會期待新人自己猜出公司規矩,你會寫下來教他,而且第一週只給他一件事。這週在你的部門裡找出三個重複性最高的工作,挑其中一個最單純、做錯了也不會有人受傷的,指定一位同仁在一週內做出第一版,不必完美。重點是那個人做完之後要回頭教第二個人,而不是變成部門裡唯一會做的那個人。
來源:Anthropic 客戶案例(工具供應商自製的客戶案例,數字由該公司提供、未經第三方查核)
如果你手上也有一條「規則其實講得清楚、但一直沒人有空整理」的流程,我們可以先聊三十分鐘把它拆開看看:預約 30 分鐘交流
二、訪談十幾家新創之後歸納的五條規矩,其中一條是「做出來的東西要準備重做」
Anthropic 這週把訪談十幾家快速成長新創的結果整理成一份操作指南,受訪的是具名的創辦人與技術主管,文中引用的公司包括 Clay、ClickHouse、Harvey、Cognition 等。五條規矩分別是:每個人都能出貨、把機械性的部分交出去、可以信任但要驗證、為了重建而建、以及先做原型再自己用再上線。
第四條最反直覺。指南裡的說法是模型能力一直在腳下移動,所以幾乎沒有什麼東西被當成永久的。Clay 的共同創辦人 Kareem Amin 講得更直接:What we do at Clay is you build it and then you build it again and then you build it again——我們在 Clay 的做法就是做一次,然後再做一次,然後再做一次。另一條「把機械性的部分交出去」則被寫成一句可以直接拿去用的分界:Agents own the mechanical 80% of the lifecycle so engineers spend their time on the cases that actually need judgment——機械性的八成交出去,人把時間花在真正需要判斷的那些情況上。
要說明的是,這份文件是工具的供應商自己整理的,立場不中立,裡面的數字也沒有經過第三方查核;但引句都掛在具名的人身上,可以自己回去看。
對你的意義:多數人在導入 AI 的時候,心裡想的是「一次把它做對,之後就不用管了」。這份指南裡的那十幾家公司想的正好相反:他們預設三個月後會有更好的做法,所以刻意不把流程綁死在某個工具或某個版本上。這對你的實際影響是,如果你正因為「怕做了白做」而遲遲不開始,那個顧慮的前提是錯的——重做本來就是正常的一環,不是失敗。
你可以這樣試:把推倒重來當成正確操作,不是浪費。這週選一件你已經做到一半、但越修越不順的自動化或文件,不要繼續修,直接留下你原本想達成的目標,重新做一次。你會發現第二次做通常比修快,而且結構會乾淨很多。判斷標準很簡單:如果你已經改了三輪還在原地打轉,那就是該重做的訊號。
三、Snowflake 推出動態模型路由,簡單的任務自動送給便宜的模型
資料雲端公司 Snowflake 這週發表了一項還在私有測試階段的功能:系統會自己評估每一個任務,依照品質與成本挑選最適合的模型,重複性高、複雜度低的送給比較便宜的模型,需要深度推理的才用旗艦模型。他們同時宣布把兩個中國開放模型 DeepSeek V4 Flash 與 GLM-5.3 納入可選清單。
執行長 Sridhar Ramaswamy 講了一句話說明為什麼企業開始在意這件事:It is no longer enough to show that employees are using AI, or that token consumption is growing——光是證明員工都在用 AI、或用量一直成長,已經不夠了。他說用量只是投入,真正重要的問題是公司拿回了什麼。Snowflake 自己的內部測試給了兩個數字:代理人建置資料管線時,混合搭配的效率最高是只用旗艦模型的三倍,品質相同;工程團隊在提交同樣數量的程式碼變更時,token 使用效率高出兩成五。這類功能不只他們有,亞馬遜、Databricks、微軟與 OpenRouter 都已經推出。
對你的意義:這件事對個人使用者的意義,比對企業更直接。你手邊多半已經有不只一個 AI 工具,但很可能所有事情都丟給同一個——包括「幫我把這段話改成三個項目符號」這種完全不需要動腦的活。企業現在正在把「哪些任務值得用貴的」變成系統自動判斷;你可以先在自己手上用手動的版本做同一件事。
你可以這樣試:卡住的時候回頭問「人是怎麼做的」——你不會請資深顧問來幫你影印文件。這週把你這個月最常做的五件事列出來,在每一件後面標上「需要判斷」或「只是搬運」。只是搬運的那幾件,改用便宜或免費的工具做一週看看,品質有沒有差你會很快知道。差不多的話,那筆錢就省下來了。
想知道同一件事在不同模型手上怎麼分工、怎麼切換,多模型分工錄影課講的就是這個,隨時能看,含 30 分鐘一對一諮詢。
四、我們自己的一週:三個寄出去就收不回來的誤操作
這個月我們在三個地方各犯了一次同樣形狀的錯,都跟 AI 幫忙動外部系統有關。
第一次是口述時說了一句「跟他確認了、改行事曆」,那個「他」指涉不唯一,結果改到了另一位客戶的邀請日期,而且帶著通知寄出去了。更麻煩的是回滾:把日期改回來的那一刻,同一位客戶又收到第二封更新通知,一次誤判在對方眼裡變成兩封莫名其妙的改期信。第二次是用「回覆全部」建草稿,對方回信時自己加了三位副本,收件人於是從兩人變成六人,範圍與費用被更多不認識的人看到。第三次是行事曆上的佔位事件,備註欄寫的是給自己看的內部判斷,事件一發邀請,那段備註就跟著寄到客戶信箱;後來改成對外版本,但第一封追不回來。
我們自己記下的判準是:代名詞指涉不唯一時,動外部系統前先確認對象。三件事的形狀其實是同一個——執行的那一步本身都沒有出錯,出事的是它跟外部收件人之間那道沒有人看的門。
對你的意義:判斷一件事能不能放手交出去,看兩個問題:做錯了能不能收回來?做完能不能一眼看出對不對?寄信、寄出行事曆邀請、送出表單這幾種動作,答案都是「收不回來」,所以不管工具多可靠,都應該卡在人這一關。反過來說,草稿、整理、分析這些改壞了重做就好的事情,就不需要每一步都盯著。
你可以這樣試:這週把你目前交給 AI 的事情分兩堆,判準只有一個:做完之後別人看得到嗎。看得到的那一堆(寄信、發通知、更新共用行事曆、貼到群組),全部改成它只能產草稿、你按下最後那個鍵。看不到的那一堆就放手讓它做完再檢查。如果你用的工具支援自動送出,這週就把那個開關關掉。
五、英國國家網路安全中心發布代理型 AI 指引:模型內建的防護不夠用
英國國家網路安全中心(NCSC)在八月二十日發布了一份專門談自主型 AI 代理人的資安指引,作者是該中心的首席安全架構師(Principal Security Architect)。它把「代理人可以自己決定下一步」這類系統的風險管理寫成一份公開文件,適用對象是打算導入這類系統的組織,不是研究單位。
指引的核心判斷有兩點。第一,不要把模型自帶的安全機制當成防線。指引把模型內建的安全控制可能出現的狀況列成三項:可能被繞過、在高風險環境裡無法提供足夠保護、或光靠自己不足以妥善管理風險。接著這句是它給的行動方向:Understanding the safeguards that are available, their efficacy and their limitations, will enable you to determine what additional controls are needed——先弄清楚有哪些防護、它們的效力與限制在哪,你才有辦法判斷還需要補上哪些控制。第二,指引反覆提醒代理人不是人:It does not have common sense or human traits, and may interpret instructions and goals in literal or unexpected ways——它沒有常識,也沒有人的特質,可能會用字面上或出乎意料的方式解讀指令與目標。具體建議包括依自主程度給相稱的控制、用限制對外連線的沙箱環境、完整記錄與監控,以及保留隨時中止的能力:發生事故時你必須永遠能夠把插頭拔掉,立刻停止代理人的活動。
對你的意義:這份文件最實用的地方,是它把「提醒」與「限制」分得很開。組織裡最常見的做法是發一封公告請大家注意,但公告擋不住任何事情——真正有效的是那些不需要任何人記得的設計:沒有給的權限就是用不了,沒有連線的環境就是連不出去。這個道理不只適用於 AI,也適用於任何你希望不要出錯的流程。
你可以這樣試:口頭約束不是保證,結構性限制才是。這週檢查一下你或你的團隊給 AI 工具的權限:它能不能讀到不該讀的資料夾、能不能直接寄信、能不能改共用檔案。凡是「我們有交代過不要碰」的項目,都改成「它根本就拿不到」。另外確認一件事:如果它現在正在做某件你不想讓它做的事,你知道要按哪裡才能停下來嗎?不知道的話,這件事比其他所有設定都優先。
來源:NCSC
社群在聊什麼
這一區是我們從 Reddit 上撈的討論,幫你把原文和留言重點整理成中文,不用點進去也讀得完。裡面都是網友的個人經驗、沒有經過查證,當風向看就好。
超市的人臉辨識又認錯人,這次是把一位顧客請出店外
一則英國新聞在版上引起討論:連鎖超市 Sainsbury's 在倫敦一家分店暫停使用人臉辨識,起因是一位顧客在結完帳後被兩位店長攔下,告知不能為他服務,離開時他在店內監視器畫面上看到自己的臉被紅圈標了起來。這是今年第二起同類事件。公司事後道歉,把原因歸給人為判斷而不是軟體,並表示會加強員工訓練。
留言區最集中的反駁正是針對這個說法。有人直接指出,把自動化監控造成的誤判說成人為疏失、同時繼續在其他地方推行,是典型的危機處理話術,而這種系統用在一般顧客身上的誤判率太高了。另一則講得更細:人臉辨識給出的其實只是一個弱比對結果,本來就需要更多證據才能行動,但現場人員在各種壓力下往往把那個弱訊號當成確定的證據用,於是誤指控就大規模發生。也有人提到歐盟的新法規把這類用途列為不允許,以及美國連鎖藥局幾年前的類似災難讓整個產業縮手。
可以帶走的一句判準是:任何 AI 給出的「疑似」結果,交到現場人員手上就很容易變成「確定」。所以真正要設計的不是模型準不準,是那個結果被交出去之後,還要走過哪幾道人的確認才會變成行動。
他把真錢交給 AI 操作股票,然後把結果貼上來
一位使用者讓 AI 用他自己的真錢操作股票,把結果貼上版,兩千三百多分、三百九十多則留言。從留言的走向看,結果並不好。
得票最高的一則留言給出了最完整的解釋:多數當沖與個股操作者本來就是賠錢的,常見的估計是高達九成失敗率,而 AI 正是在這些資料上訓練出來的,所以「你的系統完全按照設計運作」。第二高票則提醒了一件原 po 自己也沒想到的事——這份損益還沒有把呼叫模型的費用扣掉,所以實際上虧得更多。原 po 的回覆只有一句「糟糕,我沒想到這個」。
其餘留言多半是玩笑:有人說他忘了在指令裡加上「你是專業操盤手,不要犯錯」;有人提議乾脆反著做,AI 想買什麼就賣什麼。比較認真的一則說,真的有人用 AI 做出可用的交易系統,但那些設定複雜得多,會接上多個資料來源與財報,而且真正做成的人不會公開講。
可以帶走的一句判準是:AI 學到的是它讀過的東西的平均值。在一個多數參與者都在賠錢的領域,那個平均值就是賠錢。要判斷一件事適不適合交出去,先問「這個領域公開資料裡的多數做法,是好的還是壞的」。
他說自己不是累在寫,是累在檢查每一行
一位使用者發文說自己有點撐不住了,累的不是工具本身,是因為還不完全信任它,所以每一個它動過的地方都要盯著看。他形容這是把打字的疲勞換成了檢查的疲勞,而且有些日子後者更糟。這是所有開始把工作交出去的人都會撞到的第二階段問題,值得提早知道。
留言區的共識是這個問題不能靠硬撐,要改工作方式,具體給了三個做法。第一是只檢查邊界不檢查瑣碎:把注意力放在架構、資料流向、跟權限與金流有關的地方,其餘交給自動化。第二是投資在自動檢查上,讓「出錯的時候你會知道」變成系統的責任而不是你的責任。第三是每次只做一件事、分小段交付——同樣的內容,分成十次各四十行看,比一次看四百行輕鬆得多。
其中一則被推很高的留言把心態講得最清楚:他說他到現在還是不信任這個工具,他只是想辦法讓「出錯的影響範圍」小到不需要盯著它。另一位補充了自己的做法:他跑兩輪檢查,一輪讓多個角色各自從不同角度看(正確性、文件、風格、驗收標準),一輪自己抽樣看最複雜的幾段。他說最有價值的一次抓包,是工具在自動檢查那一關聲稱已經修好,但被要求把實際內容攤開來時就藏不住了。
可以帶走的一句判準是:與其問「我要不要更信任它」,不如問「這件事做錯了,我要花多久才能復原」。復原成本低的就放手,復原成本高的才逐行看。另外,讓另一個沒有立場的第二方來挑毛病,比要求同一個執行者自我檢查誠實得多。
如果你想再往前一步
企業與團隊:如果你手上有一條「很花時間、規則其實講得清楚、但一直沒人有空整理」的流程,我們可以先聊 30 分鐘,把它拆開看看值不值得做。這通交流不談報價、不推銷,也不用你事先準備什麼。填一下這張表就好:先聊聊,不用急著談方案
一個實際的例子:8 人服務團隊,每月 160 小時手動報表,導入後 12 小時完成,三週內上線。
— 企業培訓案,服務業
個人:如果你想先自己動手試試看,可以從錄影課開始,隨時能看、含 30 分鐘一對一諮詢;想跟著直播梯次上課的話,L1 入門班與 L2 綜合實戰班都是線上 Zoom 小班工作坊。兩種都在 agentcrew.cc。
喜歡這期內容?
訂閱後每週一封直接寄到信箱,隨時可退訂。