AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-08-05
第 0 期(內部試刊)
這是「AgentCrew 週報」的內部試刊,取材區間 2026-08-03 到 08-05。
每一則的寫法固定三段:是什麼(一句話講清楚)、對你的意義(對到你的工作場景)、你可以這樣試(今天就能動手的一件小事)。我們不寫模型跑分、不寫融資八卦,也不販賣焦慮。只挑跟你怎麼做事有關的部分。
一、普立茲獎八位得主揭露用了 AI,但寫稿是紅線
今年普立茲獎有創紀錄的八位揭露在作品中使用 AI,五位得主加三位入圍者;這個揭露要求從 2024 年開始實施。用法很一致,全都是拿 AI 處理讀不完的資料:華爾街日報用內部模型摘要德州水災的上千份公開文件,美聯社用模型搜索數萬份中國監控技術外洩文件,明尼蘇達星報用 ChatGPT 翻譯一本用偽西里爾字母寫的日記、再請語言專家覆核,紐約時報用模型覆核自己人工分類的證券交易委員會加密貨幣案件。普立茲行政長 Marjorie Miller 講得很直接:在可能角逐普立茲的作品裡,用 AI 撰寫與編輯稿件並不恰當。
對你的意義:這是目前最清楚的一條專業界線示範。得獎的人不是不用 AI,是把它用在「讀完你讀不完的東西」,而最終的判斷與成品仍然掛自己的名字。你在公司要立規矩的時候,這條線比任何內部政策草稿都好用。
你可以這樣試:兩個問題就夠了,做錯了能不能收回、做完了能不能一眼看出對不對。查資料、整理、比對、翻譯,兩題多半都過,放手交給 AI;對外要署名的東西做錯收不回來,那就只讓 AI 出草稿、人過目再送。兩個問題比一份十頁的規範好用。
來源:The Decoder(原始報導出自 Nieman Lab)
二、GitHub 的律師自己做工具,合約審查時間砍一半
GitHub 法務團隊裡不會寫程式的律師和法務顧問,用 Copilot CLI 做出了自己的內部工具。產品法務顧問 Ngandu Kasuku 做了一個合約起草工具 terms-ai,內建自家的白話寫作準則和核可過的合約範本庫,他說審查加起草的時間「大約少了一半」。線上安全法務顧問 Jesse Geraci 則做了一個處理 DMCA 通知、NDA 分流與風險評估的法務工作流程式。兩個工具的核心指令都是用白話 Markdown 寫的,法務自己就能改。
對你的意義:他們不是學會了寫程式,是把腦中的判斷規則用白話寫了下來。那份白話文件本身就是工具的雛形。你懂你的業務,這件事比會不會寫程式重要。
你可以這樣試:挑一件你每週至少重複三次的判斷(回信語氣怎麼拿捏、文件該歸到哪一類、什麼情況要往上呈),用中文把判準寫成一頁。一個好用的比喻是,AI 是個很聰明、但沒有社會經驗的新員工。你不會期待新人自己猜出公司的規矩,你會寫下來教他。那一頁就是他的工作手冊。
來源:GitHub Blog
三、廣告業高層:技術早就到位了,難的是改習慣、團隊和預算
三家廣告與品牌公司的創意負責人在一場座談上講的話,比任何工具評測都值得主管看。Edelman 建立 AI 生產能力的 Gabe Michael 說,設計師現在「效率是五倍」,五倍的產出而工時沒有增加。Le Truc 的創意技術負責人 Filip Williander 說,生成工具讓他幾分鐘就能把一個概念做到六、七成,然後直接拿去給客戶看。而整場的共識是:技術已經成熟,真正的工作是把習慣、團隊和預算重新接線。Monks 創新長 Henry Cowling 的提醒最值得抄下來,他說最大的風險是用 AI 把原本的混亂放大,或者只是把既有的做事方式做得更徹底而已。
對你的意義:如果你導入 AI 半年還是沒感覺,問題大概不在選錯工具。原本就沒講清楚的流程,交給 AI 只會更快地產出更多沒人要的東西。
你可以這樣試:不要問「哪個 AI 比較好用」,改問這兩題。第一,如果這件事是人來做,人會怎麼做?第二,AI 現在少了什麼,才做不到人做的事?答案通常不是「AI 不夠強」,而是某個你以為理所當然、卻從來沒寫下來的前提。把那個前提寫成一行具體的規則,就是你該補的東西。
來源:Runway
四、有人把病毒藏進開發工具的設定檔,打開資料夾就中招
8 月 4 日,維護 keyv、cacheable 等程式套件的帳號被入侵,惡意程式像蠕蟲一樣在數小時內擴散到 400 多個套件、九個彼此不相關的組織,會竊取開發者電腦裡的各種帳號憑證。這次比較特別的是它的入侵方式:它在專案資料夾裡藏了兩個「開啟就自動執行」的設定,一個給 AI 工具、一個給程式編輯器。也就是說,你只是把從網路上抓回來的資料夾打開,就可能觸發。唯一擋在中間的,是那個問你「要不要信任這個資料夾」的提示。
對你的意義:這件事對主管的意義不是技術問題,是權限問題。你公司裡有多少人會從網路上抓別人分享的範本、工具包回來直接打開?那個「要不要信任」的視窗就是唯一一道關卡,而多數人會直接按下一步。
你可以這樣試:這種事光靠提醒沒用,口頭約束不算保證,要用結構擋。所以具體做法是限制權限而不是加強宣導:指定誰有權安裝外部工具、其他人一律不裝;需要用的範本集中放在一個公司內部核可過的位置,不要各自從網路上抓。那個「是否信任這個資料夾」的提示當然要一律先按不信任,但別把它當防線,它只是最後一道。
五、我們自己的一週:AI 越來越猜得中你要什麼,接下來拚的是驗證
這週寫了一篇,講一個正在發生的轉變。以前 AI 產出的品質很吃使用者的表達能力:同樣是「幫我把重要的證件整理起來」,有人只講得出這一句,有人講得出「重要等於適用情境廣、不可替代性高、跟其他證件相依度低」,模型才知道護照比學生證重要。但模型規模長上去之後,這層知識它自己就有了,連表達得不清不楚的意圖也對得上,好一點的模型甚至會在重大決策前停下來問你一句。
所以真正區分產出品質的東西正在往後移:從「會不會下指令」,移到品味(AI 給你五個看起來都不錯的方案,你怎麼選)和驗證(AI 說做完了,要你簽核送出,你放不放行)。而驗證比品味重要,因為它背後是責任。品味錯了,東西不好看、不好用;驗證錯了,是你自己簽的名字。
對你的意義:這決定你敢不敢放手讓團隊用 AI。真正的風險不在 AI 會不會做,在你們有沒有人真的在驗。而驗證最常見的失敗不是偷懶,是驗錯地方:照著自己寫的規格驗,規格本身錯了就怎麼對都會過;把「還沒驗完」當成「驗過了不合格」;或者驗錯層次,檢查了資料齊不齊,卻沒檢查這東西實際上有沒有用。還有更基本的一種,你驗的素材根本不是你以為的東西,檔名寫著逐字稿,打開是已經整理過的摘要。
你可以這樣試:檢查的方式不是問「你覺得結果對嗎」,那樣只會換來一句「應該沒問題」。正確的做法是自己先想好一個你知道存在、而 AI 很可能漏掉的具體線索,再問「這個有沒有考慮進去」。用在簽核上就是:下次有人拿 AI 做的成果給你簽,先問「你是拿什麼跟它對的」。如果答案是「我自己寫的需求」,那還沒驗完。
社群在聊什麼
這一區是我們從 Reddit 上撈的討論,幫你把原文和留言重點整理成中文,不用點進去也讀得完。裡面都是網友的個人經驗、沒有經過查證,當風向看就好。
用了一個月,我們把公司網站的 AI 客服下架了
發文的是一位網站經營者。他們把 GPT 客服接上官網,試用一個月,期間每一則對話都人工看過,最後決定停用,改回真人。他的說法是:說不太上來,但你感覺得到多數使用者的挫折。
留言區的檢討比原文有價值。最高分那則說,問題不是 AI,是「假支援」:與其讓機器人繞我二十分鐘還給不出答案,不如老實說「留言或打給我們,我們很快回你」。第二個角度更務實,說多數網站的 AI 客服令人火大是因為它沒有權限,不能退款、不能開單、不能改帳號,只能講話,等於一個包裝過的搜尋,還擋在你和真人中間。也有人舉 Amazon 的 AI 客服當正面例子,訓練得好就能處理掉簡單問題,把真人留給需要判斷的案件。另有一則提醒:客服本來就會被罵,真人也一樣,差別只在對機器罵沒有快感。
看這則的收穫是:導入前先問「它有沒有權限把事情解決掉」。沒有權限的 AI 客服不是省成本,是把客訴變慢。
我全盲,ChatGPT 讓我終於能自己處理文件格式
發文者是全盲的螢幕報讀軟體使用者。過去要交文件、研究論文、求職信,只要牽涉到排版格式,都得請看得見的親友或志工幫忙,用報讀軟體不是做不到,就是永遠沒把握。
他現在的做法很值得學,而且跟看不看得見無關:先把文字貼進一個對話,請它輸出指定格式的 PDF;接著另外開一個乾淨的對話,把檔案丟進去請它挑毛病;再把那份批評貼回原本的對話請它改。反覆到滿意為止。他請看得見的朋友複查過,說細節抓得相當好。他即將去念法學院,那個行業對格式和引註極度講究,他說這帶來的自主性太驚人。留言區另一位同樣失明的讀者補充,她要做 FDA 與 EPA 的法規文件,格式錯了可能延誤登記,手動做得到但慢得驚人。
這裡最值得抄走的一招是「另開一個對話當審稿人」:同一個 AI,換一個沒有前文包袱的對話去挑毛病,比在原本的對話裡叫它自我檢查有效得多。道理很簡單,同一個執行者不會誠實抓自己的錯,要換一個沒有預設立場的第二方來看。
讓 Claude 複審另一個 AI 寫的東西,通過率從 71.6% 拉到 89.7%
本週社群最熱的一則,也是最好的「別只看標題」教材。標題說:讓 Claude 去複審另一個 AI(Codex)的產出,通過率從 71.6% 拉到 89.7%。聽起來就是兩個 AI 互相檢查很有用。
但最高分的留言直接把原始論文的摘要貼出來打臉:Claude 自己單獨做就有 91.4%,是全場最高;反過來把 Claude 的成果交給比較弱的模型複審,反而掉到 82.8%。也就是說,標題埋掉了真正的結論,沒有任何一種複審組合,贏得過「讓最強的那個自己做完」。
另外兩個批評也值得記下來。一是這份研究用的是上一代模型,結論未必適用於現在的版本。二是研究裡的「複審者」是直接動手改寫,這不叫審查;真正的審查是給意見,讓原作者自己判斷要不要改。這一點很關鍵:第二方是來挑毛病的,不是來接手的。
一個數字被推到將近千分,真正的結論卻躺在留言區第一則。這就是為什麼我們一直說,看到驚人的數字,先找出處。
如果你想再往前一步
企業與團隊:如果你手上有一條「很花時間、規則其實講得清楚、但一直沒人有空整理」的流程,我們可以先聊 30 分鐘,把它拆開看看值不值得做。這通交流不談報價、不推銷,也不用你事先準備什麼。填一下這張表就好:先聊聊,不用急著談方案
一個實際的例子:8 人服務團隊,每月 160 小時手動報表,導入後 12 小時完成,三週內上線。
— 企業培訓案,服務業
個人:如果你想先自己動手試試看,可以從錄影課開始,隨時能看、含 30 分鐘一對一諮詢;想跟著直播梯次上課的話,L1 入門班與 L2 綜合實戰班都是線上 Zoom 小班工作坊。兩種都在 agentcrew.cc。
部分選題參考:數據來源 AI HOT(aihot.virxact.com)。