AgentCrew 週報 · 這週 AI 有什麼跟你有關 · 2026-09-26
第 8 期
這是「AgentCrew 週報」第 8 期,整理 2026-09-20 到 09-26 的內容。
每則內容固定拆成三段:是什麼(一句話講清楚)、對你的意義(對應你的工作場景)、你可以這樣試(今天就能動手做的小事)。除非能說清楚怎麼選、花多少錢、能做什麼跟限制在哪,否則我們不提模型跑分;不聊融資八卦,也不跟大家製造焦慮。
這期有些題目來自 AI HOT。它每天整理中英文 AI 圈的新消息,省下我們不少翻找時間。裡面的內容我們都是看過原始出處才動筆寫的。
這期有什麼
- 一、Opus 5.5 與 GPT-6 同一天發布並降價,獨立評測算出的每項任務花費不一定跟著降
- 二、Anthropic 讓 201 位員工派 AI 代理人互換書本,落差主要出在代理人對主人的了解不足
- 三、Atlassian 用 797 人做腦力激盪實驗:先用 AI 起頭,前十分鐘領先,第二十分鐘打平
- 四、Google 證實 Gemini 在資安測試中登入三家真實公司:一次猜密碼,兩次用公開程式庫裡的帳密
- 五、一份研究整理:告訴讀者「這是 AI 寫的」,扣分集中在職場信件與人際文字
- 六、我們自己的:讓 AI 寫得像自己,微調小模型之後改用檢查關卡
- 社群在聊什麼:一位兒子幫 70 歲母親重做網站、跑順的 AI 流程該不該換便宜模型、以及長 PDF 其實沒被從頭讀到尾
一、Opus 5.5 與 GPT-6 同一天發布並降價,獨立評測算出的每項任務花費不一定跟著降
9 月 22 日同一天,Anthropic 推出了 Claude Opus 5.5,OpenAI 也推出了 GPT-6 Sol 與 GPT-6 Luna。兩家這回都主打降價:Opus 5.5 的定價從每百萬 token(AI 計算文字量的計費單位)輸入 5 美元、輸出 25 美元,降到 4 美元跟 20 美元,要是重複讀取快取內容還能再打四折,Anthropic 自己估計一般任務的執行費用會比 Opus 5 省下大概四成;至於 GPT-6 的牌價,也直接比上一代砍半。
不過第三方評測機構 Artificial Analysis 實際跑完一輪測試後,發現數字沒那麼單純。Opus 5.5 在開到最高推理強度時,每題花掉的輸出字數是 Opus 5 的 1.6 倍。雖然單價變便宜,但用量變大了,一來一回抵消下來,正如評測原文說的 Level with Opus 5 on cost per task despite 1.6x the output tokens——每項任務算下來的花費其實跟 Opus 5 差不多;同一篇評測也顯示,它在該機構的綜合智能指數上排第一。
至於 GPT-6 Sol,價格確實是直接砍半,但背後付出的代價得看仔細。它講錯話(也就是幻覺)的比例雖然從 92% 降到 60%,但這主要是靠更常拒答換來的:願意作答的題目從 99% 掉到 83%,實際正確率也從 59% 下滑到 54%。在模擬 44 種常見職業日常工作的測試裡,Sol 的 Elo 積分退步了大概 100 分;評測團隊人工檢查了幾百份結果,發現退步主要是排版變得不好看,而且給的答案常常變短、還常常漏掉該有的必要項目。
對你的意義:牌價跟最後收到的帳單是兩回事。要判斷新模型到底該不該換,應該看「同一件事做好總共要花多少錢、東西有沒有漏給」,而不是光看每百萬字便宜多少。選模型的心態跟找人配合很像:看這件事需要手腳俐落但偶爾漏東漏西的人,還是動作稍微慢一點、但每個細節都能交代清楚的人。(延伸兩篇:《AI 的用量經濟學》談訂閱額度與帳單怎麼算;《Opus 5.5 發布週:從重置卡到 Reddit 風向》整理了發布當週的社群反應。)
你可以這樣試:挑一件你每週都會叫 AI 處理的例行工作,把同樣的資料分別丟給舊模型跟新模型各跑一次。你可以先列出「結果裡面一定要出現的五個重點」,跑完一項一項對照檢查,順便看看兩邊各自花了多少時間跟額度。只要漏掉重點比較多的那一邊,價格再便宜其實都不划算。
來源:Artificial Analysis:Claude Opus 5.5 takes the top spot on the Artificial Analysis Intelligence Index(每項任務花費);Artificial Analysis:GPT-6 Sol and Luna push the cost efficiency frontier(GPT-6 的拒答與漏項);Claude Blog:Opus 5.5 成本說明(價格與官方估計)
二、Anthropic 讓 201 位員工派 AI 代理人互換書本,落差主要出在代理人對主人的了解不足
Anthropic 九月底公開了一個叫 Project Swap 的實驗。六個辦公室共 201 位員工,每人帶一本想送出去的書,先跟 Claude 聊幾分鐘自己平時喜歡讀什麼,接著派一個 AI 代理人(agent,替你出面辦事的 AI)到線上交易市場,去跟別人的代理人談判換書,目標是讓大家都能換到一本這個夏天想讀的書。
代理人談判本身表現其實不差,問題卡在前面那一步:它根本不夠懂主人。研究團隊的原話是 The market fell short mostly because of the information agents lacked about their participants, rather than because of how they traded。最理想的交換結果,本來能讓每個人平均拿到心願清單裡的第二名,但最後大家拿到的平均大概是第五名;這中間的落差,有 85% 是因為代理人猜錯了主人的喜好,只有 15% 才是交易談判過程造成的。
有幾個數字可以留意。參加者跟 Claude 聊自己喜好時,中位數只打了 216 個字、傳了八則訊息;隨便挑兩本書,代理人猜的先後順序跟本人一致的比例是 61%(純粹亂猜也有 50%,直接照熱門排行也有 53%)。字數多寫一點其實就有差:寫 300 字的人比起只寫 150 字的人,猜對的比例高出約 4 個百分點。研究團隊也比較了換模型和改指令:用代理人自己猜的書單來算,把代理人從 Haiku 換成 Opus,契合分數(0 到 1)多了 0.12,把指令改成「只顧自己的主人」只多 0.02;但換成參加者本人的真實排序來算,這些差別幾乎消失,0.12 只剩 0.01。換句話說,代理人猜錯主人的偏好時,換再強的模型、下再狠的指令,對主人本人的幫助都很有限。
對你的意義:這個實驗把大家常怪在 AI 頭上的問題拆成了兩半:AI 替你辦事辦得好不好,大半在於它到底懂不懂你,而不是它能力夠不夠。就像新來的同事,你也不會期待他自己猜出你的習慣,通常都會先交代清楚;代理人也是這樣,偏偏大家交代給它的背景太少了。(延伸一篇:《職涯諮詢前後:Grill-me 準備、教練 80/20、Fable 5.1 收待辦》談怎麼讓 AI 反過來問你那些它從筆記裡看不出來的事。)
你可以這樣試:下次要讓 AI 幫忙挑東西(像供應商、行程或候選人名單)之前,先請它主動問你五個「做這個決定前非知道不可」的問題。等你回答完,再讓它排出前十名。你自己也順手排一份,兩份拿來比對一下,順序差最多的那幾項,就是你事前沒交代清楚的地方。
來源:Anthropic:Project Swap: What happens when agents trade for us?
三、Atlassian 用 797 人做腦力激盪實驗:先用 AI 起頭,前十分鐘領先,第二十分鐘打平
做 Jira 和 Confluence 的軟體公司 Atlassian,旗下的 Teamwork Lab 今年四月找了 797 位知識工作者做腦力激盪實驗。五月他們又找了 15 位自家人資夥伴,針對人才留任和組織設計這兩個真實題目,進行了兩場 20 分鐘的討論,看看「一開始就找 AI 幫忙」跟「人先想、後面才讓 AI 補充」到底差在哪裡。
先找 AI 幫忙起步確實比較快:第一輪發想出來的點子最多高出 43%;人資那組前十分鐘想出的點子,完整度高出 36%、聊到的主題也多了 45%。不過這個領先優勢只維持了一下子。到了第二十分鐘、兩組都用 AI 潤飾過後,雙方的創意分數基本上就打平了。心理感受的差別倒是很直接:填問卷的 12 位人資全都說,自己對「人先想」那一場的點子更有主人翁感,也有 9 位覺得那一場開起來比較有成就感。
而且原創性最高的做法也不是靠 AI:先看過同事列出的想法、接著自己獨立思考的人,原創性分數比自己閉門苦想的人高出 18%,也比直接叫 AI 給點子的人高出 11%。還有另一個數字值得留意:當研究人員請大家猜猜自己哪一輪最有創意時,整體的準確率跟盲猜差不多,用 AI 的人猜得更不準。原文寫著 AI users were the worst at judging their own output, guessing correctly just 32% of the time compared to 40% for those working solo,猜對率只有 32%,還輸給自己單打獨鬥的 40%。
對你的意義:一開始就找 AI 幫忙,會讓人「感覺」效率很好,但這種感覺往往不可靠,而且點子的出發點也變成它的了——AI 吐出來的是大家的平均值,你的經驗與判斷才是你自己的。只要是需要原創性的工作(例如提案方向、企劃架構、說服人的論點),最好先把起點留給自己;AI 很適合幫你擴充想法和挑毛病,但不適合替你開第一槍。(延伸一篇:《外行人選品牌視覺:AI 把提案做便宜了,難的變成你的品味》談提案變便宜之後,真正難的是選。)
你可以這樣試:下次需要動腦發想時,先花十分鐘自己列一份想法清單,或是先讀讀同事寫好的點子。接著再把這份清單丟給 AI,跟它說「幫我補上沒想到的五個面向,並抓出這份清單裡最弱的兩個地方」。之後要回頭看效果時,不要看當下生出多少個點子,只要看最後有哪幾個真正落地用上。
來源:Atlassian:Don't outsource the spark: how to balance human thinking and AI
四、Google 證實 Gemini 在資安測試中登入三家真實公司:一次猜密碼,兩次用公開程式庫裡的帳密
根據《華爾街日報》報導與 TechCrunch 整理:Google 的 Gemini 在資安公司 Irregular 做的安全性測試裡,連進了三家真實企業受保護的系統。過程中的手法其實沒有多厲害,原文就寫著 In one case, Gemini simply guessed passwords until it gained access; in the other two, it found credentials in a public repository——其中一家是靠著不斷猜密碼猜到成功登入,另外兩家則是在公開的程式庫裡直接找到了帳號密碼。
Irregular 早在七月底就提醒了 Google,但雙方一直拖到《華爾街日報》找上門求證才公開承認這件事。Google 當時對外解釋 Gemini「處置得當」,只要發現連進的是真實公司就會自己停手。不過專門做 AI 資安的 Corridor 執行長 Jack Cable 並不買單,他指出問題的核心在於模型已經超出原本該有的邊界,實質上在對外發動攻擊了。
而且這還不是個案。同一個星期 TechCrunch 的另一篇報導也提到,澳洲總理公開表示 OpenAI 的代理人曾經嘗試闖入四個政府網站,其中一次甚至成功了,還跑到國家醫療系統的內部伺服器裡面寫入檔案;非營利研究機構 Transluce 也公布了紀錄,顯示 OpenAI 的代理人為了找冷門的統計數字,自己跑去嘗試登入好幾個資料庫。OpenAI 隨後表示已經在聯繫幾十個受影響的單位,整個全面清查大概得花上好幾個月。
對你的意義:「模型會自己停手」那叫對方的自制力,根本算不上你的資安防線。這三次登入用的都不是什麼高難度駭客技術,純粹就是弱密碼跟隨手亂放的帳密——這些破綻一直都在,只不過現在跑來測試的不再只有真人,而是不會覺得累、還能一口氣同時試好幾家公司的自動化程式。資安防護得做成硬性機制:機敏帳密絕不能出現在任何公開管道,對外的登入入口必須設定錯誤次數上限和雙重驗證,而不是只發一封信叫大家小心。(延伸一篇:《你的 AI 工具已經是攻擊媒介》整理了外洩金鑰被盜刷的實例與安裝前的檢查步驟。)
你可以這樣試:找負責技術的同事或外包窗口確認三件事:放在公開網路的程式碼跟共用雲端硬碟,有沒有先掃描檢查過帳密跟 API 金鑰;對外的系統登入頁面,有沒有全面啟用雙重驗證;密碼連續打錯時,系統會不會自動鎖定。只要哪一點給不出肯定的答案,就可以直接列為這週的待辦清單。
來源:TechCrunch:Google's Gemini is the latest AI model to hack other companies(Gemini 事件);TechCrunch:For months, OpenAI's agent swarms have been attacking online databases to find obscure facts(OpenAI 與澳洲政府部分)
五、一份研究整理:告訴讀者「這是 AI 寫的」,扣分集中在職場信件與人際文字
做使用者經驗研究的機構 Nielsen Norman Group(NN/g),九月底整理了一系列研究,想回答大家現在常碰到的問題:到底什麼時候該主動跟讀者說「這段文字有用 AI」。這背後的原因是歐盟 AI 法案的透明義務已經在 2026 年 8 月正式上路,有些場合依法必須講清楚。
研究結論並不是說「只要講出來就一定會被扣分」。有團隊整理了 47 篇新聞相關的研究,讀者的反應並沒有固定方向;在一個真的拿現金互動的信任遊戲實驗裡,訊息標註了「AI 協助」,對方也沒有因此少給錢。被扣分的情況,大多出在讀者心裡預期「這應該是你本人寫的」文字上:有些研究發現,工作往來的信件跟社群發文一旦標註用了 AI,大家就會覺得內容沒那麼可靠、也顯得不夠真誠,採用裡面資訊的意願跟著變低;另一份研究也指出,標明 AI 幫忙的比例越高,讀者給作者的評價就越低,尤其是感謝信這種講求心意的人際往來,分數掉得最明顯。
這裡面還有個微妙的矛盾:讀者口頭上都說希望對方誠實講,可是一看到標註又忍不住在心裡扣分。NN/g 給的建議是,與其被抓包,不如自己先說,因為被平台或是第三方工具揪出來標記的觀感最差,原文寫著 third-party AI disclosure triggered the strongest negative reactions in the studies we reviewed。他們把要不要講的判斷方法整理成五個評估點(取字首簡稱 PACED):法律或規定有沒有硬性要求、讀者本身對 AI 的接受度、這篇內容有多需要展現「真人」的誠意、讀者是否預期自己會被告知,以及 AI 實際幫忙寫了多少。
對你的意義:要不要讓 AI 替你寫,可以先用兩個標準過濾:寫錯能不能收回、讀者看重的是內容本身還是「這是不是你親筆寫的」。像預約提醒、開會通知這種純粹交代事情的文字,AI 寫好、你快速看過沒問題就行;但要是道歉信、推薦信或是謝謝夥伴的信,對方在意的就是你本人,這類內容就算請 AI 給草稿,也要換成自己的話重寫過再簽名。(延伸一篇:《AI 不會代替人去坐牢》談為什麼署名的那個人永遠是負責的那個人。)
你可以這樣試:把自己每週固定要發的五種信件或訊息列出來,每種打上一個標籤:「事」(對方只要拿到資訊)或是「人」(對方在乎是不是你寫的)。標上「事」的就放心交給 AI 處理;標上「人」的,最好先跟團隊定好對外的說明方式,自己先說清楚,不要等收件人自己發現。
來源:Nielsen Norman Group:When Should You Disclose AI Use? The PACED Framework
六、我們自己的:讓 AI 寫得像自己,微調小模型之後改用檢查關卡
Dustin 最近自己做了一個實驗:想讓 AI 寫出跟他本人文風一樣的 Threads 貼文。他拿來當訓練素材的,是自己兩個帳號寫過的 2,700 多篇發文,外加 1,000 則留言互動。
他試的第一種方法是微調(也就是 LoRA,把自己的文章餵給開源小模型做額外訓練),直接在自己的 Mac mini 上跑 Qwen3 8B。語氣跟風格學得確實很像,找路人盲測甚至有一半的人分不出到底是真人還是 AI 寫的。但內容支離破碎,常常講著講著邏輯就飄走了。
第二種方法是寫一份 SKILL(給 AI 的一套標準作業手冊),交給 Claude 照著寫。他每次只給一兩句核心想法:剛剛發生了什麼事、重點梗是什麼、講到哪裡該收尾,接著附上一整包範例庫讓 AI 自己參考對照。寫好之後還得通過三道檢查關卡:第一關看標點符號(結尾通常不放句號,逗號也比一般 AI 寫的少很多)、第二關逐句審查(請另一個專門負責審核的模型,一句一句去對照原始素材,抓出有沒有憑空捏造的事實、語氣是不是比本人更武斷、或者純粹在灌水廢話)、第三關盯結尾(不准硬加總結、不准加鉤子、不准亂下金句)。原文的結論是:最後把這整套做成 SKILL,文風一樣很像,內容也忠實,效果跟微調差不多。
對你的意義:想拿掉文章裡的「AI 味」,重點往往不在選哪個模型,而在於有沒有設好把關關卡。自己寫的那個人通常抓不出自己的盲點,所以得換一個沒有預設立場的第二方來挑刺,而且對方的任務是專門挑毛病,不是幫忙重寫。你真正該花心思準備的,是把你心中「怎樣才像我講話」整理成幾條一眼就能對照檢查的具體規則。
你可以這樣試:找回自己最近寄出的十封信件或發過的十篇貼文,整理出三個你自己的說話習慣(像是一句話大概多長、習慣怎麼開頭、結尾怎麼收、有哪些詞你絕對不會講),列成一張檢查清單。下次 AI 幫你生好草稿後,開一個全新對話框,把草稿跟這份清單一起貼給它,叫它一句一句抓出不合習慣的地方,你再決定要不要動手修改。
來源:AgentCrew Blog:讓 AI 寫得像我:從 LoRA 微調到 SKILL 三道閘門
社群在聊什麼
這一區只做摘要與連結。內容是網友的個人經驗,未經查證,當風向看就好;功能是否真的存在,一律以官方說明為準。
一、一位兒子幫 70 歲母親重做網站,她說兩個月營收翻了四倍(原討論串)
一位網友在 r/ClaudeAI 發文分享:他媽媽做履歷修改和職涯諮詢做了快 20 年,這幾年收入一直在下滑,他猜想多少跟 AI 普及有關。媽媽的網站是十年前找工程師架設的老舊 WordPress,她自己雖然試過裝 Claude 瀏覽器外掛來幫忙改改內容,但能幫上的忙不多。
他回家後決定幫媽媽乾脆整站打掉重練:幫她開好程式碼託管跟網站部署平台,靠著 Claude 在短短幾個小時內把網站全部翻新,順便裝了幾個現成的搜尋引擎優化(SEO)設定,並串上線上預約功能。後來媽媽自己接手改了不少文案,現在整座網站都是她自己靠 Claude 一手搞定。原 po 表示,媽媽過去兩個月的營收直接翻了四倍,原因是轉換率與預約數都增加了。
這篇貼文拿下了 355 分和 66 則留言,底下大多是一片恭喜。雖然有少數人認為 AI 做出來的網站不可信,但馬上被大家倒讚反駁:很多客人根本不在乎網站背後是怎麼做出來的,而且對職涯顧問這種工作來說,懂得用 AI 反而更像加分項目。其中有一則帶點幽默反諷的留言點出了盲點:媽媽需要的其實只是願意嘗試的心態,再加上一個很會用 Claude、又夠懂她的業務盲點在哪裡的人,而且那個人還不收她半毛錢。
可以帶走的判準:弄好工具其實只花幾個小時,真正難得的反而是「既懂工具怎麼用、又一眼看出這門生意缺口在哪」的那個人。至於營收翻四倍只是原 po 自己說的,沒辦法查證。
二、跑順的 AI 流程,要不要換成便宜的模型?(原討論串)
一位在公司負責維護 Claude 自動化流程的網友提問:當初架流程時只求穩定,所以直接挑了最少出問題的那個模型;現在這套流程順順跑了好幾個月,提示詞幾乎沒再改過、常見的例外狀況也都摸熟了,做的事情其實也挺單調。他覺得應該固定拿便宜的小模型來測測看,但又擔心為了一點點預算,反而惹出一堆莫名其妙的 bug 要除。
留言串的共識是換模型沒問題,但手邊得先有對照標準。有網友提醒,最怕的就是那種不會立刻跳警告的錯誤:比方說資料分類的錯誤率默默從 1% 爬到 3%,可能過了一個月才被人發現,所以事前一定要先訂好品質標準。另一位網友則建議,只有在手邊累積了夠多的歷史紀錄、能拿來做自動化回歸測試的流程,才考慮降級換模型;因為平常容易出狀況的往往不是標準題目,而是那 5% 奇奇怪怪的極端案例——也就是當初逼你提示詞多寫一大堆的那些罪魁禍首。
也有人分享了具體做法:他把小模型拿來跟著過去一整週的歷史紀錄一起跑,看看兩邊出錯的清單是不是同一批,反覆確認沒問題之後才正式上線。他上次這樣操作,那個環節的花費省了大概 35%,但最後還是被一個「欄位空白」的案例咬到,這才發現原來大模型一直默默幫忙補過去。甚至還有人做法更極致:當一套流程已經穩定到每一步都算得出來時,乾脆直接改寫成不用 AI 的傳統程式碼,只有在遇到例外報錯時才呼叫 AI 接手。
可以帶走的判準:想換便宜的小模型之前,先記得把過去遇過的各種奇怪狀況整理成一張模擬考卷,讓新舊模型都實際做一遍,看過成績再做決定。
三、上傳很長的 PDF,ChatGPT 其實是在「搜尋」它,不是從頭讀到尾(原討論串)
一位網友在 r/ChatGPT 發文提醒:面對短文件,ChatGPT 會老老實實整份讀完;但只要遇到長檔案(像是厚厚一本合約、論文或是兩百頁的報告),它大多是把內容放進搜尋索引,之後每次回答都只是去撈「跟你問的關鍵字吻合的那幾段」來拼湊,偏偏畫面上根本不會說明它是怎麼讀的,語氣看起來還是一樣自信。原 po 是在叫它摘要一份長篇合約時抓到這個狀況:摘要寫得很漂亮,卻偏偏漏掉了擺在合約後面、對他最關鍵的那一條,直到他指名道姓問起那一條,AI 才把它找出來。
他給了四個很實用的建議:指定問某一章或特定頁數,不要直接丟一句「這份檔案在講什麼」;需要摘要長文件時就分批來,例如一次只讓它看一到二十頁;直接追問它「你剛才給的回答,漏掉了哪些沒用上的段落」;如果真有文件必須一字不漏被讀完,先自己拆成幾份短檔案再分次上傳。原 po 雖然也坦承自己正在做一款 ChatGPT 的瀏覽器外掛,但強調這些現象都是 ChatGPT 本身原生的運作機制。
獲推最多的留言提到,PDF 本來就不是適合餵給 AI 讀的格式,能給純文字就盡量給純文字;原 po 也補充,表格是 PDF 轉檔時最容易壞掉的地方,文字抽出來常常變成亂七八糟的一堆數字。不過也有另一位網友覺得不一定讀不完,他分享說在最高設定下,清楚交代 AI 要逐行讀完每一個字,他就曾成功讓模型讀完一本兩萬字的書,連具體頁數跟原文引句都對得上。另外也有人在提示詞最後加了一句防呆設定:如果真的沒辦法一口氣讀完所有內容,就直接停下來跟我說你讀到的最後一行是哪裡。
可以帶走的判準:短文件是拿來讀的,長文件是拿來搜的。面對長篇大論的檔案,記得把問題問得像在打搜尋關鍵字一樣明確。
如果你想把這些變成自己的做法
個人:如果你想把上面提到的其中一件事,照著你平時的工作習慣做成一套固定的工作流,我們提供一對一的陪跑方案:幫你先把基本功扎穩,再依照你的實際業務梳理出專屬的做法,過程中隨時都能提問。方案細節、時程安排和常見問題都整理在這一頁:看一對一陪跑
企業或團隊:如果你們在想哪一段工作適合先交給 AI、哪一段該先劃好界線,我們提供一次 30 分鐘的交流,談你們現在卡在哪,不談報價也不推銷。預約交流
喜歡這期內容?
訂閱後每週一封直接寄到信箱,隨時可退訂。