我在此宣佈:昨晚發佈的 Gemini 3.7 Flash,才是這半年內 Gemini 家族終於可以用在 agent 工作上的模型。之前的 3.1、3.5、3.6 不知道在幹嘛的。
3.5 那一輪我整理過 Reddit 上的實測回報,結論是貴三倍、Vision 退步、Tool Calling 災難。這次是同一條線隔了三個版本之後的翻身。
有人問我 3.5 之後到底差在哪,我的回答是三大優勢:
要速度 有速度
要品質 有速度
要自主執行 有速度
跟現在檯面上的模型比,體感是比 Sonnet 5 強,但是沒有接近 Sol。我覺得主要差別在他常常會誤解使用者的一些模糊的指令,但 Sol 就猜心比較準。
價格也是對半折,還有原生影音多模態,甚至額度可以當作是買雲端硬碟送的,根本用不完,跑一整晚都不會心疼。我已經把它接進 Claude Code,能力已經可以用在正常工作。
另外,多模態單點任務這一塊,Gemini 仍然是王。
補記:同一家的 API 和網頁版是兩回事
做單點任務的 Gemini API 真的是寶。三萬多道題目轉寫匯入資料庫,跑起來又快又好。怕品質差?設雙閘門驗證就好。
話說回來,他們是怎麼做到 API 表現好,網頁版表現那麼差的。

舒坦了,現在每週都會把 Gemini 用好用滿,總算不負我每月 5 USD 買 5TB 雲端硬碟換到的額外 token。
agy 做單點任務跟多模態任務非常出色,我讓他寫三萬道題目都是極高品質,不痛不癢。無關程式碼的寫作任務上,他是最自然最有人味的。3.5 是旗艦啊,寫作方面的旗艦——因為 A 家後來的模型就越來越不說人話。
有人問我一堆名片怎麼辦,我的回答是這樣:
- 全部拍照丟一個資料夾裡
- 去 Google AI Studio 申請 Gemini API,不用充錢,因為你老闆也沒給你報銷
- 給 Claude/ChatGPT 一下指令:「此資料夾裡面有大量名片檔案,請幫我調用 gemini api 使用 gemini-flash-lite-latest 辨識並匯入 excel」
- 做完請 Claude/ChatGPT 抽驗
唯一的缺點就是慢,因為免費 tier 有 rate limit。但沒差,老闆給我等,少囉嗦。
補記:多模態是王,但也有翻車的時候
我故意把一間非連鎖餐廳的照片二度截圖去掉位置訊息,以為不會被 AI 發現(這種 shabu 曼谷滿大街都是),結果 GPT 還是比對成功了。反而擁有 Google Map 原生圖資的 Gemini 亂猜。