先用文言文宣布了選型
七月二十五號早上,我在 Threads 上用文言文發了一則本地模型的評測結論:
今宣鄙見,歷旬試諸離線文模,較其短長;蘋果迷你機 M4 強化之軀,四十八吉內存之器,眾模紛陳,實用首推通義千問三點六三十五億參數三壓縮本。 預載文辭,百三十七字流於一息;逐句推演,五十字出於片時。速率從容,尚可容受。單獨之務可憑,數標滌清可仗,圖文辨字無礙,夜間批運相宜,淺層自主循環,一應雜功咸洽。 若夫裁章構筆,鋪辭抒翰,則羽禽三十五億之模,文氣渾融,語態天籟,遲速與前型相埒,故置為次選,以備緩急。 至若聲音轉錄,離線辨言,純漢之語,取通義千問三代聲識之型;漢英相參之響,用跨語辨聲之術。 其圖像甄別、聲音寫錄、數據整標諸役,不關密隱,悉付星圖輕捷雲模。值廉算力豐,繁瑣細務,一皆委託。此類素材本無私忌,縱取中土文模商用接口,亦無妨礙,特以私衷所好,遂擇此雲端之器而已。
翻回白話:機器是 Mac mini M4 Pro、48GB 記憶體。試了十來天各家離線模型之後,日常首選是 Qwen3.6-35B-A3B 的 3-bit 量化版。prefill 每秒 137 tokens,逐字生成每秒 50 tokens,這個速度我可以接受。
它扛得住的活:單一任務、資料清洗打標、OCR 圖文辨識、夜間批次、淺層的自主循環,各種雜活都行。要寫文章、鋪陳文筆的時候我會換 Ornith-35B,文氣比較順、語感比較自然,速度跟前一支差不多,所以列為次選備用。
各任務用哪一支
語音轉錄分兩種情況:純中文用 Qwen3 ASR,中英夾雜就換跨語言辨識的方案。
至於圖像辨識、語音轉寫、資料整理標註這些不涉及隱私的工作,我全部丟給 Gemini Flash 雲端模型。便宜、算力充足,雜事一律外包。這類素材本來就沒有隱私顧慮,就算用中國模型的商用 API 也無妨,只是我個人偏好才選了這個雲端方案。
有人問我本地模型到底能拿來做什麼,我列的清單是:語音轉錄、知識庫定期清掃跟連結補全、OCR 辨識、資料去敏、生成影片(很有挑戰,還在試)、生成音樂跟圖片(比我想像中厲害很多)。
還有一個模型選型上的偏方。Gemini 對 recitation error 管最嚴——就是模型背誦到版權內容時會直接中止那個限制——Qwen 最寬鬆。所以透過 OpenRouter 上的美國供應商用 Qwen 是最佳解:部署在美國資料中心,資料不會流到中國,而且模型只擋政治敏感內容,不擋版權。
真正的瓶頸不是選型
七月二十七號到三十號這四天,我在開發日誌裡反覆寫同一條結論。做了三次 A3B 對 Ornith 的對照測試,最後拍板維持原本的選擇。方法論上的收穫是:瓶頸在餵進去的證據品質,不在模型選型。
同一批日誌裡還有兩個踩坑。一個是已經除役的 qwen3-coder:30b,排程還在每晚跑,連續三個晚上產出 0 分的結果才被我發現。另一個是 qwen3.6:27b 也已除役,另外 num_predict 設太小會截斷 thinking trace。
硬體跟成本的現實
七月三十一號早上我在觀察 swap。前一天不小心兩個模型一起 load,用了一堆 swap,SSD 以 1TB/H 的速度寫入,嚇死我。現在我都要嚴格盯著 swap 使用量。
Mac mini M4 Pro 搬機那次倒是撿到一個驚喜。用 Migration Assistant 機對機遷移,TCC 權限意外跟著搬過來,省去逐一重新授權。
如果有人問要不要跑 local,我的建議是這樣:雲端模型的話 8GB 就可以跑。Local 模型就要看規格了,但先想清楚為什麼想跑 local。如果是為了隱私,合理;如果是為了省錢,那不太合理——因為你要讓 local 跑出堪比商業模型的表現,首先必須花錢堆硬體。一開始先不要想太多 local,一般閉源模型玩熟了再說。
三大劣根性
七月三十號晚上,我在 Threads 上招認了自己這兩週的德性:
這兩週 弄來Mac Mini + 開始玩本地模型 + Anthropic/OpenAI 大玩重置後,才發現我身上有三大劣根性:
- 慣老闆: 半夜睡覺也要操Mac,設了一堆本地模型排程讓他處理任務。如果有空檔?那就去擁抱臉拉幾個下來跑Benchmark測試
我女友問說書房怎麼比以前熱,我不知道是不是該回他因為一直在跑模型
免費蕭貪仔: 反正拉開源模型不花錢,儘量拉儘量測!反正Mac Mini的耗能少到可以忽略…
吃到飽不吃撐不甘心: 重置給我的額度沒用完我會遺憾到錘心肝,所以一reset就開始猛用,這個月token假設用API算已經破萬美金…
以上三個劣根性,反省中
前幾天有人在我貼文底下提到小模型,我回他:聰明,現在大家都在卷大模型,小模型未來才是遍地開花的關鍵。