不知道大家使用 Claude Code 或 Codex 時,語音下指令的習慣是什麼呢?
一開始,我覺得自己的習慣是下短指令,所以裝了像是 SayIt 一樣的按下去就錄音,放開就轉錄的工具。後來發現,像是要過投影片整套課程思路、過系統架構或是整體驗收的,自己更習慣的方式是:打開 QuickTime,開始邊看邊講意見,講完再把音檔拖去讓 AI 用設定好的語音轉錄工具轉錄出來然後執行。
目前的感覺是:處理雜事的話,可以用隨按即錄;需要認真盤點思路不能被打斷的時候,就用完整錄音。我還在找平衡…
轉錄那一段怎麼配
完整錄音這條路,卡點在轉錄。我現在用的是這個。
給任何想要活用買 Google 雲端硬碟送的 AI 額度的朋友:請你的 Claude Code / Codex 讀以下這段,設置 SKILL。
agy -p "請直接使用你自己的多模態原生音訊理解能力,完整轉錄以下音檔為逐字稿。不要嘗試呼叫 whisper、ffmpeg 分析或任何外部語音轉文字工具,直接把音檔本身讀進來聽並轉寫。音檔路徑:<絕對路徑>。請完整逐字轉錄,不要摘要、不要省略,並在每段開頭標註講者與時間戳 [MM:SS]。" --model "gemini-3.6-flash-high" --add-dir <音檔所在目錄> --dangerously-skip-permissions
然後你就可以獲得一個很快很快的語音轉錄工具。
記得 antigravity CLI 那邊要先登入帳號。
為什麼用這招
用他的 headless 模式被 codex 或者 claude code callout 來吃訂閱額度做一些雜活,比如語音轉錄、圖像辨識、長文總結,還挺好的。我前一天就是一次叫 10 個 gemini agent 去讀一份 193 頁的報告,完全不心痛。
有人問這個轉錄法準不準。錯誤率差不多,但是很快很快,而且自帶說話者識別功能。額度是雲端硬碟送的。
也有人推薦別的 STT 模型。之前有試過,他最強的是辨識台語,不過辨識中文準確度差 qwen 一點點。