目錄
最近在用 AI 處理客戶資料時,客戶明確希望機敏資料不該送去 AI 伺服器。但我在找去識別化工具時發現一個問題:台灣的個資格式——身分證、手機、統編——沒有現成的工具支援。
所以我結合了國外的開源套件跟本地化的修改,做了 pii-guard-tw。它可以把文件裡的個資自動替換成佔位符,讓你丟給 AI 處理完再還原回來。真實資料全程不離開你的電腦。
支援偵測的個資類型
- 身分證字號、居留證號、護照號碼
- 手機號碼(09 開頭 / +886)、市話
- Email、信用卡號
- 統一編號、車牌、出生日期、銀行帳號
- 人名、組織名、地名(透過 CKIP BERT 中研院模型辨識)
支援的檔案格式
- 純文字(.txt / .csv / .tsv)
- Excel(.xlsx)— 逐格處理,保留格式
- Word(.docx)— 段落加表格都處理
- PDF(.pdf)— 提取文字後處理
MCP 整合
也有 MCP server 可以直接接 Claude Code,在你的工作流中無縫使用。
現在還是很草創,歡迎大家提 issue 跟 PR。
給 API / Enterprise 用戶的補充
Claude API 和 Enterprise 用戶可以參考官方的 ZDR(Zero Data Retention)政策,資料本來就不會留著。一般訂閱用戶除了用去識別化工具之外,也要記得去設定裡把「同意用我的資料訓練模型」關掉,這樣你的資料就只會在 Anthropic 存 30 天,而不是五年。
補記:還沒解決的部分
話雖如此,但商用 Agent 的越權跟隔離問題我還在研究,考慮未來走 Proxy 配置。另外,批量文檔處理跟多格式文檔處理也是未來努力的方向。
歡迎有興趣協作者一起試用,也歡迎所有的 issue 跟 PR。
補記:本地模型抓機敏資料的召回率實測
去機敏我有實測。qwen2.5:1.5b 3/16,快但漏太多;qwen3-vl:8b 14/16,很快但答案欄位異常且漏人;qwen3-coder:30b 15/16,單測尚可但完整流程超過 110 秒且中途失敗;qwen3.6:35b-a3b 16/16,最完整也最穩定。不要直接讓本地模型去處理,先用 regex 腳本掃一次,本地模型只是用來涵蓋邊界狀況。
補記:這個週末更新——瀏覽器模式、PDF 直傳、加強模式
這個週末更新了三件事。第一,不用再開 Ollama 也能用了:裝好、打一行指令、瀏覽器開一頁,選檔案、看去識別化結果、把漏掉的名字用滑鼠圈起來補遮、下載。全部在自己電腦上跑,對照表不會經過網頁,也不會進任何 log。第二,文字型 PDF 可以直接丟進去,它會把字抽出來走同一套流程,解析關在一個有時間和記憶體上限的獨立小程序裡做,PDF 壞掉或藏東西也只會拿到一句固定的錯誤訊息。第三,想再保險一點可以勾「加強模式」:它會叫本機的 Ollama 把每一段文字看三次,三次都過才放行,沒過之前你連去識別化的文字都看不到;長文件不會整份丟進去,會先用規則挑出可疑段落跟前後文。