Skip to content
Dustin's AI Lab
Go back
Updated:

PII Guard TW:為台灣打造的個資去識別化工具

台灣的個資格式沒有現成的去識別化工具。所以我自己做了一個,讓機敏資料不離開你的電腦就能安全送 AI 處理。

目錄
  1. 支援偵測的個資類型
  2. 支援的檔案格式
  3. MCP 整合
  4. 給 API / Enterprise 用戶的補充
  5. 補記:還沒解決的部分
  6. 補記:本地模型抓機敏資料的召回率實測
  7. 補記:這個週末更新——瀏覽器模式、PDF 直傳、加強模式

最近在用 AI 處理客戶資料時,客戶明確希望機敏資料不該送去 AI 伺服器。但我在找去識別化工具時發現一個問題:台灣的個資格式——身分證、手機、統編——沒有現成的工具支援。

所以我結合了國外的開源套件跟本地化的修改,做了 pii-guard-tw。它可以把文件裡的個資自動替換成佔位符,讓你丟給 AI 處理完再還原回來。真實資料全程不離開你的電腦。

支援偵測的個資類型

支援的檔案格式

MCP 整合

也有 MCP server 可以直接接 Claude Code,在你的工作流中無縫使用。

現在還是很草創,歡迎大家提 issue 跟 PR。

給 API / Enterprise 用戶的補充

Claude API 和 Enterprise 用戶可以參考官方的 ZDR(Zero Data Retention)政策,資料本來就不會留著。一般訂閱用戶除了用去識別化工具之外,也要記得去設定裡把「同意用我的資料訓練模型」關掉,這樣你的資料就只會在 Anthropic 存 30 天,而不是五年。

補記:還沒解決的部分

話雖如此,但商用 Agent 的越權跟隔離問題我還在研究,考慮未來走 Proxy 配置。另外,批量文檔處理跟多格式文檔處理也是未來努力的方向。

歡迎有興趣協作者一起試用,也歡迎所有的 issue 跟 PR。

補記:本地模型抓機敏資料的召回率實測

去機敏我有實測。qwen2.5:1.5b 3/16,快但漏太多;qwen3-vl:8b 14/16,很快但答案欄位異常且漏人;qwen3-coder:30b 15/16,單測尚可但完整流程超過 110 秒且中途失敗;qwen3.6:35b-a3b 16/16,最完整也最穩定。不要直接讓本地模型去處理,先用 regex 腳本掃一次,本地模型只是用來涵蓋邊界狀況。

補記:這個週末更新——瀏覽器模式、PDF 直傳、加強模式

這個週末更新了三件事。第一,不用再開 Ollama 也能用了:裝好、打一行指令、瀏覽器開一頁,選檔案、看去識別化結果、把漏掉的名字用滑鼠圈起來補遮、下載。全部在自己電腦上跑,對照表不會經過網頁,也不會進任何 log。第二,文字型 PDF 可以直接丟進去,它會把字抽出來走同一套流程,解析關在一個有時間和記憶體上限的獨立小程序裡做,PDF 壞掉或藏東西也只會拿到一句固定的錯誤訊息。第三,想再保險一點可以勾「加強模式」:它會叫本機的 Ollama 把每一段文字看三次,三次都過才放行,沒過之前你連去識別化的文字都看不到;長文件不會整份丟進去,會先用規則挑出可疑段落跟前後文。


15 分鐘導入診斷

填表預約你的專屬 1 對 1 免費診斷時段,了解你可以怎麼無痛與 AI 協作、大幅提升生產力。

預約免費診斷
Share this post on:
Previous Post
派更多 subagent 不會讓你更快
Next Post
沒拋錯不代表成功:靜默失敗、Opus 捏造工具輸出,以及一個擋得住的 hook