實作指南

AI 客服會拿我的資料去訓練模型嗎?怎麼確認?

· 3 分鐘

「上傳的文件和客戶對話,會不會變成別人模型的養分?」這是 B2B 導入 AI 前最該問清楚的一題。拆解資料在 AI 客服系統裡的三段旅程,以及向供應商確認的五個問題。

先把問題拆對:資料其實走三段路

「會不會拿去訓練」聽起來是一個問題,實際上是三個,因為你的資料在 AI 客服系統裡走三段路。第一段,存放:文件與對話存在服務商的系統裡——問的是隔離與加密。第二段,處理:AI 回答時,內容會經過上游模型供應商(如 OpenAI、Google 這類公司)的 API——問的是他們拿這些內容做什麼。第三段,再利用:服務商自己會不會把你的資料拿去改進產品或訓練模型——問的是條款寫了什麼。三段分開問,才不會拿到一句籠統的「我們很重視您的隱私」就結束。

上游模型供應商那一段,行規是什麼?

主流模型供應商的商用 API 條款,預設不把 API 傳入的內容用於訓練其模型——這是目前的行規,也是「會不會被拿去訓練」最常指的那一段。但有一個常被略過的細節:各家基於濫用偵測,會保留短期紀錄(一般不超過 30 日),該期間內的紀錄不在服務商可刪除的範圍。所以精確的說法是:預設不訓練,但短期留存存在——供應商講得比這句更絕對的,反而值得追問依據;完整的供應商名單與保留天數,應該寫在服務商的隱私政策裡,而不是只在業務的口頭保證裡。

服務商自己那一段,要看條款的哪裡?

看兩個地方。一,隱私政策的次處理者清單:你的資料實際會經過哪些第三方(模型、向量化、基礎設施),名單完不完整、有沒有具名——法遵上這本來就該揭露,不揭露的要問為什麼。二,資料再利用條款:服務商是否保留將資料(即使是「去識別化」後)用於改進產品或訓練模型的權利——這在條款裡通常一句話帶過,卻是「會不會被訓練」真正的變數。值得注意的是,「去識別化後使用」在業界是常見安排,重點是它有沒有寫清楚、你知不知情;藏在條款深處沒人講,跟明白寫出來讓你評估,是兩種誠信。

向供應商確認的五個問題

拿去照著問:一,我的文件與對話,實際會經過哪些第三方?請給次處理者清單。二,上游供應商的資料保留天數是多少?那段期間的資料你們能不能刪?三,你們自己會不會把我的資料用於訓練或改進產品?條款第幾條?四,不同客戶之間的資料怎麼隔離?有沒有自動化測試在守?五,合約終止時,哪些資料會被刪、哪些依法保留、多久?五題都有明確答案的,才值得把客戶對話交給它;答不出第一題的,後面四題也不用問了。

Kinsunn AI 的答案

照上面五題,我們自答一輪。你的文件內容依各家商用 API 條款,預設不會被上游模型供應商用於訓練其模型;上游基於濫用偵測會保留短期紀錄(一般不超過 30 日),該期間的紀錄不在我們可刪除的範圍——完整的供應商清單與跨境傳輸說明,寫在隱私權政策裡,不是口頭保證。企業之間的知識庫隔離由自動化迴歸測試持續驗證;刪除文件時,向量索引與衍生內容一併移除。這些主張的細節——包括我們目前還沒有的,例如儲存層靜態加密尚未啟用——都攤開在資訊安全頁與該頁的常見問題區,你可以拿它直接回你們家的資安問卷。

參考資料

← 回到部落格