企業導入 AI 知識庫時最在意的兩件事,往往是「答案準不準」與「資料安不安全」。 這兩個問題的核心,都指向同一個技術選擇:RAG(檢索增強生成)。
什麼是 RAG?
一般的通用大型語言模型,是依它「記得的」知識回答,碰到不確定的內容容易臆測。 RAG 的做法不同:它先從你提供的文件裡檢索出相關段落,再依據這些段落生成答案。 換句話說,回答的依據是你的資料,而不是模型對世界的籠統印象。
為什麼答案要附來源頁碼?
知識助理的每則答案都會標註來源檔名與頁碼。這個設計看似小,實際很關鍵:
- 可查證:使用者能直接翻到原始文件那一頁,確認答案是否被正確引用。
- 可究責:當文件本身過時或有誤,能快速定位是哪一份、哪一頁要更新。
- 可信任:附來源的答案,比一段「聽起來很有道理」的純文字更值得採信。
找不到就不答:min-score 的價值
RAG 在檢索時會評估文件段落與問題的相關度。知識助理設有相關度門檻(min-score): 當系統判斷找不到夠相關的內容時,會選擇不回答,明確告知「目前文件沒有這項資訊」,而不是硬湊一個答案。
這能大幅降低幻覺風險。對企業而言,一個「敢說不知道」的客服,遠比一個「什麼都答得出來、但可能答錯」的客服安全。 這一點,我們在AI 客服能做什麼、不能承諾什麼裡也談過。
文件怎麼進來?PDF、OCR 與索引更新
知識庫的內容來源與維護,務實情況如下:
- 以 PDF 匯入為主;導入階段顧問會協助把 Word、Excel、PowerPoint、SOP 整理轉成 PDF,你不需要自己重做問答集。
- 掃描版/圖片型 PDF 可透過 OCR 擷取文字後納入檢索。
- 文件更新後需重建索引,新內容才會反映到回答裡——這是維護時要納入的步驟。
資料安全:租戶隔離與訓練政策
隔離與訓練政策
知識庫採租戶隔離,各企業的資料彼此不互通;上騏不將客戶資料用於自家通用模型訓練。 若採第三方雲端模型,依供應商與方案的資料處理條款處理;若需資料不外送,採本地/私有部署方案。
推論在哪裡跑
若方案使用雲端模型,會依資料處理政策交由該模型服務處理; 也可依方案改採本地/私有模型不外送。實際採用哪一種,依貴司的資安要求與方案規劃決定。
小結
RAG 讓 AI 的回答「有憑有據」:依你的文件檢索、附來源頁碼、找不到就不答。 加上租戶隔離、以及「不將客戶資料用於自家通用模型訓練」的政策,這正是企業知識庫值得信任的基礎。 想看實際的知識助理能力,可前往知識助理頁面。