技術解析

RAG 企業知識庫:為什麼答案要附來源頁碼

RAG 依你的文件檢索後回答,每則答案標註來源檔名與頁碼可查證;找不到夠相關內容時選擇不回答。談 PDF 匯入、OCR、租戶隔離,以及不將客戶資料用於自家通用模型訓練的政策。

·約 7 分鐘閱讀·上騏科技 SHANGQI AI

企業導入 AI 知識庫時最在意的兩件事,往往是「答案準不準」與「資料安不安全」。 這兩個問題的核心,都指向同一個技術選擇:RAG(檢索增強生成)

什麼是 RAG?

一般的通用大型語言模型,是依它「記得的」知識回答,碰到不確定的內容容易臆測。 RAG 的做法不同:它先從你提供的文件裡檢索出相關段落,再依據這些段落生成答案。 換句話說,回答的依據是你的資料,而不是模型對世界的籠統印象。

一句話分辨:通用模型「憑記憶回答」,RAG「先翻你的文件再回答」。對企業知識庫來說,後者才靠得住。

為什麼答案要附來源頁碼?

知識助理的每則答案都會標註來源檔名與頁碼。這個設計看似小,實際很關鍵:

  • 可查證:使用者能直接翻到原始文件那一頁,確認答案是否被正確引用。
  • 可究責:當文件本身過時或有誤,能快速定位是哪一份、哪一頁要更新。
  • 可信任:附來源的答案,比一段「聽起來很有道理」的純文字更值得採信。

找不到就不答:min-score 的價值

RAG 在檢索時會評估文件段落與問題的相關度。知識助理設有相關度門檻(min-score): 當系統判斷找不到夠相關的內容時,會選擇不回答,明確告知「目前文件沒有這項資訊」,而不是硬湊一個答案。

這能大幅降低幻覺風險。對企業而言,一個「敢說不知道」的客服,遠比一個「什麼都答得出來、但可能答錯」的客服安全。 這一點,我們在AI 客服能做什麼、不能承諾什麼裡也談過。

文件怎麼進來?PDF、OCR 與索引更新

知識庫的內容來源與維護,務實情況如下:

  • 以 PDF 匯入為主;導入階段顧問會協助把 Word、Excel、PowerPoint、SOP 整理轉成 PDF,你不需要自己重做問答集。
  • 掃描版/圖片型 PDF 可透過 OCR 擷取文字後納入檢索。
  • 文件更新後需重建索引,新內容才會反映到回答裡——這是維護時要納入的步驟。

資料安全:租戶隔離與訓練政策

隔離與訓練政策

知識庫採租戶隔離,各企業的資料彼此不互通;上騏不將客戶資料用於自家通用模型訓練。 若採第三方雲端模型,依供應商與方案的資料處理條款處理;若需資料不外送,採本地/私有部署方案。

推論在哪裡跑

若方案使用雲端模型,會依資料處理政策交由該模型服務處理; 也可依方案改採本地/私有模型不外送。實際採用哪一種,依貴司的資安要求與方案規劃決定。

涉及地端部署、私有雲、企業級資安稽核等細節,會依專案需求由顧問評估規劃,不在公開頁面一概承諾。

小結

RAG 讓 AI 的回答「有憑有據」:依你的文件檢索、附來源頁碼、找不到就不答。 加上租戶隔離、以及「不將客戶資料用於自家通用模型訓練」的政策,這正是企業知識庫值得信任的基礎。 想看實際的知識助理能力,可前往知識助理頁面。

常見問題 FAQ

支援哪些檔案格式?

系統以 PDF 匯入為主;導入階段我們的顧問會協助將您現有的 Word、Excel、PowerPoint、SOP 等文件整理並轉換為 PDF 後匯入,您無需自行重做問答集。掃描版/圖片型 PDF 可透過 OCR 擷取文字;其他格式由顧問先轉 PDF,並非直接上傳任意圖片檔。

資料會不會外洩或被拿去訓練?

採租戶隔離,各企業資料彼此不互通。上騏不將客戶資料用於自家通用模型訓練;若採第三方雲端模型,依供應商與方案的資料處理條款處理;若需資料不外送,採本地/私有部署方案。

想知道您的流程適不適合?

先做一次 AI 檢核,或從單一入口試行開始。我們的顧問會依貴司現有的 LINE、官網與既有文件,盤點最合適的切入點。

前往 AI 檢核