深度文件理解
規格書、報價單、型錄、SOP 直接上傳。AI 讀得懂裡面的表格與圖說,而不只是把文字倒出來。
讀得懂的關鍵不在「能不能開啟 PDF」,而在能不能理解裡面的表格、單位與圖說。一份 datasheet 的答案通常不是一句話,而是一張表格裡的某一列、加上頁尾的一條備註 —— 把整份文件轉成純文字再丟給 AI,那兩件事會被拆散。
Kinsunn AI 保留文件的結構後才交給 AI:表格維持成表格、圖說跟著它說明的那張圖、章節層次不被壓平。所以 AI 回答「這顆料的工作溫度範圍」時,拿到的是那一列規格,而不是一段被打散的文字。
簡報與圖片會逐頁「看圖」辨識,連圖表裡的數字都讀得到 —— 不必先轉成 PDF,也不必自己把表格重打一遍。
常見的辦公文件與圖片直接上傳就能用,不需要先轉檔。
| 文件 | PDF、Word(.doc / .docx) |
|---|---|
| 試算表 | Excel(.xls / .xlsx)、CSV |
| 簡報 | PowerPoint(.ppt / .pptx) |
| 純文字 | .txt、Markdown(.md / .mdx) |
| 圖片 | JPG、PNG —— 逐頁辨識,含圖表裡的數字 |
單檔大小上限依訂閱方案而不同,方案愈高、單一檔案可以傳得愈大。實際數字會顯示在後台的文件頁,並標明你目前的方案。
因為網頁可以夾帶程式碼,而且沒有可驗證的檔案特徵。
我們對每一個上傳的檔案做兩道檢查:副檔名要在支援清單內,而且檔案開頭的真實位元組必須與副檔名相符 —— 改名成 .pdf 的執行檔會在這裡被擋下。但 HTML 是唯一沒有這種特徵、又能攜帶腳本的格式,第二道檢查對它是空的,所以我們選擇不開放。
要把網頁內容放進知識庫,用瀏覽器「列印 → 另存 PDF」,或把文字貼進 .txt / .md 再上傳。
目前只收上傳的檔案,不收網址。不是做起來麻煩,而是抓回來的東西不一定是你以為的那份 —— 知識庫裡放進一份看起來正確、其實殘缺的資料,比缺這份資料還麻煩。
現在的網頁多半是打開之後才由瀏覽器組出畫面:價格、規格表、要點開才看得到的分頁,常常是後來才載入的。程式去抓同一個網址,拿到的往往是還沒長出內容的骨架;就算抓得到,導覽列、頁尾、彈窗與推薦商品也會一起混進正文,表格最容易在這一步被拆散。這些內容一旦進了知識庫,AI 會照著它回答 —— 它分辨不出這份資料當初就抓歪了。
網頁還會在你不知道的時候改版。今天抓到的價格,下個月頁面一改就對不上,知識庫卻不會跟著變。上傳的檔案不一樣:你知道自己傳了什麼、什麼時候傳的,要更新就重傳一次。
所以要把網站上的內容放進知識庫,還是回到上一段的作法:用瀏覽器「列印 → 另存 PDF」,把你眼睛看到的版面存下來,或把正文貼進 .txt / .md。多這一步,換到的是「你清楚知道知識庫裡放的是哪一版」。
三種檢索同時運轉,各自擅長不同的找法。
語意檢索負責「意思相近但用字不同」—— 客人問「耐不耐熱」,文件裡寫的是「工作溫度範圍」。關鍵字檢索(BM25)負責相反的情況:料號、型號、規格代碼這種一個字都不能錯的東西,語意相似度反而幫倒忙。
知識圖譜(GraphRAG)與階層式索引(RAPTOR)負責跨文件:當答案不在單一段落裡,而要把 A 文件的規格、B 文件的相容性說明、C 報價單的條件湊起來才成立時,靠的是這一層。
三者的結果會合併後重新排序,再交給 AI 作答。單獨用其中一種,都會在某類問題上失手,這也是為什麼我們不挑一種用。
最有效的一件事是「一份文件講一件事」,而不是把所有東西塞進一份 50 頁的大 PDF。
系統檢索的單位是「片段」。一份混雜產品、價格、政策與活動的大文件,切出來的片段主題混雜,彼此互相干擾;而且日後要更新其中一段(尤其是會過期的優惠),得整份重傳。
完整的準備方法、各行業該放哪些文件、以及怎麼寫才容易被查到,都寫在線上手冊裡。
→ 知識庫建立指南(線上手冊,含各行業的文件清單與撰寫建議)
每一家企業有自己獨立的知識庫,A 公司上傳的文件不會出現在 B 公司的 AI 回答裡。
系統裡沒有共用知識庫,也沒有「查不到就退回去查別人」的後備知識庫。每一次檢索都必須帶上該企業自己的知識庫識別碼,取不到就直接回空結果。
刪除一份文件時,向量索引、原始檔、摘要卡、每頁原圖與存取權限設定會一併移除 —— 這條沒有開關可以關掉。
→ 資訊安全(資料存放、企業隔離、傳輸加密、提示注入防護、稽核紀錄與資料刪除,逐條說明)
使用前先知道
歪斜、模糊或解析度太低的掃描件,辨識結果會跟著打折。原生的電子檔(直接從軟體匯出的 PDF)一律優於掃描件。
簡報與圖片是逐頁辨識的,所以一份幾百頁的文件不會在幾秒內完成。上傳後可以先做別的事,處理完會顯示在文件列表。
知識庫裡查不到的東西,AI 的預設行為是誠實說不確定並轉給真人,而不是自己編一個看起來合理的答案。這是刻意的取捨 —— 對技術問答來說,答錯比答不出來貴得多。
.html / .htm 基於安全考量不開放上傳;貼網址讓 AI 自己去抓也不在支援之列,因為抓回來的內容不可靠。兩種情況都是先另存為 PDF 或貼成純文字,理由都寫在上方。
本頁最後更新:2026-08-20