深度文件理解

業務不用再翻型錄找答案

規格書、報價單、型錄、SOP 直接上傳。AI 讀得懂裡面的表格與圖說,而不只是把文字倒出來。

我的規格書,AI 真的讀得懂嗎?

讀得懂的關鍵不在「能不能開啟 PDF」,而在能不能理解裡面的表格、單位與圖說。一份 datasheet 的答案通常不是一句話,而是一張表格裡的某一列、加上頁尾的一條備註 —— 把整份文件轉成純文字再丟給 AI,那兩件事會被拆散。

Kinsunn AI 保留文件的結構後才交給 AI:表格維持成表格、圖說跟著它說明的那張圖、章節層次不被壓平。所以 AI 回答「這顆料的工作溫度範圍」時,拿到的是那一列規格,而不是一段被打散的文字。

簡報與圖片會逐頁「看圖」辨識,連圖表裡的數字都讀得到 —— 不必先轉成 PDF,也不必自己把表格重打一遍。

支援哪些檔案格式?

常見的辦公文件與圖片直接上傳就能用,不需要先轉檔。

文件PDF、Word(.doc / .docx)
試算表Excel(.xls / .xlsx)、CSV
簡報PowerPoint(.ppt / .pptx)
純文字.txt、Markdown(.md / .mdx)
圖片JPG、PNG —— 逐頁辨識,含圖表裡的數字

單檔大小上限依訂閱方案而不同,方案愈高、單一檔案可以傳得愈大。實際數字會顯示在後台的文件頁,並標明你目前的方案。

為什麼不支援網頁檔(.html)?

因為網頁可以夾帶程式碼,而且沒有可驗證的檔案特徵。

我們對每一個上傳的檔案做兩道檢查:副檔名要在支援清單內,而且檔案開頭的真實位元組必須與副檔名相符 —— 改名成 .pdf 的執行檔會在這裡被擋下。但 HTML 是唯一沒有這種特徵、又能攜帶腳本的格式,第二道檢查對它是空的,所以我們選擇不開放。

要把網頁內容放進知識庫,用瀏覽器「列印 → 另存 PDF」,或把文字貼進 .txt / .md 再上傳。

可以直接給網址,讓 AI 自己去抓嗎?

目前只收上傳的檔案,不收網址。不是做起來麻煩,而是抓回來的東西不一定是你以為的那份 —— 知識庫裡放進一份看起來正確、其實殘缺的資料,比缺這份資料還麻煩。

現在的網頁多半是打開之後才由瀏覽器組出畫面:價格、規格表、要點開才看得到的分頁,常常是後來才載入的。程式去抓同一個網址,拿到的往往是還沒長出內容的骨架;就算抓得到,導覽列、頁尾、彈窗與推薦商品也會一起混進正文,表格最容易在這一步被拆散。這些內容一旦進了知識庫,AI 會照著它回答 —— 它分辨不出這份資料當初就抓歪了。

網頁還會在你不知道的時候改版。今天抓到的價格,下個月頁面一改就對不上,知識庫卻不會跟著變。上傳的檔案不一樣:你知道自己傳了什麼、什麼時候傳的,要更新就重傳一次。

所以要把網站上的內容放進知識庫,還是回到上一段的作法:用瀏覽器「列印 → 另存 PDF」,把你眼睛看到的版面存下來,或把正文貼進 .txt / .md。多這一步,換到的是「你清楚知道知識庫裡放的是哪一版」。

幾百份文件裡的答案,怎麼找得到?

三種檢索同時運轉,各自擅長不同的找法。

語意檢索負責「意思相近但用字不同」—— 客人問「耐不耐熱」,文件裡寫的是「工作溫度範圍」。關鍵字檢索(BM25)負責相反的情況:料號、型號、規格代碼這種一個字都不能錯的東西,語意相似度反而幫倒忙。

知識圖譜(GraphRAG)與階層式索引(RAPTOR)負責跨文件:當答案不在單一段落裡,而要把 A 文件的規格、B 文件的相容性說明、C 報價單的條件湊起來才成立時,靠的是這一層。

三者的結果會合併後重新排序,再交給 AI 作答。單獨用其中一種,都會在某類問題上失手,這也是為什麼我們不挑一種用。

文件要怎麼準備,AI 才查得準?

最有效的一件事是「一份文件講一件事」,而不是把所有東西塞進一份 50 頁的大 PDF。

系統檢索的單位是「片段」。一份混雜產品、價格、政策與活動的大文件,切出來的片段主題混雜,彼此互相干擾;而且日後要更新其中一段(尤其是會過期的優惠),得整份重傳。

完整的準備方法、各行業該放哪些文件、以及怎麼寫才容易被查到,都寫在線上手冊裡。

知識庫建立指南(線上手冊,含各行業的文件清單與撰寫建議)

上傳的文件會不會被別家看到?

每一家企業有自己獨立的知識庫,A 公司上傳的文件不會出現在 B 公司的 AI 回答裡。

系統裡沒有共用知識庫,也沒有「查不到就退回去查別人」的後備知識庫。每一次檢索都必須帶上該企業自己的知識庫識別碼,取不到就直接回空結果。

刪除一份文件時,向量索引、原始檔、摘要卡、每頁原圖與存取權限設定會一併移除 —— 這條沒有開關可以關掉。

資訊安全(資料存放、企業隔離、傳輸加密、提示注入防護、稽核紀錄與資料刪除,逐條說明)

使用前先知道

有幾件事,我們先講在前面

掃描件的品質決定辨識品質

歪斜、模糊或解析度太低的掃描件,辨識結果會跟著打折。原生的電子檔(直接從軟體匯出的 PDF)一律優於掃描件。

頁數多會處理比較久

簡報與圖片是逐頁辨識的,所以一份幾百頁的文件不會在幾秒內完成。上傳後可以先做別的事,處理完會顯示在文件列表。

文件沒寫的,AI 不會替你補

知識庫裡查不到的東西,AI 的預設行為是誠實說不確定並轉給真人,而不是自己編一個看起來合理的答案。這是刻意的取捨 —— 對技術問答來說,答錯比答不出來貴得多。

網頁上的內容要自己先轉一次

.html / .htm 基於安全考量不開放上傳;貼網址讓 AI 自己去抓也不在支援之列,因為抓回來的內容不可靠。兩種情況都是先另存為 PDF 或貼成純文字,理由都寫在上方。

本頁最後更新:2026-08-20

全年無休的金牌業務客服
今天就上線

Kinsunn AI 專精於複雜文件與各種專業場景,歡迎預約測試。

有問題?直接寫信:[email protected]