【資料前處理】AI 分析適用的檔案格式
發佈日期 :
2026-06-11
文件分析三階段
文件用於 AI 分析 通常橫跨了資料前處理的三個階段,以下以 PDF 為例:
一般使用者多止步於「資料解析與提取」階段,忽略了後續兩個階段,因而造成 AI 資料分析不正確的原因之一。
適用 AI 分析的檔案格式
若要將包含「公文格式」、「複雜表格」、「條列清單」的文件提供給 AI 進行分析,適用的檔案格式可參考以下分析表,依你自身情境選擇適用格式。
| 格式 | Markdown 格式 (.md) | JSON 格式 (.json) |
| 優勢 | 目前大語言模型(LLM)最喜歡且理解能力最好的格式。人類直接閱讀一目了然。適合邊清理資料邊進行人工校對。Token 成本低。適合處理「半結構化資料」(如:公文與表格並存的文件)。 | 高度結構化與精確性,程式可以 100% 精準地定位、撈取、過濾特定欄位,非常適合直接對接向量資料庫。語法嚴謹且防錯。資料型態明確,如:能夠明確告訴機器「111」是數字而非純文字。 |
| 劣勢 | 資料檢索不夠精準(非嚴格結構化),如:精確撈取所有『吳郭魚』的『檢驗項目』,程式解析起來會比 JSON 費力。 缺乏嚴格的語法校驗,雖然 AI 可能看得懂,但對於傳統程式自動化管線來說,容易造成解析錯誤。 |
對於非結構化的公文敘述(如主旨、說明),JSON 的呈現會比較臃腫(Token 消耗巨大)。人類閱讀體驗差。不適合處理非結構化敘述。 |
| 實務策略 | AI 能精準識別哪一段是公文主旨、哪一列是缺失項目,絕不會發生像上圖右側那樣表格行內文字前後錯位的狀況。 適用於分析與檢索階段(RAG) |
欄位絕對不會錯置,AI 可以進行 100% 精準的定量分析(例如統計哪一食品違反最多次)。 適用於輸出與落地階段。 |
執行轉檔步驟對 AI 分析的優點
-
提高檢索精確度(RAG 最佳化): 如果不進行這層清理,直接將雜亂的文字切片(Chunking)丟進向量資料庫,AI 在檢索時就會抓到破碎、上下不連貫的資料。
-
節約 Token 成本: PDF 圖檔或是轉換失敗的冗餘純文字含有太多廢話。Markdown 用最精簡的純文字符號(如 |)代替了複雜的排版,能大幅幫你省下餵給 AI 時的 Token 消耗與花費。
如果你遇過將內含表格的 PDF 檔讓 AI 幫忙分析,結果 AI 不是看得丟三落四,就是連關鍵數據都看錯,那麼你可以參考下面這篇文章:

![[ 原始 PDF ] 本機端先完成去識別化隱私資料 │ ▼ 【 1. 資料解析與提取 (Data Extraction) 】 -> 利用 OCR 或多模態 AI 辨識出文字與表格 │ ▼ 【 2. 資料清理 (Data Cleaning) 】 -> 修正錯位、濾除線條雜訊、再次去識別化隱私(AI抓漏 ) │ ▼ 【 3. 資料結構化 (Data Structuring) 】 -> 轉為 Markdown 格式 (.md),方便後續 LLM 讀取或轉為 JSON 格式 (.json) 對接結構化資料庫](/static/file/2/1002/img/312280600.png)