跳到主要內容區
I001

【資料前處理】AI 分析適用的檔案格式

發佈日期 : 2026-06-11

文件分析三階段

文件用於 AI 分析 通常橫跨了資料前處理的三個階段,以下以 PDF 為例:

[ 原始 PDF ] 本機端先完成去識別化隱私資料      │      ▼ 【 1. 資料解析與提取 (Data Extraction) 】 -> 利用 OCR 或多模態 AI 辨識出文字與表格      │      ▼ 【 2. 資料清理 (Data Cleaning) 】            -> 修正錯位、濾除線條雜訊、再次去識別化隱私(AI抓漏 )      │      ▼ 【 3. 資料結構化 (Data Structuring) 】   -> 轉為 Markdown 格式 (.md),方便後續 LLM 讀取或轉為 JSON 格式 (.json) 對接結構化資料庫

一般使用者多止步於「資料解析與提取」階段,忽略了後續兩個階段,因而造成 AI 資料分析不正確的原因之一。

適用 AI 分析的檔案格式

若要將包含「公文格式」、「複雜表格」、「條列清單」的文件提供給 AI 進行分析,適用的檔案格式可參考以下分析表,依你自身情境選擇適用格式。

格式 Markdown 格式 (.md) JSON 格式 (.json) 
優勢 目前大語言模型(LLM)最喜歡且理解能力最好的格式。人類直接閱讀一目了然。適合邊清理資料邊進行人工校對。Token 成本低。適合處理「半結構化資料」(如:公文與表格並存的文件)。 高度結構化與精確性,程式可以 100% 精準地定位、撈取、過濾特定欄位,非常適合直接對接向量資料庫。語法嚴謹且防錯。資料型態明確,如:能夠明確告訴機器「111」是數字而非純文字。
劣勢 資料檢索不夠精準(非嚴格結構化),如:精確撈取所有『吳郭魚』的『檢驗項目』,程式解析起來會比 JSON 費力。
缺乏嚴格的語法校驗,雖然 AI 可能看得懂,但對於傳統程式自動化管線來說,容易造成解析錯誤。
對於非結構化的公文敘述(如主旨、說明),JSON 的呈現會比較臃腫(Token 消耗巨大)。人類閱讀體驗差。不適合處理非結構化敘述。
實務策略 AI 能精準識別哪一段是公文主旨、哪一列是缺失項目,絕不會發生像上圖右側那樣表格行內文字前後錯位的狀況。
適用於分析與檢索階段(RAG)
欄位絕對不會錯置,AI 可以進行 100% 精準的定量分析(例如統計哪一食品違反最多次)。
適用於輸出與落地階段。

執行轉檔步驟對 AI 分析的優點

  • 提高檢索精確度(RAG 最佳化): 如果不進行這層清理,直接將雜亂的文字切片(Chunking)丟進向量資料庫,AI 在檢索時就會抓到破碎、上下不連貫的資料。

  • 節約 Token 成本: PDF 圖檔或是轉換失敗的冗餘純文字含有太多廢話。Markdown 用最精簡的純文字符號(如 |)代替了複雜的排版,能大幅幫你省下餵給 AI 時的 Token 消耗與花費。

如果你遇過將內含表格的 PDF 檔讓 AI 幫忙分析,結果 AI 不是看得丟三落四,就是連關鍵數據都看錯,那麼你可以參考下面這篇文章:

【資料前處理】餵給 AI 的PDF內容又張冠李戴了?三步驟解鎖 Markdown 神隊友

瀏覽數: