跳到主要內容區
I001

【資料前處理】餵給 AI 的PDF內容又張冠李戴了?三步驟解鎖 Markdown 神隊友

發佈日期 : 2026-06-12

大家在做計畫或是論文時,有沒有遇個超頭大的問題:好不容易在找到了「PDF 檔」,想要丟給 AI 幫忙分析,結果這些含有表格的資料,AI 不是看得丟三落四,就是把表格的內容整個排版大錯位,甚至連流水號和品項都對不起來?

為什麼直接轉文字餵 AI 會翻車?

很多人直覺的做法是:「就把 PDF 丟到 Google Docs(Google 文件)轉成純文字,再複製貼給 AI 。」

如果你的 PDF 內容含「複雜表格」,千萬不要這樣做!

我們用「端午節應景食品抽驗名冊」(包含日本生干貝、吳郭魚、豬肉等抽驗資料)當作範例,帶大家看看表格經過OCR文字轉檔後的「翻車現場」,並教大家如何聰明地把包含「複雜表格」的文件餵給 AI,讓它變成你的超強神隊友(若是「公文格式」、「條列清單」的文件格式也可以參照辦理)。

掃描圖檔彙整的 PDF使用 Google Docs開啟檔案自動轉檔為文字

上圖左(掃描圖檔彙整的 PDF)使用 Google Docs開啟檔案後,自動進行OCR辨識轉檔(見圖右)後,產生了表格解構、文字錯位以及特殊符號與日期提取錯誤的問題。這是因為傳統的 OCR 或單純的文字轉檔,往往會破壞文件的「空間幾何結構」。

轉檔步驟 :「圖片型 PDF」或表格截圖秒變 Markdown 格式

要把這種「圖片型 PDF」或表格截圖,一秒變成 AI 最愛的 Markdown 格式,可利用多模態 AI並搭配「提示詞(Prompt)」就能輕鬆搞定。現在的 通用型 AI(例如 Gemini 3.5)都具備「多模態(Multimodal)」能力,意思是不只能讀文字,還看得到圖片。

🛠️ 轉檔三步驟

  1. 截圖或準備檔案: 打開你的 PDF(或是使用範例檔端午節抽驗名冊),將包含表格的畫面截圖下來,或者直接使用 PDF 檔。請注意機敏資料要先去識別化後再進行下一步驟。

  2. 上傳至 AI 工具: 打開 AI 聊天對話視窗,點擊上傳(+)符號,把剛剛的圖片或 PDF 檔案傳上去。

  3. 輸入「轉換 Markdown 提示詞」: 在對話框中貼下方的提示詞並送出,AI 就會生成排版完美、橫列縱欄對得齊齊整整的 Markdown 文本了!(提示詞第4點為安排讓AI協助再次檢查個資機制,降低人工遺漏的風險。)

  4. 匯出「Markdown」格式以Gemini為例(見下方附圖紅色指示),選擇「匯出至文件)」,在 Google文件 開啟檔案後,匯出md格式。

📋 轉換 Markdown 提示詞(直接複製使用, 紅字請修改為你的情境)

請扮演一位專業的「文件結構與數據轉換專家」。請仔細觀看我上傳的這張圖片/PDF 文件,並嚴格遵循以下規則,將其中的所有內容完整轉換為 Markdown 格式

  1. 保留階層結構: 請將文件中的大標題、小標題分別使用 Markdown 的 ###### 標籤呈現。

  2. 精準表格轉換:圖片/PDF 中只要有表格(例如抽驗名冊),請務必使用 Markdown 的表格語法(| 欄位 | 欄位 |)進行轉換。每一橫列(Row)的資料必須與原圖完全對齊,絕對不能發生編號錯位、跳行或張冠李戴的情況。

  3. 文字完整性: 請逐字精準識別,不要擅自省略或簡化任何廠商名稱、地址、數據或特殊符號

  4. 隱私抓漏處理(去識別化): 在輸出的 Markdown 內容中,請主動將涉及隱私的敏感資訊進行模糊化。例如:具體的店家/攤商名稱請改為「◯◯商號」或「某某攤」;完整的地址請統一保留至縣市行政區(如:基隆市仁愛區◯◯路),後續路名與門牌請以 ◯◯ 代替。

請直接輸出轉換後的 Markdown 程式碼,不需要額外的問候語。

轉存成md格式

除了Markdown 格式 (.md),方便後續 LLM 讀取分析,如果你的資料是要對接結構化資料庫,則可使用 JSON 格式 (.json)。

這兩種格式的優劣比較看這裡:【資料前處理】AI 分析適用的檔案格式

瀏覽數: