← 回作品列表

流程自動化 · Python

報告 PDF 自動命名

事務機掃出來的報告 PDF,檔名全是一串亂碼。要用報告編號重新命名,每一份都得打開來確認。我用 Python 加 OCR 抓出頁面上的編號直接批次改名,兩個部門每天近百份報告,處理時間從一個下午縮到 5 到 10 分鐘。

流程自動化 文件辨識

為什麼要做這個作品?

掃描報告進電腦之後,檔名是事務機給的一串亂碼。要用報告編號命名,人員得一份一份打開來確認。我們每天大概有近百份報告,這件事不難,但每天都在發生。

我不想做一個很華麗的文件平台,只想先把「檔案叫什麼」這部分落實。名稱對了,後面要歸檔、要查、要交接,才走得動。

包含哪些功能?

  • 用 OCR 讀出報告頁面上的編號,只抓關鍵位置、不辨識整頁,掃描速度很快。
  • 批次改名,不用一份一份打開來對。
  • 目前兩個部門在用,每天固定處理近百份。
  • 用 Python 完成,之後同類文件可以沿用同一套做法。

遇到什麼困難?

這件事做得起來,前提是我們的報告格式都一樣,編號永遠在同一個位置,OCR 只要抓那一塊就好。

真正麻煩的是掃描解析度。同一台事務機掃出來的檔案清晰度並不一致,模糊的那幾份辨識就會出錯。報告編號只由英文字母和數字組成,所以後來的做法是針對字母和數字之間容易認錯的組合做比對修正,把辨識結果調回可以用的程度。

回頭看

小自動化非常值得做,尤其是每天需要不斷重複的事情。透過這種小型的自動化,可以讓同仁更容易接受自動化上線,也比較能接受工作流程的改動,因為這有直接解決到他們的痛點。等他們感受過一次,後面要再推別的系統或流程調整,就好談很多。