為什麼要做這個作品?
掃描報告進電腦之後,檔名是事務機給的一串亂碼。要用報告編號命名,人員得一份一份打開來確認。我們每天大概有近百份報告,這件事不難,但每天都在發生。
我不想做一個很華麗的文件平台,只想先把「檔案叫什麼」這部分落實。名稱對了,後面要歸檔、要查、要交接,才走得動。
包含哪些功能?
- 用 OCR 讀出報告頁面上的編號,只抓關鍵位置、不辨識整頁,掃描速度很快。
- 批次改名,不用一份一份打開來對。
- 目前兩個部門在用,每天固定處理近百份。
- 用 Python 完成,之後同類文件可以沿用同一套做法。
遇到什麼困難?
這件事做得起來,前提是我們的報告格式都一樣,編號永遠在同一個位置,OCR 只要抓那一塊就好。
真正麻煩的是掃描解析度。同一台事務機掃出來的檔案清晰度並不一致,模糊的那幾份辨識就會出錯。報告編號只由英文字母和數字組成,所以後來的做法是針對字母和數字之間容易認錯的組合做比對修正,把辨識結果調回可以用的程度。
回頭看
小自動化非常值得做,尤其是每天需要不斷重複的事情。透過這種小型的自動化,可以讓同仁更容易接受自動化上線,也比較能接受工作流程的改動,因為這有直接解決到他們的痛點。等他們感受過一次,後面要再推別的系統或流程調整,就好談很多。