Module 03 / 06

文件辨識

掃描件與 PDF 在本機完成版面分析與文字辨識;辨識完的內容還能再產出報告,或和另一個版本逐段比對。

模組規格
執行位置100% 本機辨識
輸入掃描影像 / PDF
Feature 01 / 03

OCR 分析

兩種模式:進階做完整版面分析與高精度辨識,輕量把整頁交給視覺模型快速轉成純文字。

  • 進階:保留結構標題、段落、表格、公式各自成塊,輸出可逐塊檢視與編輯,適合報告與合約。
  • 輕量:快速轉文字整頁直接轉成純文字,適合截圖與收據;不做版面分析,也不需要下載 OCR 專用模型。
  • 多種匯出Markdown、Word、HTML、JSON、純文字、CSV。
文件辨識 — OCR 分析示意展示
輸出內容
標題
段落
表格
圖說
保留版面與表格結構
Feature 02 / 03

洞察報告

辨識完成的文件可以再整理成一份多面向報告 — 不只是一段摘要。

  • 十餘種內容重點摘要、關鍵詞、章節大綱、行動項目、重點摘錄、心智圖、詞彙對照、不確定事項…。
  • 可回跳原文章節與摘錄可以點,直接跳回文件對應的頁碼。
  • 可追問可匯出右側抽屜追問報告內容,或匯出 HTML / Markdown。
文件辨識 — 洞察報告示意展示
已完成
  • 重點摘要
  • 關鍵詞
  • 章節大綱
  • 行動項目
  • 詞彙對照
Feature 03 / 03

文件比較

兩份都辨識完成的文件,先用演算法對齊頁面,再逐段整理出到底改了什麼。

  • 先對齊再比對頁面對應關係由演算法決定;只有判定有變動的頁面才交給語言模型逐段分析。
  • 三種檢視只看版本一、並排、只看版本二,另可切換成只看有差異的段落。
  • 誠實標記對不準的頁面會標「配對信心較低,請人工確認」,不會假裝百分之百。
文件辨識 — 文件比較示意展示
版本一共 4 處變更版本二
顏色不是重點 — 左緣的標記與粗細就是變更類型
Next

拿到機器了?四步開始。

下載安裝、同意條款、序號啟用、下載模型 — 大部分時間只是等下載完。