Module 03 / 06

文書認識

スキャン文書と PDF のレイアウト解析と文字認識をローカルで完結します。認識した内容からレポートを作ることも、別のバージョンと段落単位で比べることもできます。

モジュール仕様
実行場所100% ローカル認識
入力スキャン画像 / PDF
Feature 01 / 03

OCR 解析

2 つのモードがあります。アドバンストは完全なレイアウト解析と高精度な認識を行い、ライトはページ全体をビジョンモデルに渡して素早くプレーンテキストにします。

  • アドバンスト:構造を保持見出し、段落、表、数式がそれぞれブロックになり、出力はブロック単位で確認・編集できます。レポートや契約書に向いています。
  • ライト:素早くテキスト化ページ全体をそのままプレーンテキストにします。スクリーンショットやレシート向けで、レイアウト解析は行わず、OCR 専用モデルのダウンロードも不要です。
  • 多様なエクスポートMarkdown、Word、HTML、JSON、プレーンテキスト、CSV。
文書認識 — OCR 解析イメージ表示
出力内容
見出し
段落
図キャプション
レイアウトと表の構造を保持
Feature 02 / 03

インサイトレポート

認識を終えた文書は、さらに多面的なレポートへまとめられます — 単なる要約ひとつではありません。

  • 十数種類の項目要点の要約、キーワード、章立て、アクションアイテム、重要な抜粋、マインドマップ、用語対照、不確かな点など。
  • 原文へ戻れる章や抜粋はクリックでき、文書の該当ページへ直接ジャンプします。
  • 追加質問もエクスポートも右のドロワーでレポートの内容を掘り下げたり、HTML / Markdown として書き出したりできます。
文書認識 — インサイトレポートイメージ表示
完了
  • 要点の要約
  • キーワード
  • 章立て
  • アクションアイテム
  • 用語対照
Feature 03 / 03

文書比較

どちらも認識を終えた 2 つの文書について、まずアルゴリズムでページを対応付け、次に段落ごとに何が変わったのかを整理します。

  • 先に対応付け、次に比較ページの対応関係はアルゴリズムが決めます。変更ありと判定されたページだけを、言語モデルが段落単位で分析します。
  • 3 つの表示バージョン 1 のみ、並べて表示、バージョン 2 のみ。差分のある段落だけを表示することもできます。
  • 正直な印うまく対応付けられなかったページには「対応付けの確信度が低いため、目視でご確認ください」と印が付きます。100% を装うことはしません。
文書認識 — 文書比較イメージ表示
バージョン 1変更 4 か所バージョン 2
色が要点ではありません — 左端の印と太さが、変更の種類を表します
Next

マシンが届いたら、4 ステップ。

ダウンロードとインストール、同意、シリアル認証、モデルダウンロード — 時間のほとんどはダウンロード待ちです。