Module 03 / 06
文档识别
扫描件与 PDF 在本机完成版面分析与文字识别;识别完的内容还能再产出报告,或和另一个版本逐段比对。
模块规格
执行位置100% 本机识别
输入扫描图像 / PDF
Feature 01 / 03
OCR 分析
两种模式:高级做完整版面分析与高精度识别,轻量把整页交给视觉模型快速转成纯文本。
- 高级:保留结构 — 标题、段落、表格、公式各自成块,输出可逐块查看与编辑,适合报告与合同。
- 轻量:快速转文字 — 整页直接转成纯文本,适合截图与收据;不做版面分析,也不需要下载 OCR 专用模型。
- 多种导出 — Markdown、Word、HTML、JSON、纯文本、CSV。
输出内容
标题
段落
表格
图注
保留版面与表格结构
Feature 02 / 03
洞察报告
识别完成的文档可以再整理成一份多维度报告 — 不只是一段摘要。
- 十余种内容 — 重点摘要、关键词、章节大纲、行动项、重点摘录、思维导图、词汇对照、不确定事项…。
- 可回跳原文 — 章节与摘录可以点,直接跳回文档对应的页码。
- 可追问可导出 — 右侧抽屉追问报告内容,或导出 HTML / Markdown。
已完成
- 重点摘要
- 关键词
- 章节大纲
- 行动项
- 词汇对照
Feature 03 / 03
文档比较
两份都识别完成的文档,先用算法对齐页面,再逐段整理出到底改了什么。
- 先对齐再比对 — 页面对应关系由算法决定;只有判定有变动的页面才交给语言模型逐段分析。
- 三种查看方式 — 只看版本一、并排、只看版本二,另可切换成只看有差异的段落。
- 诚实标记 — 对不准的页面会标“配对置信度较低,请人工确认”,不会假装百分之百。
版本一共 4 处变更版本二
颜色不是重点 — 左缘的标记与粗细就是变更类型