跳转到主要内容
PHOENIX CONSULTING & DEVELOPMENT LIMITED logo
数据与 AI · 文档 AI · Smart OCR

文档进,结构化记录出。

从身份证件、发票、合同和手写体中提取阿拉伯语和英语内容:结构化 JSON 存入 S3,供给 Bedrock 知识库。

Smart OCR 是 Phoenix 产品化的文档 AI 流水线,已上架 AWS Marketplace。它读取阿拉伯语和英语文档(包括手写体),并将结构化 JSON 交付到 Amazon S3,供下游系统、RAG 知识库和仪表盘直接消费。

部署在客户自己的 AWS 账户中,文档永远不离开客户的数据边界。作为产品销售,在同一核心流水线上按客户调优。

服务范围。

多语言提取

开箱即用的阿拉伯语(原生)和英语,并可配置其他 RTL 和 LTR 语言的提取器。支持印刷体、打字体和手写体。

  • Arabic
  • English
  • Handwriting

文档类型

身份证件与护照、发票与收据、合同、KYC 材料、医疗文档、政府表单、表格数据:按文档类型配置提取模板。

  • IDs
  • Invoices
  • Contracts
  • Forms

结构化 JSON 存入 S3

每份提取的文档都变成 Amazon S3 中带字段级置信度分数的规范化 JSON 记录:供 BI 使用、集成到 SAP 或 CRM、索引到 Bedrock。

  • S3
  • JSON
  • Confidence scores

Bedrock 就绪

提取流水线直接对接 Amazon Bedrock 知识库:同一文档语料成为企业副驾驶的 RAG 数据源。

  • Bedrock KBs
  • RAG-ready

交付方法。

  1. 01

    界定

    文档类型、语言、数量、目标下游系统:按每页阶梯定价。

  2. 02

    部署

    产品安装到客户自己的 AWS 账户:数据留在客户边界内。

  3. 03

    调优

    按文档类型配置提取模板;样本语料按准确率目标做基准测试。

  4. 04

    扩展

    数量爬坡,集成接入 SAP / CRM / 知识库,持续的准确率监控。

明确的交付物。

每个项目都交付具体的成果物,而非一堆幻灯片。

  • 部署在您 AWS 账户内的 Smart OCR 产品
  • 按文档类型配置并通过基准测试的提取模板
  • 落在您 Amazon S3 存储桶中的结构化 JSON 输出
  • 与 SAP、CRM、BI 或 Bedrock 知识库的下游集成
  • 带字段级置信度评分的准确率仪表盘
  • 新文档类型接入时的持续调优

常见问题

Smart OCR 与开源 OCR 或 Amazon Textract 有何不同?

Smart OCR 是针对阿拉伯语、英语和手写体调优的产品化流水线,配有按文档类型的提取模板(证件、发票、合同、KYC)、置信度评分,以及可供下游系统直接使用的 S3 JSON 输出。它构建于 AWS 服务之上(在合适处包括 Textract),但作为产品交付,而非工具包。

文档数据会离开我们的 AWS 账户吗?

不会。Smart OCR 部署在客户自己的 AWS 账户中。文档在账户内提取,JSON 输出落在客户自己的 S3 存储桶,一切都留在客户的数据边界内。

开箱支持哪些文档类型?

身份证件与护照、发票与收据、合同、KYC 材料、医疗文档、政府表单和表格数据。新文档类型通过配置提取模板添加:通常以天计,而非以周计。

准确率如何监控和改进?

每个提取字段都带置信度分数。按文档类型的仪表盘报告准确率和低置信度比例。高价值文档可接入人工复核(human-in-the-loop),低置信度样本回流用于提取器调优。

Smart OCR 能为 Bedrock RAG 副驾驶供数吗?

可以,这正是设计形态。提取的 JSON 以已规范化的形式存储在 S3,接入 Amazon Bedrock Knowledge Bases 只是直接的索引步骤。同一语料成为企业副驾驶的事实基础。

最早的沟通往往最有价值。

无论您是在评估 SAP 上云、重启停滞的项目,还是在思考数据与 AI 的切入点,都欢迎从一次对话开始。