LandingAI 推出 Agentic Document Extraction Gen2,基于 DPT-3 模型重塑文档智能体架构

近日,专注于计算机视觉领域的 AI 公司 LandingAI 正式发布了 Agentic Document Extraction Gen2 版本。这是其文档处理架构的一次全面重构,核心基于全新的 DPT-3 模型家族。此次更新标志着 LandingAI 从传统的 OCR(光学字符识别)工具向更复杂的“智能体”系统迈出了关键一步,旨在解决企业在处理复杂数据结构时面临的挑战。

从“块”到“树”的架构进化

在 Gen1 版本中,文档通常被分割成扁平的“块”进行处理。然而,在实际业务场景中,文档往往具有复杂的层级结构,如多层嵌套表格、页眉页脚以及跨栏排版。Gen2 版本引入了更先进的“文档-页面-块树”结构。这种层级化的数据表示方法,不仅保留了文档的原始布局信息,还能让 AI 模型更好地理解上下文关系,从而在提取数据时避免语义混淆。

DPT-3 Pro 与 Verity:高精度提取的双重引擎

此次更新引入了两个关键的 DPT-3 模型变体,分别针对不同的精度需求:

DPT-3 Pro:专注于“行级”精度。这意味着模型能够精确识别并提取表格中的特定行,即使这些行包含复杂的合并单元格或交错内容。对于金融报表、发票列表等结构化数据,Pro 版本能提供极高的准确性。

DPT-3 Verity:则侧重于“词级”精度,并附带置信度评分。在处理法律合同、医疗记录或需要极高准确率的非结构化文本时,Verity 模型通过提供置信度分数,让用户能够对提取结果的可靠性进行评估,从而在人工审核时进行重点检查。

智能体与计费模式的变革

Agentic Document Extraction 的“智能体”一词暗示了其不仅仅是识别文字,还具备一定程度的理解和推理能力。通过树状结构,系统可以模拟人类阅读文档的逻辑,对复杂文档进行更自然的解析。此外,Parse 计费模式也发生了重大调整。Gen2 版本不再按“页”计费,而是改为按“输出字符数”计费。这一举措对于开发者和企业用户而言意义重大,它打破了页面大小的限制,使得长文档或低密度文档的处理成本更加透明和可控。

迁移与未来展望

值得注意的是,Gen1 的代码将无法在 Gen2 的端点上运行,这意味着现有的集成项目需要进行相应的代码迁移。尽管存在一定的迁移成本,但这次重构所带来的数据处理效率和准确性提升,对于希望自动化复杂文档工作流的科技公司和金融机构来说,无疑是值得的投资。LandingAI 此次发布的 Gen2,再次展示了其在文档智能领域的技术领导力。

信息来源: MarkTechPost
原文链接: https://www.marktechpost.com/2026/09/09/landingai-releases-agentic-document-extraction-gen2-with-dpt-3-pro-and-dpt-3-verity/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/09/landingai-releases-agentic-document-extraction-gen2-with-dpt-3-pro-and-dpt-3-verity/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注