Knowledgator 发布 GLiFormer:一款 5.75 亿参数的编码器,在嵌套 JSON 提取任务中斩获 91.10 F1 分数

在人工智能领域,参数规模的膨胀往往被视为提升性能的唯一路径。然而,近日 Knowledgator 公司推出的一款名为 GLiFormer 的新型模型,却向这一传统认知发起了挑战。GLiFormer 是一款仅拥有 575M 参数的编码器架构模型,它在处理复杂的嵌套 JSON 数据提取任务时,表现出了惊人的精度,F1 分数高达 91.10,这一成绩甚至逼近了当时顶尖的 GPT-5.6-luna 模型的 91.96 分。

无需生成 Token 的高效提取器

与传统的大语言模型(LLM)通常采用的生成式路径不同,GLiFormer 采用了纯粹的编码器架构。这意味着它在处理输入文本时,不需要像生成式模型那样“逐字逐句”地预测输出,而是直接对信息进行结构化的编码与提取。这种设计上的转变,不仅显著降低了计算资源的消耗,更重要的是,它在保持高精度的同时,避免了生成式模型可能出现的幻觉或逻辑不一致问题。

打破参数壁垒,实现接近 GPT 的性能

在自然语言处理(NLP)任务中,模型参数量往往与性能呈正相关。然而,GLiFormer 的出现打破了这一刻板印象。作为一个仅有 5.75 亿参数的模型,它不仅能够处理复杂的嵌套 JSON 结构,还能准确识别文档中的实体信息。根据测试数据显示,其性能指标已非常接近当时业界领先的 GPT-5.6-luna 模型。这种“小而美”的模型架构,为在边缘设备或资源受限环境中部署高性能 AI 应用提供了新的可能性。

核心特性:Grounding 源数据的可解释性

除了高精度的提取能力外,GLiFormer 另一大亮点在于其“Grounding”(锚定/溯源)能力。在信息抽取任务中,模型不仅要输出正确的结果,还需要能够指出这些结果在原始文档中的具体位置。GLiFormer 成功地将提取到的每一个 JSON 值都锚定在源文本的特定跨度上。这一特性对于构建可信赖的 AI 系统至关重要,它使得数据的来源有据可查,极大地增强了系统在金融、法律等高风险领域的应用价值。

行业影响与应用场景

嵌套 JSON 提取是许多企业级应用中的关键技术环节,特别是在检索增强生成(RAG)和自动化数据处理流程中。GLiFormer 的问世,有望显著提升企业处理非结构化文档的效率。例如,在自动化合同审查、财务报表解析或医疗记录结构化等场景中,该模型能够快速从长文本中精准提取出关键的结构化数据,供下游系统直接调用。相比传统方法,GLiFormer 在不牺牲准确率的前提下,提供了更低的延迟和更高的稳定性。

总结

GLiFormer 的成功发布,标志着 AI 领域正从单纯追求大模型参数量,转向追求模型架构的专用性与高效性。通过摒弃不必要的 Token 生成过程,专注于高精度的编码与溯源,Knowledgator 展示了未来 AI 工具的一种演进方向:更智能、更轻量、更可解释。随着 RAG 技术的进一步普及,此类高精度的结构化提取工具将成为连接非结构化数据与结构化应用的关键桥梁。

参考来源: MarkTechPost

原文链接: https://www.marktechpost.com/2026/09/16/knowledgator-releases-gliformer-a-575m-parameter-encoder-that-hits-91-10-f1-on-nested-json-extraction-without-generating-tokens/

信息来源:MarkTechPost,原文链接:https://www.marktechpost.com/2026/09/16/knowledgator-releases-gliformer-a-575m-parameter-encoder-that-hits-91-10-f1-on-nested-json-extraction-without-generating-tokens/

oaido_ai

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注