大模型时代来临,智能文档处理该走向何方?

自去年ChatGPT发布以来,大语言模型(Large Language Model, LLM)的发展仿佛瞬间驶入了快车道,每天都能听到对相关话题的讨论。

在这里插入图片描述

cite: 清华大学人工智能国际治理研究院微博

按照现行的标准,能被称为大语言模型至少要满足以下四个条件:

  • 模型:基于自回归语言模型,参数量超过百亿。
  • 能力:具有思维链、情景学习等涌现能力,能够执行人类的指令。
  • 对话:可以直接和人类进行对话。
  • 对齐:符合人类价值观和思维方式,满足“有益(helpful)”、“诚实(honest)”和“无害(harmless)”三个原则。

大语言模型的强大能力归因于巨大的参数量带来的涌现现象。当模型规模较小时,模型的性能和参数大致符合比例定律,即模型的性能提升和参数增长基本呈线性关系。然而,当 GPT-3/ChatGPT 这种千亿级别的大规模模型被提出后,模型的能力会产生质的飞跃(如,可以理解人类指令等)。
在这里插入图片描述
ChatGPT 的成功给人们带来了信心,因此很多科技公司和组织都在加快推出类似的产品。

在大模型来临的背景下,近期举办的CSIG企业行活动中,以“图文智能处理技术与多场景应用技术”为主题的技术分享会上,合合信息邀请了来自学界和业界的多位研究者共同探讨大语言模型在智能图文文档处理中所带来的新机遇以及所面临的挑战。

对话式大语言模型

复旦大学计算机学院邱锡鹏教授在 CSIG 企业行活动分享中分析到,ChatGPT之所以成功,是因为它打通了三项关键技术:

  • 关键技术一:情景学习。所谓情景学习,就是将Prompt作为学习数据,一个Prompt包含任务描述、多个问答示例以及一个问题用例。情景学习主要学习答案的形式,而答案的实际内容主要来源于模型本身。
    在这里插入图片描述

  • 关键技术二:思维链。思维链通过构建更复杂数字Prompt来提供思维范式。例如,在解决数学问题时,Prompt应提供具体的分析过程。然而,思维链仅能学习问题分析形式,而无法直接分析出正确答案。因此,思维链通常需要与模型的计算能力相结合。
    在这里插入图片描述

  • 关键技术三:指令学习。指令学习旨在使机器理解人类指令。由于人类指令通常含糊不清,现有的语言模型仍无法完美响应人类指令。指令学习面临的最大挑战是泛化性,即模型需要通过学习已知指令来理解之前未见过的指令。但进行指令学习需要大量的人类指令数据。
    在这里插入图片描述

这里,我们也不得不提国内已经上线几个大语言模型,虽然它们离ChatGPT还有一定的差距,但随着投资的加大和对技术路线的充沛信心,我相信迎头赶上也只是时间问题。

  • 文心一言
    文心一言拥有超过1000亿参数,涵盖了海量中文互联网数据,它专注于中文文本,对中文语境的理解较为深入。
  • 腾讯ERNIE
    腾讯AI Lab研发的预训练模型ERNIE,是基于Transformer架构的深度学习模型。ERNIE强调知识增强,通过整合多模态数据和知识图谱等外部知识,提高模型性能。
  • 复旦MOSS
    MOSS拥有超过200亿参数,可执行对话生成、编程、事实问答等一系列任务,打通了让生成式语言模型理解人类意图并具有对话能力的全部技术路径。

尽管类似ChatGPT的对话式大语言模型展示了通用人工智能的大框架,具有一定的思考能力,但图灵奖得主、人工智能三巨头之一 Yann LeCun 认为 ChatGPT 还是存在几个缺点,例如无法处理多模态信息、无法与自然场景相连接等等。

大模型时代的图文文档处理

在见识到大语言模型对文本的令人惊叹的处理能力之后,有不少工作将LLM模型扩展到多模态上,文档处理是其中重要的应用领域。

对于一线的研究人员来说,很希望出现一种工具,只需要我们甩一个PDF过去,它自己就能阅读,并且能三言两语用大白话解释清楚我们的疑惑。

NewBing和ChatPDF率先推出了分析PDF文档的功能,能够在几秒钟内解读长达几十页的文档内的文本、图像描述、公式和上下文结构,然后任由我们提问,它会根据文档内容进行回复。GPT-4更是有强大的推理能力,能够一步步推断出问题的正确答案。
在这里插入图片描述

复杂中文文档的结构建模

尽管交互式的大语言模型为文档处理带来了新的曙光,但对文档的复杂结构建模现在仍处于发展阶段。对于一个包含多行、多栏文本、表格、公式、图片、页眉和页脚等的文档,即使是GPT-4也不能在解析文本和识别内容结构方面做到完美。

在这里插入图片描述

这些复杂需求带动了复杂图像文档结构建模领域的研究。在早期的复杂文档研究存在很多缺陷,例如无法处理复杂排版、低分辨率和模糊图像,并且通常只适用于英文文档,对中文文档的泛化能力相对较弱。

对此,中国科学技术大学杜俊副教授提到:对于中文文档的文档结构研究,应该从汉字、图表和篇章结构三个方面逐步完成。

杜俊副教授认为,汉字是一篇中文文档中最基本的构成单位。针对文档中的汉字,一方面需要实现汉字的识别,另一方面需要实现汉字的生成,这是一个联合优化的过程。
在这里插入图片描述
他提出,可以借鉴对公式处理的方式,首先对汉字的部首信息进行分割,并以树形结构进行组织。然后利用识别注意力机制识别汉字结构。在生成过程中,顺序正好相反:先给定汉字的结构,然后通过生成注意力机制来安排部首位置,从而实现汉字的生成。

在这里插入图片描述

在解读汉字的基础之上更进一步,是识别和提取图表信息。具体到表格信息,杜俊副教授提出采用分割、嵌入和融合三大步骤实现更好地信息提取。

所谓分割,就是将表格图像拆分成一系列基础网格,利用行列分隔线的交点绘制表格的基本网格,从而呈现表格的整体框架。

在这里插入图片描述

在完成分割任务之后,需要设计一个视觉模块以提取网格结构特征。同时,还需设计一个文本模块来提取网格中的文本特征。最后,通过一个融合模块将两种模态进行整合嵌入,得到最终的网格表征。

在这里插入图片描述

最后,通过应用Attention机制,逐步预测当前网格与其他网格的归并关系,实现跨行跨列单元的识别和提取。
在这里插入图片描述

以上所述处于处理文档区域单元的阶段,实际上更重要的任务在于如何划分文本、图表、公式、段落、小节等区域。

过去的研究工作主要集中在单页文档内各类要素的检测、分类和关系预测。然而,在现实场景中,一篇文档的上下文元素之间的关系很可能跨越多个页面。

在这里插入图片描述

在处理多页文档时,我们需要识别并分类各个页面中的文档要素。这包括对文字、图片、表格等各类要素的检测和分类。此外,我们还需要重建文档的整体结构。这包括识别跨页的标题、段落和列表等要素之间的关系,以恢复文档的原始逻辑结构。

自然场景下的图文文档处理

尽管现在对中文文档的处理已经有了很深远的研究,但是仍然有很多重要问题还未解决,例如:

  • 自然场景下的汉字建模:如何在噪声(光照不均、背景复杂等)图像上实现更好的手写、汉字生成与识别性能?
  • 自然场景下的表格建模:如何在噪声(形变、倾斜等)图像上实现更加鲁棒的表格分割性能?
  • 多模态文档建模:如何实现多模态大模型下的多版式文档(简历、海报、证件等)的理解和分析?

在这里插入图片描述

对于这些挑战,合合信息图像算法研发总监郭丰俊在 CSIG 企业行活动分享中给出了答案——在底层视觉任务中解决这些问题。

  • 底层视觉任务:处理输入图像并输出图像。
    这些任务包括:图像预处理、图像过滤、图像复原、图像增强等。
  • 中层/顶层视觉任务:处理输入图像并输出特征或理解。
    这些任务包括:图像分割、物体检测、场景识别等。

底层视觉研究的初衷在于,计算机所接收的现实图像常常受到噪音干扰,例如扭曲、模糊、光影等现象,因此,在进一步分析和理解输入图像之前,需要进行底层视觉处理,以对图像进行“预处理”。

以试卷文档处理为例,不规范的拍照方式会严重影响文本检测和提取的成功率。
在这里插入图片描述

智能文档处理中,底层视觉处理的Pipeline流程主要包括以下几个步骤:
在这里插入图片描述

  • ROI提取:在该步骤,图像中的关键区域被提取出来,以减少不相关区域对后续任务的干扰;
  • 形变矫正:该步骤主要利用矫正方法对扭曲和倾斜的图像进行整平,为后续的OCR识别创造便利条件;
  • 图像恢复:该步骤旨在消除阴影、反光、摩尔纹等干扰图像信息的噪声,从而提高图像的可识别程度;
  • 质量增强:该步骤通过突出图像中的文本信息,有助于提高图像的可读性、可解释性和可感知质量。

可以看出,底层视觉技术主要包括图像预处理、特征提取、边缘检测、形态学变换等。当前,底层视觉技术的前沿难点有去除摩尔纹、去除反光、手写擦除和篡改检测等等。

在这里插入图片描述

经过数年的技术积累,合合信息已经在智能文档处理领域沉淀了丰富的经验,并将这些技术集成到了“扫描全能王”应用和“TextIn (https://www.textin.com/)”平台上。

立足大模型,下一站在何方?

站在多模态和自然场景的角度上继续延伸,以ChatGPT为代表的对话式大语言模型的潜力还可以进一步开发。厦门大学南强特聘教授纪荣嵘从语言和视觉两个方面强调了打通各个模态之间壁垒的重要性。可以说,构建多模态模型是助力机器理解人类指令的重要踏板,以文本和图像为例,当文本信息和图像信息能够完全相互代表时,人类对于图像的操作就可以仅通过一段话来完成。

在这里插入图片描述

IDC发布的《2022中国大模型发展白皮书》中提到:面向未来,大模型必然成为重要的AI新型基础设施之一。任何依靠人工智能展开的研究都可以在这种生成式大模型的基础上得到发展。上海交通大学人工智能研究院常务副院长杨小康就认为,生成式人工智能为构建基于视觉直觉的物理世界模型和虚拟数字人提供了可行的途径。未来,随着数学、物理、信息论、脑认知、计算机等学科的交叉,还可以进一步夯实生成式人工智能的基础理论,实现“物理+数据”联合驱动、“虚拟+现实”深度融合,从而加速科学发现、物质合成以及世界模型的构建。

虽然通用人工智能的大门尚未完全叩开,但是我们已经看到了光明的前景,我们还有许多可以探索和实现的事物,山高水远,道阻且长。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/33744.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

探索AI领域,AI图像安全技术助力行业健康发展

目录 一、AI时代降临二、AIOCR与传统OCR技术三、通过人工智能模型生成AI图片技术探索四、提前布局,合合信息AI图像安全技术助力行业健康发展1、识别医疗门诊发票和报告2、图像篡改检测升级,截图篡改检测3、AIGC判别,人脸伪造检测4、OCR对抗攻…

chatgpt赋能python:Python图片分割:了解基于Python的图像分割技术

Python图片分割:了解基于Python的图像分割技术 在计算机视觉中,图像分割是一项非常重要的技术,它的主要目的是将一幅图像分成多个区域,每个区域具有独特的特征和属性。这项技术广泛应用于许多领域,如医学图像处理、自…

合合信息亮相CCIG2023:多位大咖共话智能文档未来,文档图像内容安全还面临哪些技术难题?

近日,中国图象图形大会(CCIG 2023)(简称“大会”)在苏州圆满落幕。本届大会以“图象图形向未来”为主题,由中国科学技术协会指导,中国图象图形学学会主办,苏州科技大学承办&#xff…

证件照转数字人只需几秒钟,微软实现首个3D扩散模型高质量生成效果,换装改形象一句话搞定 | CVPR 2023...

转载自 微软亚洲研究院量子位 | 公众号 QbitAI 一张2D证件照,几秒钟就能设计出3D游戏化身! 这是扩散模型在3D领域的最新成果。例如,只需一张法国雕塑家罗丹的旧照,就能分分钟把他“变”进游戏中: △RODIN模型基于罗丹旧…

证件照更换底色(remove.bg包)【Python】

最近正好在办理入职需要用到蓝底的证件照,我目前只有一个白底的,在网上百度很多工具都需要付费,一气之下叫ChatGPT帮我写了一个哈哈哈。 最开始写的不太符合要求,人物旁边都是白色区域(这一段的代码就不上了&#xff…

chatgpt赋能python:Python改变图片背景色:让你的照片更生动

Python改变图片背景色:让你的照片更生动 随着数字摄影技术的进步,人们拍摄照片的数量和质量都得到了大幅提升。但是,有些时候照片的背景色不够理想,可能会影响整体效果。而Python这个流行的编程语言,可以通过图像处理…

安卓新闻客户端

安卓新闻客户端 特别说明:本安卓使用版本较高,因为是课设仓促完成的,现在还有些许BUG,目前还在维护和更新ing~ 完整代码GitHub自行下载导入 GitHub仓库:点击此处 实训报告:点击此处 主界面图 一、需求分析 …

android新闻客户端的实现

制作一个基于聚合新闻数据简单的新闻APP 制作简易新闻App 导航篇[1、使用FragmentViewPager TabLayout自制简易新闻 app主要框架(一)](https://blog.csdn.net/Tobey_r1/article/details/93221486)[2、解析聚合新闻数据,并显示到主界面上&…

高等数学学习笔记——第四十讲——微积分基本公式

1. 问题引入 2. 微积分基本定理(微积分基本公式、牛顿——莱布尼兹公式) 3. 定积分计算示例(利用微积分基本公式) 4. 分段函数的定积分(需分段计算)(引申:具体问题,具体分…

如何利用MATLAB求解积分与微分?

文章目录 前言1 数值微分2 数值积分小结 前言 今天我们要说的就是数值微积分,赶紧看看他和高等数学中的微积分有什么区别吧。本文是科学计算与MATLAB语言专题六第一小节的学习笔记,如果大家有时间的话,可以去听听课,没有的话&…

数学建模学习(22):求解微积分之积分问题详解,超详细!

文章目录 前言不定积分定积分与无穷积分多重积分总结前言 积分是一个很重要的概念,通常分为定积分和不定积分。 我们在这里介绍的就是int函数,调用方式如下: F=int(fun,x) fun是被积函数,x是自变量,当然如果只有一个自变量可以省略。 不定积分 求解如下式子的不定积分:…

[MIT]微积分重点 第五课 积分总览 学习笔记

0.先上本节课目录: 1.函数二是函数一的导数 函数一: H e i g h t y ( x ) Height y(x) Heighty(x) 函数二: S l o p e s ( x ) Slope s(x) Slopes(x) 函数一 -> 函数二: S l o p e s ( x ) d ⁡ y d ⁡ x l i m i t o f …

这可能是关于微积分讲的最好的文章了

最近自己学习深度学习相关的东西,发现需要大量关于微积分的知识作为支撑,于是我在网上找到了这篇关于微积分的好文章,这也是我目前见过的最好的讲解微积分的文章了!要是大学课本这么写,高数怎么可能让那么多同学挂科&a…

用Python学《微积分B》(定积分)

本文主要学习《微积分B》第7章——“定积分的概念和存在条件”,结合课程中的知识进行一些扩展,并用Python辅助求解课后练习题。关于定积分(Definite Integral)的概念,课本中只介绍了“黎曼积分”(Riemann I…

多变量微积分笔记17——通量

在流体运动中,通量是单位时间内流经某单位面积的某属性量,是表示某属性量输送强度的物理量。在大气科学中,包含动量通量、热通量、物质通量和水通量。 本章关于向量和点积的相关知识课参考《线性代数笔记3——向量2(点积&#xff…

以MATLAB的方式实现微积分问题的计算机求解问题及解决方案集锦(二)

前言 关于MATLAB系列的精品专栏大家可参见 MATLAB-30天带你从入门到精通 MATLAB深入理解高级教程(附源码) 喜欢的小伙伴可自行订阅,你的支持就是我不断更新的动力哟! 微积分问题的计算机求解系列 (0001) 试求出以下的曲线积分。 【解】 套用第一类和第二类曲线…

第三单元 用python学习微积分(十九)FTC2(下)和定积分在对数和几何上的应用

本文内容来自于学习麻省理工学院公开课:单变量微积分-定积分在对数和几何上的应用-网易公开课 概率密度_百度百科 概率密度是什么意思_百度知道 正态分布(高斯分布)、Q函数、误差函数、互补误差函数 - htj10 - 博客园 正态分布_百度百科 …

程序员的数学【多元函数微分学】

目录 前言一、多元函数的定义二、偏导数三、高阶偏导数四、梯度五、雅可比矩阵5.1 雅克比矩阵定义5.2 雅克比矩阵示例 六、Hessian矩阵6.1 Hessian矩阵定义6.2 实例演示Hessian矩阵 七、极值判别法则7.1 极值判定条件7.2 实对称矩阵正定负定判定 八、二次型8.1 二次型定义8.2 二…

微积分基础知识note

此部分转自https://blog.csdn.net/zhulf0804/article/details/52238435 方向导数与梯度 在许多问题中,不仅要知道函数在坐标轴方向上的变化率(即偏导数),而且还要设法求得函数在其他特定方向上的变化率。这就是接下来要谈论的方…

用Python学《微积分B》(微积分应用)

微积分是一种非常重要的“数学分析”思想(方法),在许多领域中都有应用,比如:计算平面面积、曲线长度、空间图形的体积、旋转曲面面积和物理学中的“微元法”等。而如何用好“微积分”是这部分学习的重点。要用好微积分…