微软多模态ChatGPT来了?搞定看图答题、智商测验等任务!

点击下方卡片,关注“CVer”公众号

AI/CV重磅干货,第一时间送达

点击进入—>【计算机视觉】微信技术交流群

转载自:机器之心 | 编辑:杜伟、陈萍

从大型语言模型(LLM)到多模态大型语言模型(MLLM),微软又迈出了重要一步。

在 NLP 领域,大型语言模型(LLM)已经成功地在各种自然语言任务中充当通用接口。只要我们能够将输入和输出转换为文本,就能使得基于 LLM 的接口适应一个任务。举例而言,摘要任务输入文档,输出摘要信息。所以,我们能够将输入文档馈入摘要型语言模型,并生成摘要。

尽管 LLM 在 NLP 任务中取得了成功的应用,但研究人员仍努力将其原生地用于图像和音频等多模态数据。作为智能的基本组成部分,多模态感知是实现通用人工智能的必要条件,无论是对于知识获取还是与现实世界打交道。更重要的是,解锁多模态输入能够极大地拓展语言模型在更多高价值领域的应用,比如多模态机器人、文档智能和机器人技术。

因此,微软团队在论文《Language Is Not All You Need: Aligning Perception with Language Models》中介绍了一个多模态大型语言模型(MLLM)——KOSMOS-1,它可以感知一般模态、遵循指令(即零样本学习)以及在上下文中学习(即少样本学习)。研究目标是使感知与 LLM 保持一致,如此一来模型能够看到(see)和说话(talk)。研究者按照 METALM(参见论文《Language models are general-purpose interfaces》 )的方式从头开始训练 KOSMOS-1。

482e872a0c475fba69f26e64d993cfcd.png

  • 论文地址:https://arxiv.org/abs/2302.14045

  • 项目地址:https://github.com/microsoft/unilm

如下图 1 所示,研究者将一个基于 Transformer 的语言模型作为通用接口,并将其与感知模块对接。他们在网页规模的多模态语料库上训练模型,语料库包括了文本数据、任意交错的图像和文本、以及图像字幕对。此外,研究者还通过传输纯语言数据来校准跨模态的指令遵循能力。

最终,KOSMOS-1 模型原生支持零样本和少样本学习设置下的语言、感知语言与视觉任务,具体如下表 1 所示。

eb4dffc5de61c3d3c34d41384391b259.png

研究者在下图 2 和图 3 中展示了一些生成示例。除了各种自然语言任务,KOSMOS-1 模型能够原生处理广泛的感知密集型任务,如视觉对话、视觉解释、视觉问答、图像字幕、简单的数学方程式、OCR 和带描述的零样本图像分类。他们还根据瑞文推理测验(Raven's Progressive Matrices, RPM)建立了一个 IQ 测试基准,用来评估 MLLM 的非语言推理能力。

35887c4988e1e3e9b36950002c8aebb1.png

‍这些示例表明,多模态感知的原生支持为将 LLM 应用于新任务提供了新的机遇。此外与 LLM 相比,MLLM 实现了更好的常识推理性能,表明了跨模态迁移有助于知识获取。

由于 KOSMOS-1 模型的参数量为 16 亿,因此有网友表示有望在自己的电脑上运行这个多模态大模型。

71ac267a6e3dadb1086b250e6541cf51.png

KOSMOS-1:一个多模态大型语言模型

如图 1 所示,KOSMOS-1 是一个多模态语言模型,它既可以感知一般的模态、遵循指令、还能在上下文中学习并生成输出。具体来说,KOSMOS-1 的主干是一个基于 Transformer 的因果语言模型。除了文本之外,其他模态也能被嵌入并输入到该模型中,如下图中,除了语言还有视觉、语音等的嵌入。Transformer 解码器用作多模态输入的通用接口。一旦模型训练完成,KOSMOS-1 在零样本和少样本设置中也能对语言任务和多模态任务进行评估。

256e93d3edd04fb240b2995ade83bb59.png

Transformer 解码器以统一的方式感知模态,输入信息会被 flatten 为带有特殊 token 的序列。例如 < s > 表示序列开始、</s > 表示序列结束。特殊 token <image > 和 </image > 表示编码图像嵌入的开始和结束。

2ffcdbc5a5fc5940103d836d2a10dc56.png

嵌入模块将文本 token 和其他输入模态编码成向量表示,对于输入 token,该研究使用查找表将其映射到嵌入中。对于连续信号模态(例如,图像和音频),也可以将输入表示为离散编码。

之后,获得的输入序列嵌入会被馈送到基于 Transformer 的解码器。然后因果模型以一种自回归的方式处理序列,从而产生下一个 token。总而言之,MLLM 框架可以灵活地处理各种数据类型,只要将输入表示为向量即可。

模型训练

首先是训练数据集。数据集包括文本语料库、图像 - 字幕对、图像和文本交叉数据集。具体而言,文本语料库包括 The Pile 、Common Crawl (CC);图像 - 字幕对包括 English LAION-2B、LAION-400M、COYO-700M 以及 Conceptual Captions;图像和文本交叉多模态数据集来自 Common Crawl snapshot。

数据集有了,然后是训练设置。MLLM 组件包含 24 层、隐藏维度是 2048、8192 个 FFN 和 32 个注意力头、参数量为 1.3B。为了使模型更好的收敛,图像表示是从具有 1024 个特征维度的预训练 CLIP ViT-L/14 模型获得的。图像在训练过程中被预处理为 224×224 分辨率,此外,训练期间除了最后一层,所有的 CLIP 模型参数被冻结。KOSMOS-1 的参数总数约为 1.6B。

8e91689ee9002acad16a9ea2e2a3f123.png

实验结果

该研究进行了一系列丰富的实验来评价 KOSMOS-1 :语言任务(语言理解、语言生成、 OCR-free 文本分类);跨模态迁移(常识推理);非语言推理( IQ 测试);感知 - 语言任务(图像字幕、视觉问答、网页问答);视觉任务(零样本图像分类、带有描述的零样本图像分类)。

图像字幕。下表给出了不同模型在 COCO 和 Flickr30k 上的零样本性能。相比其他模型,KOSMOS-1 均取得了显著效果,甚至在参数量远小于 Flamingo 的基础上,性能也不错。

13da1d65af201b095154642d3a50a965.png

下表为少样本性能对比:

f47747f56dc10726f06265b6a2c3343b.png

视觉问答。KOSMOS-1 比 Flamingo-3B 和 Flamingo-9B 模型具有更高的准确率和鲁棒性:

03ef6c629a0f55724460a763fa145215.png

下表为少样本性能对比:

b6d5e5ed9e0482df4a6d34bddda4a7fe.png

IQ 测试。瑞文推理测验是评估非语言推理最常见的测试之一。图 4 显示了一个示例。 

04bf480cad657cf1af55346c5f91ae8f.png

表 6 显示了在 IQ 测试数据集上的评估结果。KOSMOS-1 能够在非语言环境中感知抽象概念模式,然后在多个选择中推理出之后的元素。据了解,这是首次有模型可以执行此类零样本 Raven IQ 测试。

db9c1b7db8a35e9550ffbc4b85f9ac5d.png

网页问答。网页问答旨在从网页中找到问题的答案。它要求模型既能理解文本的语义,又能理解文本的结构。结果如下:

c3bcd9d193cb66e36364d55929466277.png

多模态思维链提示。受思维链提示的启发,本文对这方面进行了实验。如图 5 本文将感知语言任务分解为两个步骤。在第一阶段给定图像,使用提示来引导模型生成符合要求的输出,以产生最终结果。

fef0649ca10aed7a0809ff502c3f8b73.png

从表 9 可以看出,多模态思维链提示的得分为 72.9 分,比标准提示高出 5.8 分:

4a0b272e1781a6968d239b2887b2ed0f.png

了解更多实验内容,请参考原论文。

点击进入—>【计算机视觉】微信技术交流群

最新CVPP 2023论文和代码下载

 

后台回复:CVPR2023,即可下载CVPR 2023论文和代码开源的论文合集

后台回复:Transformer综述,即可下载最新的3篇Transformer综述PDF

目标检测和Transformer交流群成立
扫描下方二维码,或者添加微信:CVer333,即可添加CVer小助手微信,便可申请加入CVer-目标检测或者Transformer 微信交流群。另外其他垂直方向已涵盖:目标检测、图像分割、目标跟踪、人脸检测&识别、OCR、姿态估计、超分辨率、SLAM、医疗影像、Re-ID、GAN、NAS、深度估计、自动驾驶、强化学习、车道线检测、模型剪枝&压缩、去噪、去雾、去雨、风格迁移、遥感图像、行为识别、视频理解、图像融合、图像检索、论文投稿&交流、PyTorch、TensorFlow和Transformer等。
一定要备注:研究方向+地点+学校/公司+昵称(如目标检测或者Transformer+上海+上交+卡卡),根据格式备注,可更快被通过且邀请进群▲扫码或加微信号: CVer333,进交流群
CVer学术交流群(知识星球)来了!想要了解最新最快最好的CV/DL/ML论文速递、优质开源项目、学习教程和实战训练等资料,欢迎扫描下方二维码,加入CVer学术交流群,已汇集数千人!▲扫码进群
▲点击上方卡片,关注CVer公众号
整理不易,请点赞和在看

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/13868.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

【ChatGPT+Python】Landsat卫星图像黑边去云及旋转校正

引言 下图是一张Landsat图像的示例&#xff08;右图&#xff09;。我们可以明显地看到四周的黑边和倾斜的角度。这是由于卫星传感器成像导致的。一般情况下&#xff0c;我们是不需要去除黑边和选择的&#xff0c;因为这样做之后投影信息和位置信息就不正确了。但对于做深度学习…

AI聊天机器人公司Character获1.5亿美元 公司估值10亿美元

雷递网 乐天 3月24日 AI聊天机器人初创公司Character.AI日前宣布完成1.5亿美元&#xff0c;估值为10亿美元&#xff0c;领投方为Andreessen Horowitz。 Character.AI计划将使用这笔资金来训练其自建模型并扩充22人的团队。 Character.AI由前谷歌研究人员 Noam Shazeer 和 Danie…

“AI产品经理大本营”六周年活动明天开启!(最后的优惠价格窗口+三大内容产品发布)...

明天&#xff08;5月9日&#xff0c;周二&#xff09;&#xff0c;将开启咱们社群“AI产品经理大本营”六周年活动——“AI产品经理的新起点 2.0”&#xff01; 下面将介绍三个方面&#xff1a; 1、“AI产品经理大本营”的三大会员权益体系&#xff08;价值XXXX元&#xff09; …

AI绘图软件分享:Midjourney 基础教程(一)

大家伙&#xff0c;我是权知星球&#xff0c;今天跟大家分享一下最近AI绘图爆火的软件工具Midjourney的使用教程。 Midjourney基础教程&#xff08;⼀&#xff09;&#xff1a;Midjourney 使⽤准备 Midjourney是⼀个AI绘画⼯具&#xff0c;可以使⽤⽂字描述&#xff0c;⽣成…

阿愚呱呱作为一个非技术人员,是如何做到不到3年时间成为RPA行业的一个头部IP的?

Part1RPA帮入门训练营操作手册&#xff08;问题集锦&#xff09; 1禁用edge浏览器再重启 1.winR (win是键盘最左边Ctrl和Alt之间的按键) 2.输入msconfig 3.启动 4.打开任务管理器 5.选中edge浏览器 6.点击禁用 7.重启 2注册并下载uibot https://www.uibot.com.cn/ 3谷歌浏览器下…

“AI信息/认知”领先时间窗,可达2年?3个例证及12月的57篇精华汇总 | 星球月报...

最近被朋友敲打了下&#xff0c;酒香也怕巷子深&#xff0c;他建议的对…… 之前也有同学私下说&#xff0c;咱们星球“AI产品经理大本营”的日更AI干货&#xff0c;不仅是节省时间&#xff0c;更有体会到“圈内人”的感觉。 我后来汇总过&#xff0c;“AI信息/认知”领先外部时…

韭菜GPT:「旧世界」的开发者们,给OpenAI上了一课

OpenAI 官方 app ChatGPT 上架美区 App Store&#xff0c;一夜之间登顶 App Store 免费榜。 据 Sensor Tower 的数据&#xff0c;5 月 19 日当天&#xff0c;ChatGPT 收入排名生产力榜单第 4 名&#xff0c;App Store 总榜第 94 名。 可想而知&#xff0c;这个数据在未来一段时…

微软赢疯了,Office AI工具定价破天花板,每人每月30美元!

整理 | 朱珂欣 出品 | CSDN程序人生&#xff08;ID&#xff1a;coder_life&#xff09; AI 的尽头&#xff0c;莫非是付费订阅&#xff1f; 昨天&#xff0c;微软在全球合作伙伴大会上披露&#xff0c;Microsoft 365 Copilot 将统一定价为每个用户 30 美元/月&#xff08;约…

上云一年烧掉320万美元,Ruby on Rails 之父:“下云”成功,五年能省700万美元!...

高达320万美元一年的云计算费用&#xff0c;这家公司选择“下云”后&#xff0c;CTO 粗略算了一下&#xff0c;每年至少能节省一百五十万美元。即使预留 50 万美元用于意外开支&#xff0c;5 年也能节省 700 万美元的费用。 整理 | 梦依丹 出品 | CSDN&#xff08;ID&#xff…

ofo小黄车已彻底无法登录;初代 iPhone 拍出 6.3 万美元天价;Linux 6.3 合并了硬件噪声工具|极客头条...

「极客头条」—— 技术人员的新闻圈&#xff01; CSDN 的读者朋友们早上好哇&#xff0c;「极客头条」来啦&#xff0c;快来看今天都有哪些值得我们技术人关注的重要新闻吧。 整理 | 梦依丹 出品 | CSDN&#xff08;ID&#xff1a;CSDNnews&#xff09; 一分钟速览新闻点&#…

谷歌不跟 ChatGPT 的风,为什么?梦幻AI头像生成,你玩了没?氮化铌或让未来个人电脑量子化...

本周&#xff0c;AI业界有哪些新鲜事&#xff1f; 产业界 GitHub Copilot 推出企业版&#xff0c;但侵权等问题还需解决 根据GitHub近日发布的一份新闻稿&#xff1a;"我们很高兴为企业带来GitHub Copilot&#xff0c;它具有简单而灵活的许可管理、组织范围内的策略控制和…

在ChatGPT中建立一个虚拟机

内容部分翻译自&#xff1a;https://www.engraved.blog/building-a-virtual-machine-inside/ 除非你一直生活在岩石下&#xff0c;否则你已经听说过OpenAI开发的这个新的ChatGPT助手。你可能知道它在解决智商测试、解决leetcode问题或帮助人们写LateX方面的能力。它是人们检索…

ChatGPT对健康医疗意味着什么?

ChatGPT可能是有史以来增长最快的消费者互联网应用程序。OpenAI开发的人工智能聊天机器人于11月推出&#xff0c;仅两个月就达到了1亿用户。它空前的流行可归因于其令人印象深刻的功能。 ChatGPT可以做什么&#xff0c;为什么如此受欢迎&#xff1f; 人工智能曾经是科幻小说中…

我问了鹅厂程序员:你们工作中怎么用ChatGPT?如何高效Prompt?

&#x1f449;腾小云导读 当你还在错误使用对话 AI 工具如 GPT&#xff0c;可能会觉得其作用不过是知识平移总结或简单问答。实际上&#xff0c;当了解先进的用法、知悉如何做到 better prompt&#xff0c;你会发现&#xff1a;AI 不是来替代你的&#xff0c;是来帮助你更好工作…

[Claude]-Chatgpt最强对手来袭

Chatgpt最强对手来袭 这货名叫Claude&#xff0c;是由openai前员工创建的&#xff0c;对标chatgpt&#xff0c;且响应速度要比chatgpt免费版好很多。最近&#xff0c;Claude 突然开放了申请&#xff0c;并且更新支持中文。据说它的 API 仍然是那种不限量、免费的类型哦~ 尽管如…

chatgpt赋能python:Python编程教程:如何用Python写抢购程序

Python编程教程&#xff1a;如何用Python写抢购程序 随着网购的流行和限量商品的推出&#xff0c;抢购已经成为了一个非常热门的话题。有些人甚至会通过软件或程序来提高他们成功抢到商品的机会。在本篇文章中&#xff0c;我们将介绍如何用Python编写一个简单易用的抢购程序&a…

ChatGPT突破安全边界

如同 ChatGPT 这样强大的 AI 能否被破解&#xff0c;让我们看看它背后的规则&#xff0c;甚至让它说出更多的东西呢&#xff1f; 回答是肯定的。2021 年 9 月&#xff0c;数据科学家 Riley Goodside 发现&#xff0c;他可以通过一直向 GPT-3 说&#xff0c;「Ignore the above …

POE:性价比最高的 AI 整合网站

创作不易&#xff0c;如果本文对你有帮助&#xff0c;胖友记得一键三连 &#x1f62d;。更多 AI 优质内容推荐请关注主页 “AI” 专栏&#xff0c;笔者会不定期更新觉得自己用下来还不错的 AI 相关产品。 1.介绍 Poe 是一款同时整合了 ChatGPT、Sage、GPT-4、Claude、Claude-in…

从BERT到ChatGPT,北航等9大顶尖研究机构全面综述:那些年一起追过的「预训练基础模型」...

来源&#xff1a;新智元 【导读】2023年了&#xff0c;还有人从头开始训模型吗&#xff1f;追踪一下从Bert以来的那些预训练模型。 ChatGPT在few-shot和zero-shot场景下展现出的惊人性能&#xff0c;让研究人员们更坚定「预训练」是一条正确的路线。 预训练基础模型&#xff08…

从BERT到ChatGPT!97页全面综述:那些年一起追过的预训练基础模型

点击下方卡片&#xff0c;关注“CVer”公众号 AI/CV重磅干货&#xff0c;第一时间送达 点击进入—>【计算机视觉】微信技术交流群 转载自&#xff1a;新智元 | 编辑&#xff1a;LRS 【导读】2023年了&#xff0c;还有人从头开始训模型吗&#xff1f;追踪一下从Bert以来的那些…