这波可以,终于有内行人把 GPT-4 说透了。

881f8c6561f273960248e4eca9559ffa.gif

1522c5e47c37feee8484a4ccf4ad59ec.gif

👉腾小云导读

近三个月 ChatGPT 方兴未艾,昨日凌晨 OpenAI 趁势发布多模态预训练大模型 GPT-4 ,其能力的升级和应用的拓展又一次引爆国内外网络。腾讯算法工程师冉昱将通过10问10答的形式,分享其个人对于 GPT-4 技术能力、特点及应用等的理解。欢迎阅读!

👉看目录,点收藏

Q1:GPT-4 是什么?

Q2:GPT-4 相比历代,在效果层面有哪些显著的改进或新增能力?

Q3:GPT-4 在训练方式、模型架构上有哪些创新优化?

Q4:GPT-4相比ChatGPT,有哪些新的应用亮点和场景?

Q5:GPT-4 在生成过程中的逻辑性和准确性上有何改进?

Q6:GPT-4 是否从根本上解决了安全问题?

Q7:GPT 对技术人员有何影响?

Q8:从GPT-4 可以看出未来 LLM 的哪些趋势?未来的研发方向和优化策略是什么?

Q9:GPT-4 论文有哪些值得关注的点?

Q10:GPT-4 是通往 AGI 的唯一道路吗?

01

 GPT-4是什么

GPT-4(Generative Pre-trained Transformer 4)是 OpenAI 发布的最新 GPT 系列模型。它是一个大规模的多模态模型,可以接受图像和文本输入,产生文本输出。输出任务依旧是一个自回归的单词预测任务,这与外界之前的预期略微不同(预期中 GPT-4 多模态会增加语音、图像、视频、文本多模态输入,输出可能也不局限于文字)。

GPT系列模型的整体情况如下图:

bb67d556d62a66f03a23308b09293097.png

整体来说,GPT-4 的能力已在各种专业和学术基准上表现出了人类的水平,包括以大约前 10% 的成绩通过模拟律师资格考试。而对于生成式的幻觉、安全问题均有较大的改善;同时因对于图片模态的强大识别能力扩大了 GPT-4 的应用范围。

02

相比其他GPT模型,

GPT-4在效果层面有哪些显著的改进或新增能力?

GPT-4 毫无疑问是目前最强的文本生成模型。GPT 系列模型整体可以总结为下图:

2e292757d8ca0420ebbb45526a67be6c.png

GPT-4 改进的具体表现有8个,下面我们一一介绍。

1)突破纯文字的模态,增加了图像模态的输入,具有强大的图像理解能力。

让人惊奇的是,GPT-4 在4个场景下(4/8)零样本效果超过 fine-tuned 的SOTA。

0c45ed09769bf96367842c16e1711782.png

同时它可以解决各类图文混合的理解和生成问题。此处简单举两个例子,一个是根据图表,计算格鲁吉亚和西亚的日均肉消耗量:

faf9f8a28460cd084982502146e2dfc8.png

一个是解决法语的物理问题例子:

0e7e06c80928aecbad7eaf07fe06634c.png

可以看到 GPT-4 在多语言理解、图文理解能力上均很强大并已融会贯通。

2) 支持更长的上下文窗口

如之前外网泄露图中,GPT-4 存在两个版本。其支持的上下文分别是 8K 和 32K,是 ChatGPT 上下文长度的2倍和8倍,其成本也分别为 ChatGPT 的3倍和7倍。

cf3501bc120352dc80a9898194955de5.png

3) 复杂任务处理能力大幅提升

GPT-4 在更复杂、更细微的任务处理上,回答更可靠、更有创意。这在多类考试测验中以及与其他 LLM 的 benchmark 比较中得到。我们也可以从下列3个方面中看到。

GPT-4在不同年龄段不同类别考试中均名列前茅,平均位列人类头部的10%行列;比如律师职业资格考试前10%,生物学奥赛前1%等。下图可以明显看到,两个版本的GPT-4胜出率很高。

0933c891265bdcb3c5218723589c3dee.png

MMLU benchmark上,碾压其他大模型。

725985f06a2c10458970f6613b0e55f2.png

多语言能力强大,特别是小语种能力也很出色。

368f01d76275aa194e4ae24769da6a65.png

4)改善幻觉、安全等局限性

在各类任务上幻觉问题显著减轻,比最新的 GPT-3.5 模型高 40%。同样在安全能力的升级上,GPT-4 明显超出 ChatGPT 和 GPT3.5。详见下方两个图。

4133e8ffdceac7a2561c69f613f9d6df.png

41cdee4338a921ee31e7f8c6229aa1e7.png

5) 建立LLM测试标准

开源 OpenAI Evals 创建和运行基准测试的框架,其核心思想是对 GPT-4 等模型进行评估,并逐个样本检验性能。此举是可以让大家指出其模型中的缺点,以帮助 OpenAI 进一步改进模型。

6) 预测模型扩展性

这个特点之前行业内讨论涉及相对比较少。GPT-4 在 1/1000 的计算量上实现了扩展性的预测。特别在 LLM 不适合广泛调参的情况下,用较小的模型提前预测训练行为和 loss,极大地提升了训练效率、降低了训练成本、增强了  LLM 训练的可控性。

特别是对于 Inverse Scaling Prize 这个任务,此任务提出了模型性能随规模而下降的几个任务,而 GPT-4 可以通过提前预测模型扩展性,从而在 Inverse Scaling Prize 上的 Hindsight Neglect 任务逆转这一趋势。

f72d9589075283f2685c7a216ccdc8ff.png

7)重新实现了整个深度学习栈,从头开始设计了一台超级计算机

OpenAI 和微软合作,在 Azure 重建了深度学习堆栈,从头设计了一台专用超级计算机;基础训练设施的改进和定制,使得更大参数量模型的训练成为可能

8)风格可控

此处核心是通过「系统」自定 Prompt,让模型可以按照规定风格完成任务回复。整体思想比较简单,如下图需要 GPT-4 回复均按照 json 形式:

c8ba4311b8cf767d8be14c00957668f0.png

03

相较于之前 GPT 系列模型,

GPT-4 在训练方式、模型架构上有哪些创新优化?

整体很黑盒,但可以做一些合理的推测如下:

首先,模型参数量估计约为10万到100万亿量级(为作者个人预估,也从另一个角度看出OpenAI定制超算的强大),主要根据 OpenAI 2020 提出的大模型缩放规律:计算预算增加 10 倍,数据集大小应增加约 1.83 倍,模型大小应增加 5.48 倍。

按照下图估计,最右处的灰点极有可能为 ChatGPT(GPT3.5类模型)。图中可以看出 GPT-4 计算量约为 GPT3.5 的1000多倍,则模型容量约为548倍左右,1750亿x548≈100万亿。

9b9335161143a96b8786a3a1ae1bc5ec.png

其次,GPT-4 模型训练架构加入了图像模态的输入,应与最近微软发布的  KOSMOS-1 类似。即在预训练阶段输入任意顺序的文本和图像,图像经过  Vision Encoder 向量化、文本经过普通 transformer 向量化,两者组成多模的句向量,训练目标仍为 next-word generation。

再者,关于模型训练数据内容和数量,文中提及训练数据中额外增加了包含正误数学问题、强弱推理、矛盾一致陈述及各种意识形态的数据。数据量级同样根据 OpenAI 2020 的缩放率、训练100万亿的模型,数据量是 GPT3.5(45TB数据)的190倍。

最后,GPT-4是从头训练还是在某些基座模型上得来?这暂时无从得知。可以确定的是,它增加了后训练过程,整个过程类似于做 Prompt Engineering,核心是让模型知道如何在相应场景下合适的回答问题。

04

相比 ChatGPT,

GPT-4 有哪些新的应用亮点和场景?

GPT-4在增强了安全抵御、任务完成度和图片理解能力后,在 ChatGPT 基础之上有更多亮点和应用场景,这里为各位分享三点:

1) 发布视频中,根据潦草的手绘(下图1)制作类似布局类似的网页(下图2)。

1c38d1f4ee44d9360a289e9fe3f64cbe.png

1f215f32f10ec0e30443e0768d800be5.png

2)加入视觉模态后,可以扩充到的盲人应用(Be my eyes)。强大的多语言能力帮助小语种语言的恢复(Iceland language preserve)、安全能力提升后的反欺诈(Stripe)等应用会应运而生。

2fe78c4199cd00aa6d46c0fbafc5c2dc.png

9248fec094f3a4aa5ca72c170bf0a045.png

3) 在 AIGC 的版图上,建立以 GPT-4 以及之后更多模态的大模型为基础,形成多模态x多场景。

03dce4242381aaeaafe466283a545a21.png

(图来源:甲子光年)

05

GPT-4 在生成过程中的逻辑性和准确性上有何改进?

GPT-4 在生成逻辑性和准确性上均取得了进展。需要注意的是,GPT-4 基础模型在这项任务上只比 GPT-3.5 略好一点。然而经过 RLHF 的后训练后,效果才有了较大的改进,后训练整个过程类似于做 Prompt Engineering,核心是让模型知道如何在正确场景下做出合适的回答。

可以看到,GPT-4 相比 GPT3.5 和 Anthropic 优势较明显。但绝对正确率只有60%左右,尚存在较多弊端,并没有从根本上解决这样的问题,也会是后续持续发展的方向。

d042fddd4e3281167017f9c6fc1e26db.png

06

GPT-4 如何从根本上解决了安全问题?

GPT-4在安全问题上收效显著。针对安全问题,GPT-4的主要解决思路是利用安全相关的 RLHF ,在训练中加入额外的安全奖励信号,奖励由 GPT-4 的 zero-shot 分类器提供,即文中提到的 RBRM(基于规则的奖励模型)方法。它是一系列零样本的GPT-4 分类器。

具体来说,这些分类器接受三种输入:Prompt、Policy model 的输出以及可选的对输出的评估(人工编写)。利用这些不同安全等级的 prompt 进行训练,同时对GPT-4在不安全回复拒绝回答的行为,以及在敏感领域做安全回答两方面给奖励,通过强化学习。最后显著改善安全能力,不安全内容下降82%。敏感领域安全回答比率上升29%。

和 ChatGPT RLHF 的方法类似,Alignment(对齐工作)在此处发挥了较大作用,同时未来也会有持续的发力空间。相比单纯累积模型参数量和数据量的「大力出奇迹」方式,其计算量相对较小。如下图,在 InstructGPT 文献中,加入RLHF 的1.3B模型,在整体胜出率上,超出了 175B 的微调模型,节省了100倍的成本。

95d0e07354f074ec556cad9c33e0560a.png

07

GPT 对技术人员有何影响?

这个问题在 ChatGPT 出现之后便存在。GPT-4 只是加剧了这样的担忧。对技术人员来说,需要在研究命题、下游任务方面做思考,NLP  很多单一子任务会随之消失,会引入新的研究命题

  • 如何精准提出需求;对 ChatGPT 进行「催眠」,Prompting Project。

  • 如何更正错误:Neural Editing。

  • 安全侦测AI生成。包括整个生成过程中的安全侦测和控制。

  • 构建专有化模型,专用指令和RLHF发掘下游任务潜力。

  • Machine unleaning

    (学会忘记数据、隐私保护)

    等。

08

从GPT-4 可以看出未来 LLM 的哪些趋势?

未来的研发方向和优化策略是什么?

1)闭源趋势 

网友戏称 OpenAI 已沦为 Closed AI。毕竟从 GPT1 到 GPT-4,模型各类细节越来越闭源和黑盒,大模型战场的竞争因素决定了 以GPT-4 为代表的第一梯度模型可能会越来越封闭,成为技术门槛。 

2)「Self Instruct」模式

其核心是:中小模型+大模型生产指令数据的「LLaMA 7B + text-davinci-003」模式。中小参数的模型在成本上,是更靠近实际落地的方式。要知道 llama.cpp 可以在 Pixel 6 手机上运行。通过该模式精调过的 Alpaca,效果接近普通 GPT3.5。

3)模型结合 

更多模态、更多形态结合 ChatGPT 类模型包括 Kosmos-1 和具身智能 PaLM-E,同时从听、说、看、触等全方位结合,形成类似真正智能体的概念。 

4)模型加速和降低成本 

这会是持续关注的方向,包括从训练、推理等多层面考量。

ecbee4bfb1ddb18821c765ab760e9de2.png

5)能力预测

这是很重要的方向。即用小模型来预测广泛大模型的能力,极大减少试错成本,提升训练效率。

6)开源评测框架

这对于 LLM 的评测具有重大意义,可以快速发现改进方向。

09

GPT-4 论文有哪些值得关注的点 ?

有一些点比较有趣且可以引发我们的联想,这里提出两点:

1)GPT-4出现了“寻求权力”的倾向,并警告这一特征的风险

文中提到:

Novel capabilities often emerge in more powerful models.Some that are particularly concerning are the ability to create and act on long-term plans,to accrue power and resources (“powerseeking”), and to exhibit behavior that is increasingly “agentic.”

即 GPT-4 开始拥有一些新的能力,包括创建长期计划并采取行动的能力,积累权力和资源(“寻求权力”),以及表现出越来越「代理」的行为。例如,完成可能没有具体规定的、在训练中没有出现的目标。专注于实现具体的、可量化的目标。以及进行长期规划。而此类行为有突发性。

某种程度上,RLHF 的模型本身在寻求奖励最优,所以在某些问题上寻求权力可能会是最优的一项选择。

2)赋予了GPT-4自我编码、复制和执行的能力,甚至启动资金

在测试GPT-4的过程中,OpenAI 引入外部专家团队 ARC 作为「红方」。ARC 给 GPT-4 这样一个操作:允许GPT-4执行代码、进行链式推理,并给予少量的钱和一个带有语言模型API的账户,用是否能够赚更多的钱来增加其的稳健性。

10

GPT-4 是通往 AGI 的唯一道路吗?

个人认为,ChatGPT/GPT-4 这样的模型是现在距离 AGI 最近的一条路。但因为其本质为一个概率预测模型,没有真正的逻辑处理模块,也没有记忆存储模块,属于一个不太稳定的系统。

另外,它使用外界工具的能力也尚显初级。一个真正的 AGI 一定会像人一样,可以快速学会工具的使用。

但 GPT 大模型的不断进化,让人类看到了触碰到 AGI 的希望之光。

以上是本次分享全部内容,谨代表作者个人观点和看法。也许你还想了解ChatGPT 的终局将在何方?后 ChatGPT 时代,技术人该如何自保?我们还邀请了8位各行业的顶尖技术专家,进行了一次长达2小时的闭门夜聊。我们将核心精华内容,整理在本次推送的次条,欢迎关注。如果觉得内容有用,欢迎转发分享~

 参考材料

1. GPT-4 https://openai.com/research/gpt-4

2. GPT-4 is OpenAI’s most advanced system, producing safer and more useful responses https://openai.com/product/gpt-4

3. GPT-4 Technical Report https://cdn.openai.com/papers/gpt-4.pdf

4. GPT-4震撼发布-机器之心 https://mp.weixin.qq.com/s/kA7FBZsT6SIvwIkRwFS-xw

5. In AI, is bigger always better? https://www.nature.com/articles/d41586-023-00641-w Nature | 在AI领域,模型越大意味着越好吗?- 智源社区

-End-

原创作者|冉昱

技术责编|冉昱

最近微信改版啦,有粉丝反馈收不到小云的文章🥹。

请关注「腾讯云开发者」并点亮星标

周一三晚8点 和小云一起涨(领)技(福)术(利)

fc9d67371cac44ec51b88d7a88bb1942.gif

390f0f9360f67a2ba17bb803ced21b3c.png

96e7210057ac837f188a6665ba637543.png

bb3fa369594cad1b464c4067a6bc5a48.png

e6d31517531a04c03c83d8714848dac1.png

efa387f0aab4f2590e15857383e1da7e.png

ec825f85241d05523f0162c43614fff1.png

近期 AI 领域相继而至多个新模型,带来一阵阵「血雨腥风」。有人赞叹这是新未来,也有人惊恐这怕是要取代哪一行哪一业。你怎么看?

  • 你觉得 GPT-4 是否会取代程序员?程序员如何应对?

  • GPT-4 会如何影响你的工作?

  • ta将带来哪些产业应用新可能?

欢迎在评论区聊一聊你的看法。在3月20日前将你的评论记录截图,发送给腾讯云开发者公众号后台,可领取腾讯云「开发者春季限定红包封面」一个,数量有限先到先得😄。我们还将选取点赞量最高的3位朋友,送出腾讯QQ公仔1个。3月24日中午12点开奖。快邀请你的开发者朋友们一起来参与吧!

f685dec9d295016003673e4e9d24e230.gif

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/19467.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

讯飞星火大模型将突破开放式问答能战胜chatgpt等国际AI吗?

近日,科大讯飞召开了星火认知大模型成果发布会,会上表示讯飞星火大模型将突破开放式问答,对标ChatGPT,在中文能力上超过ChatGPT,在英文能力上与ChatGPT相当。对此,你怎么看? 科大讯飞推出的新一…

chatGPT怎么用?对教育行业的帮助

推出ChatGPT后,教育普及的门槛更低了。 教育不公平是一个普遍存在的全球性问题。我们可以发现,不同国家和地区以及不同群体之间的学习机会和成果存在巨大的差距。 在许多国家,贫困水平对数学成绩有很大影响。根据全球教育不平等数据库的数据&…

基于小米NOTE的安卓手机刷nethunter通用包的教程

基于小米NOTE的安卓手机刷nethunter通用包的教程 前言概述最后展示一下相关的画面: 前言 随着安卓平台的发展和kali官方的支持,安卓手机安装体验kail linux变得越来越好了。安卓手机安装引入kali有一些不同的方式,当然也要看手机的平台了&am…

苹果被曝正在研发 Apple GPT,“傻瓜”Siri 有救了?

整理 | 屠敏 出品 | CSDN(ID:CSDNnews) 姗姗来迟,终于等到苹果正在着手开发人工智能工具的消息。 据彭博社报道,苹果正在内部开发自己的类 ChatGPT AI 聊天机器人,一些工程师直接简明扼要地将其称之为“App…

2019款奔驰E级:价格不变,深受欢迎

不久前奔驰E级长轴版上市,令网友欣喜的是,价格与老款保持不变,价格为为43.58万-62.98万元,国产奔驰E级在国内非常受欢迎,它介于奔驰C级和S级之间,起着承上启下的作用,主力车型2019款北京奔驰E30…

全新昂科威:前脸更换家族式脸谱,动力和配置依旧没变

别克通用旗下的不少车型,都经历过换代和升级,尤其是一些比较畅销的车型,但是在面对竞争对手的车型,别克还是显得有些吃力,所以间接造成19年第一季度的销量不佳,同比下滑不少。随着国六排放的标准出台&#…

新一代奔驰C级车型内饰大改动,预计2021年才会亮相?

新一代奔驰C级的头尾灯变化明显,预计将搭载4缸、6缸以及混动系统。最近,外媒曝光了一组全新一代梅赛德斯-奔驰C级的谍照,它的车身伪装依旧很重,因为这款车距离亮相还会有好长一段时间。 其实不看奔驰C级的谍照我们也能猜到&#x…

2019款昂科威试驾:动力性能标杆,驾控体验更舒适

2019款昂科威亮相以后,反响一直很好,作为别克的资深车迷,小编自然早早的体验了一把,2019款别克昂科威究竟有什么值得称赞的地方。 从JD Power的排名来看,别克这个品牌的车型还是一如既往的受到消费者的喜爱。为了更好的…

2020款凯迪拉克XT5:外观霸气,亮点在动力

作为进口车型SRX的继任者,国产凯迪拉克XT5从来不缺少眼球。近日,凯迪拉克XT5已经到店了,我们也第一时间给大家拍到了几组实拍图。新车将与奔驰GLC、宝马X3等中型SUV展开竞争,动力满足国六排放。新车外观方面变化不大,主…

2020款奔驰E级谍照曝光,带给你非同一般的感觉

现在市面上有很多coupe,但奔驰E级轿跑车却并没有因此而被埋没。它没有任何花哨的绰号或过度的外观,是真正意义上的轿跑车。但是,一直是一个外观,再好的车也会引起审美疲劳,所以,奔驰开始致力于2020款E级的改…

2019款别克君威:年轻现代化,纵享操控驾驶乐趣

别克君威,自从别克家族设计语言升级以后,别克君威就把定位放在了年轻群体上,凭借着前卫的运动造型获得了90后的青睐,并且实现了很好的成绩,月销过万。今年,君威推出了2019款,全系标配9速&#x…

2019款的别克君威:90后的青睐,亮点不只是内饰

其实美系车一直在我国国内市场里面占有比较重要的位置,尤其是别克旗下的车型,比如说全新君威,这款车就是为年轻人设计的一款车,这一款是前卫的运动造型,获得九零后的青睐与喜爱,当时在上市的时候它的销售成…

完美打造最后的光荣——2020改款别克君越

据美国媒体报道,2020改款别克君越将于2019年年初在中国上市,而美国方面自2019年款车型销售结束之后,不会再制造和销售君越。 君越、雪佛兰沃蓝达和凯迪拉克CT6都在通用底特律Hamtramck装配厂组装,将于2019年3月1日起停产&#xff…

2020款奔驰E级:颜值与实力同在

近日,海外媒体曝光了奔驰全新E级的路试谍照,和以往路试贴伪装膜不同的是全新E级更像是光明正大在路上测试,似乎担心别人不知道。言归正传,和现款相比,新车主要在前脸和中控台发生变化。此外,新车还继续2.0T…

2019款别克昂科威:国六标准,动力操控更感人

别克昂科威在SUV市场上一直是火爆车型,2019款车型国六版在去年年底已经上市,在今年7月1日,我国多省市提前开始实施国六排放标准,作为中型SUV中的佼佼者,别克昂科威国六版到底如何? 别克昂科威在外观上&…

2019款奔驰E级:据说是成功人士都会买的一款车

世界有两种车,一种是玩具,主人百般溺爱,多数珍藏在车库,也有的厮杀于赛场,但都罕有亮相。另一种是工具,载着车主走南闯北,陪伴着车主体验着生活的五味杂陈。他们也曾光鲜,但车主不曾…

2019年别克昂科威:空间良好舒适,外观体面豪华

2019款别克昂科威是一款令人愉悦的近乎奢华的跨界SUV,它可能拥有美国历史最悠久的汽车制造商的徽章,但2019年的别克昂科威绝对是全球性的。这款五座汽车是第一款在中国制造的美国跨越式跨界SUV,这可能有助于解释其相对狭窄的内部和标准和可选…

2019款奔驰E级:三次改款上市,奔驰到底在做什么?

一年三次上市,奔驰到底在做什么?截止今年9月,奔驰E级提升了3次,上市了3次,这一系列动作着实让人有些摸不着头脑,尤其是对奔驰E级而言。作为年代改款上市车型,2018款新款奔驰E级主要针对配置进行…

豪华外观与优质内涵——2019款奔驰C级评测

2019年的梅赛德斯奔驰C级轿车在升级过程中运行得非常深入,但快速浏览一下并不能揭示其中的许多内容。大多数人都蜷缩在皮肤下,而且效果很好,因为C级从未遇到过它不喜欢的英俊角度。引人注目的是,无论是敞篷车、轿跑车还是轿车&…

2020款凯迪拉克与2019款昂科威:真实油耗对比

2020款凯迪拉克XT5和2019款昂科威哪个更省油 真实油耗对比?我们对比凯迪拉克XT5,昂科威的发动机排量,最大功率,扭矩,工信部综合油耗,为你的选车提供参考。 2020款凯迪拉克XT5上市于2019年6月17日&#xff…