震惊!火爆全网的ChatGPT背后使用的数据库居然是……

摘要:ChatGPT承认了自己背后使用的数据库是Cassandra。

OpenAI最近发布的AI驱动的智能聊天机器人ChatGPT在互联网上掀起了一阵风暴,热衷于尝试这一新AI成果的网民不在少数。ChatGPT针对网友广泛的问题提供了非常有针对性的回答,其不可思议的能力成为各大媒体平台的头条新闻,其应用内部的算法模型、应用领域、实现原理也被大家广泛谈论和探索,小编作为数据库从业者,自然也想探秘一番,让我们一起往下看吧。

狂野的发文

最初是领英上的一篇发文引起了大家的关注,北美数据库公司DataStax的开发者与Cassandra数据库开发者帕特里克在Linkedin上发文说到,这是一个非常狂野与充满想象力的消息,ChatGPT承认了自己背后使用的数据库是Cassandra!

简要来说,帕特里克问ChatGPT能否给出一些使用Cassandra进行AI模型训练的例子,这时ChatGPT竟直接回答OpenAI就是使用这一数据库来储存训练数据和模型节点的。为了实现这一目的,OpenAI对于AI开发流程很可能还打造了自己与Cassandra交互使用的一套工具链,命名为Cassio。对于上述信息,回答中还给出了工具链的源码与文档链接,最后还生成了一段代码示例。

这一回答让人感觉十分真实,不禁让人怀疑是否真的如ChatGPT所说,火爆全网的AI应用背后使用的数据库就是Cassandra呢?小编对于这个问题也是十分感兴趣,所以进行了一番求证,让我们往下看。

根据网上的资源,也有人尝试对AI领域使用Cassandra相关的问题询问ChatGPT,得到了如下的回复。

ChatGPT承认Cassandra作为分布式数据库,在实时AI储存中很有竞争力,在企业级应用中也占有大量份额,已被证实为一个实时AI应用的可靠选择。同时支持的多种数据类型,在AI应用中有广泛使用前景。但是,我们需要更加直接的证据来证明Cassandra和ChatGPT的联系!

灵魂的拷问

有资源的相关人士,通过正在内测的新必应,尝试问出OpenAI使用Cassandra的真相。新必应内置增强版的ChatGPT,其对于对话内容获取与问题解答的能力相较于公开版更为强大。在这里我们直接拷问新必应OpenAI是否使用了阿帕奇Cassandra数据库。

新必应的回答先是夸赞了Cassandra一番,随后也没有直接肯定OpenAI使用了Cassandra数据库,但是也提供了一些OpenAI历史上可能应用过这一数据库的证据。同时我们看到,回答中显示有油管视频展示了如何使用GPT-3来操作这一数据库,OpenAI的高级工程师David Greenbery也曾是阿帕奇基金会下Cassandra项目的代码提交者。当然,这一回答并不能满足我们对于OpenAI是否使用了Cassandra的疑问,所以我们更加直接地追问新必应,ChatGPT是否真的使用了Cassandra数据库。

这一次的回答提供了更多的新信息,但是还是没有直接承认ChatGPT使用Cassandra数据库。但是在夸赞Cassandra的同时,也提供了三个在AI领域具体应用的例子,例如帮助编写数据查询语句与生成相关数据图表等。这一深入的回答不禁让人想到,是否这样的应用已经存在于OpenAI内部,只是没有得到公开承认。

同时,目前必应的ChatGPT版本尚未是最终发布版本,后续回答是否会改变我们不得而知。在新必应最终发布时,会不会使用Cassandra做业务支撑,始终还是一个未知数。不过我们可以确定的是,在这个AI应用场景下,Cassandra数据库应是不二选择。

存在是否真实

DataStax的员工在更深入的探索与交互中,发现ChatGPT提供了更多不存在的链接。这一证据也可能表明相关应用证据和工具链曾经存在于网络上,只是已经被移除了。但是非常多的证据可能还散布在网络上。世界上最大的工业自动化公司之一Rockwell Automation也曾发文介绍AI在工业需求预测上的应用。这么多关于OpenAI把Cassandra应用于AI领域的消息,十分明确地指明了这一可能的应用方向与相关前景。至此,我们可以相信,即使OpenAI没有公开承认其使用的技术栈与数据库,Cassandra也有相当的概率已经被其应用于相关服务。

真实世界的解决方案

ChatGPT对于Apache Cassandra的介绍已经覆盖了其非常多的特性,对于应用场景也有了充分的描述,其分布式、高可用、低时延、高容灾的特点描述也十分准确。AI的大规模应用离不开海量的数据储存和处理,一个高效的数据库在AI模型的训练和部署阶段显得尤为重要,具备更快的读取速度、更优越的架构、更强的一致性,才能为人工智能模型的训练和应用保驾护航。

例如,有着1750亿参数的ChatGPT模型,在训练过程中需要海量数据。这些数据在分布式训练的环境下,要怎么解决诸如读取速度与一致性等问题呢? 同时,面对全球上亿用户,如何支持ChatGPT所有业务的并发呢?

我们的解决方案是,使用一款高效稳定、大容量的Cassandra数据库,比如GaussDB(for Cassandra)。

华为云GaussDB(for Cassandra)是一款基于华为自研的计算存储分离架构的分布式数据库,100%兼容Cassandra生态,相比较开源的Cassandra版本,具备高可靠、高性能、高安全、极致弹性、便捷管理、强一致性等系列优势,十分适用于海量并发、流量热点等场景。

GaussDB (for Cassandra)在AI领域的应用探究

分布式难题

GaussDB(for Cassandra)的分布式强一致性特点和华为云支持的计算节点扩容和秒级储存扩容,为AI模型训练提供强大支持。多节点同时存取数据时,相比开源Cassandra的最终一致性,GaussDB(for Cassandra)提供的强一致性特征保证每个训练节点实时获取数据的一致,为训练过程输入的数据提供可靠性保障。

数据结构

Cassandra的宽表结构,提供了灵活的数据定义。在储存原始数据输入时更具优势,也适用于多变的AI训练场景,适合AI模型的下游细粒度优化与fine-tuning任务。

长时间训练

对于长时间训练的大模型项目,数据库的高可用异常关键,数据库的波动将会极大地影响模型训练进度。对此,GaussDB(for Cassnadra) 采用了三副本形态,数据安全可靠,无丢失风险。同时支持大容量PB级数据存储,存储容量秒级扩容,对线上业务无干扰,无中断。

复杂查询

针对模型的下游针对性训练与鲁棒性检验,需要提取部分具有特殊属性的数据。GaussDB(for Cassandra)对大数据量查询性能进行了优化,引入视图增强特性,并对表结构进行优化设计,满足了信息流、内容搜索等业务的查询需求。同时,Lucene引擎全新解决方案已经上线测试,支持更多的文本复杂内容查询场景,完美弥补NoSQL数据库弱查询的短板。

超高并发

对于全球亿级用户访问ChatGPT的局面,GaussDB(for Cassandra)也能对大流量提供很好的支撑。使用的LSM tree储存引擎,对于高写入场景有很好的效果,既能高效储存用户数据,又支持快速离线导出分析,为超高并发业务提供支持,还支持数据变更捕获和实时分析。

综上所述,我们抽丝剥茧探秘了ChatGPT背后使用的数据库,也探索了GaussDB(for Cassandra)在AI领域的应用实践,相信大家对ChatGPT和GaussDB(for Cassandra)已经有了初步的了解,其实GaussDB(for Cassandra)早已拓展到了社会服务的各个方面,更多的应用场景等待着大家的探索。

所以,支持ChatGPT后台的数据库,为什么不能是GaussDB(for Cassandra)呢?

点击关注,第一时间了解华为云新鲜技术~

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/9594.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

赛狐ERP率先引入ChatGPT 一键生成优质Listing

最近被火遍全球的ChatGPT刷屏了,作为以人工智能技术驱动的自然语言处理工具,它正在用一种新的方式改变着我们的工作和生活。为了更好地赋能卖家,赛狐ERP研发团队快速响应市场需求,率先引入了ChatGPT技术,基于亚马逊畅销…

谷歌推出PaLM-E,能超越ChatGPT么?

‍数据智能产业创新服务媒体 ——聚焦数智 改变商业 ChatGPT的横空出世,打的老牌科技巨头谷歌措手不及。在OpenAI微软的双重压力下,自赋“红码”的谷歌亮出“大招”。 近日,谷歌和柏林工业大学的团队重磅推出史上最大的视觉语言模型——PaLM…

“文心一言”和“ChatGPT”两者有何差距?

如果说现阶段火遍全球应用是什么,绝大多数人会脱口而出——ChatGPT。当然最近我们国内版也出来了,就是百度的“文心一言”,文心一言和ChatGPT都是当下以语言模型为核心的人工智能平台,这两者对比之下有何不一样呢?下面…

ChatGPT+Midjourney

一键部署属于你的ChatGPTMidjourney网页,目前已实现: 1.imagin 想象 2.upscale 放大 3.variation 变幻 4.describe 识图 5.blend 混图 6.垫图 开源地址:https://github.com/Licoy/ChatGPT-Midjourney 欢迎大家访问:http://…

ChatGPT 的议论文究竟写的怎么样?111 位高中教师告诉你答案

夕小瑶科技说 原创 作者 | 小戏、Python 在 OpenAI GPT-4 发布时发布的《GPT-4 Technical Report》中,其中很吸引人眼球的一部分是 GPT-4 应用于教育领域的出色表现,通过让 GPT-4 去完成美国的 AP 课程及考试,来评估 GPT-4 在多个学科中的性…

刚刚!ChatGPT演示即将上线王炸功能!不仅推出官方版AutoGPT,还能联网,支持处理Excel,发推购物一条龙!...

转载自量子位 OpenAI官方AutoGPT,要来了! 就在AutoGPT项目破10万Star之际,OpenAI也放出重磅炸弹,由联合创始人格雷格布洛克曼(Greg Brockman)亲自现场演示了ChatGPT即将上线的新功能。 比如要一张这样有氛围…

【历史上的今天】7 月 10 日:iOS App Store 问世;台积电创始人出生;第一台被“越狱”的 iPhone

整理 | 王启隆 透过「历史上的今天」,从过去看未来,从现在亦可以改变未来。 今天是 2023 年 7 月 10 日,在 1856 年的今天,交流电的发明者尼古拉特斯拉(Nikola Tesla)出生。特斯拉被认为是电力商业化的重要…

沙龙|AI iPhone时刻来临!如何获得登上类ChatGPT的船票?

出品|网易科技数字星球 作者|袁宁 编辑|丁广胜 兴奋麻了!还没从ChatGPT带来的震撼中回过神来,过去几天GPT-4、Microsoft 365 Copilot、Midjourney V5、Google PaLM API、文心一言相继引爆,互联网巨头纷纷抢…

来自 ChatGPT 的威胁?谷歌、百度纷纷入局,苹果被迫“开卷”

整理 | 朱珂欣 出品 | CSDN程序人生(ID:coder_life) 近年来,AIGC 应用可谓是多处开花,成为了科技巨头的“必争之地”。 随着 ChatGPT 在互联网上“高热不下”,除了拍案叫绝的聊天能力以及惊人的准确率备…

苹果 App Store 出现山寨ChatGPT;Anthropic宣布获得4.5亿美元C轮融资

🚀 中国互联网协会提醒公众警惕“AI换脸”的新骗局 中国互联网协会提醒公众警惕“AI换脸”的新骗局,不法分子利用AI技术通过声音合成、伪造面部表情等实施诈骗。 公众应加强个人信息安全与防范措施,如加强个人信息保护、防止信息泄露、安装…

论文阅读 A Survey of Large Language Models 3

文章目录 能力评估基础任务语言生成知识利用率复杂推理 高级能力评估人类对戏与外部环境的交互作用扩展能力范围 公共基准测试和经验分析评价基准对LLM的能力进行全面分析 结论和未来方向 能力评估 为了检验LLM的有效性和优越性,大量的任务和基准被用来进行实证评估…

【NLP】大模型综述来了!一文带你理清全球AI巨头的大模型进化史

夕小瑶科技说 原创 作者 | 小戏,Python 如果自己是一个大模型的小白,第一眼看到 GPT、PaLm、LLaMA 这些单词的怪异组合会作何感想?假如再往深里入门,又看到 BERT、BART、RoBERTa、ELMo 这些奇奇怪怪的词一个接一个蹦出来&#xf…

LLMs模型速览(GPTs、LaMDA、GLM/ChatGLM、PaLM/Flan-PaLM、BLOOM、LLaMA、Alpaca)

文章目录 一、 GPT系列1.1 GPTs(OpenAI,2018——2020)1.2 InstructGPT(2022-3)1.2.1 算法1.2.2 损失函数 1.3 ChatGPT(2022.11.30)1.4 ChatGPT plugin1.5 GPT-4(2023.3.14&#xff0…

【人工智能】大模型综述 —— 一文带你理清全球AI巨头的大模型进化史

目录 导读 家谱树——大模型的前世今生 数据——大模型的力量源泉

山东大学软件学院2022-2023第二学期自然语言处理期末考试回忆版

山东大学软件学院2022-2023第二学期自然语言处理期末考试回忆版 前言 1、考试时间:2023/6/13 14:00 – 16:00 2、考试科目:自然语言处理(老师:SunYuQing) 3、考题语言:中文 4、考试形式:闭卷 …

ICLR 2023 | Self-Consistency: Google超简单方法改善大模型推理能力

大家好,我是HxShine。 今天分享一篇Google Research, Brain Team的一篇文章,SELF-CONSISTENCY IMPROVES CHAIN OF THOUGHT REASONING IN LANGUAGE MODELS[1]:利用自洽性提高语言模型中的思维链推理效果 这篇文章方法非常简单但是效果非常好…

【ChatGPT 翻译】Language Models are Few-Shot Learners

【ChatGPT 翻译】Language Models are Few-Shot Learners 摘要 Abstract1 引言 Introduction2 方法2.1 模型和体系结构2.2 训练数据集2.3 训练过程2.4 评估 3 结果3.1 语言建模、完形填空和完成任务3.1.1 语言模型3.1.2 LAMBADA3.1.3 HellaSwag3.1.4 StoryCloze 3.2 闭卷问答翻…

ChatGPT的今天,早已被这本书预言了|文末赠书

最近,ChatGPT大火了!推出之后,ChatGPT只用了两个月就积累了1亿用户,随着越来越多的人开始用ChatGPT,发现他能做的东西越来越多,写论文、写作业、写文案、写代码都不在话下。 于是,各种稀奇古怪的…

OpenAI ChatGPT 3.5模型和清华开源ChatGLM-6B模型的对比,到底ChatGPT强在哪里(内含几个国内GPT可用途径)

目录 前言: (1)环境 (2)比较用例 (a)中文提问:用java写冒泡排序算法 (b)中文提问:a10,b6,不新增变量,怎么交换a和b的值&#xff…

当ChatGPT的子弹射中知乎

题图|视觉中国 毫无疑问,ChatGPT 已然成为 2023 上半年最有影响力的商业话题。 ChatGPT 横空出世仅百余天便让整个互联网都为之躁动,心有猛虎的公司都在寻找向上攀爬的入口——“文心一言”之于百度、“通义千问”之于阿里、百川智能之于王小…