大模型能否生成搜索引擎的未来?

文|郝    鑫

编|刘雨琦

ChatGPT火爆之前,水面下,也有中国公司也在朝着智能助手的方向努力。夸克便是其中之一。在GPT风靡科技圈后,国内就开始陆续冒出一些大模型厂商。对当时夸克而言,做大模型毋庸置疑,但做什么样的大模型还需要结合自身优势去制定详细方案。本质上,这是一个技术性和实用性谁是第一性的问题。同样是做大模型,有的厂商选择先攻克技术,大模型研发出来后再找业务场景;而有的厂商,则是从已有的确定性场景出发,匹配满足业务需求的大模型。夸克显然属于后者,从搜、存、用三个主要核心场景出发,打造知识准确性高、逻辑理解能力强的大模型底座。事实上,大模型问世之后,落地速度并没有想象中那么快,核心原因便在于找不到场景,拿着锤子满世界找钉子,效率自然不高。而夸克则从原有的场景出发,产生价值是关键。正是源于这样的思考,夸克大模型的诞生贯穿着实用性的思考,也自我定位为:面向搜索、生产力工具和资产管理助手的应用型大模型。更准确的说,夸克借着大模型的技术东风,将原有产品功能进行智能化升级,也再次明确了打造集工作、生活、学习一体的AI助手的初心。

“学霸”是怎样炼成的?

什么样的土壤,结出什么样的果实,夸克大模型从出生起就自带着搜索引擎的基因。搜索的本质是将用户的搜索意图和信息进行匹配,而这也正是帮助大模型形成逻辑的过程。用户的每次查询、点击,都会建立、强化和拓展匹配的关联性,比如在浏览页面的过程中,就能自然地建立起“ChatGPT-OpenAI-奥特曼”之间的关系。循环往复,通过搜索就积累起了庞大的数据,建立起了涵盖文字、图片、视频的多模态知识图谱,正是在这些错综复杂的知识图谱中构建起了逻辑关系。可以说,用户的每一次搜索行为,都是在辅助大模型训练。基于此,以Transformer为架构,从搜索引擎中长出来的夸克大模型,天然就擅于理解和逻辑。得益于在理解和逻辑上的天赋,让夸克大模型确定了最核心的能力——知识正确性能力。“要开发大模型应用,首先就要解决知识正确性的问题。现在内容生成,主要靠大模型的创意能力,而不是知识能力,这可能拥有一部分市场。但更进一步,我认为,好用的大模型产品和创新产品,应该是知识和创意能力的结合”,夸克技术负责人蒋冠军表示。但从发现到构建,这中间还需要解决两个核心问题,一是如何降低幻觉,提高大模型输出的准确率?二是如何让大模型真的去理解和学会,不止是学会,更要做“学霸”。因此,“学霸计划”正式确定成立,夸克打出了一套组合拳。首先是参数要大,夸克大模型参数达到了千亿级。更大的参数量,意味着模型的知识容量更大,可学习语言的模式也更丰富,有利于大模型的分析和推理。其次是从数据价值上下功夫。从数量上做到全,据悉,夸克大模型几乎涵盖了所有的中文知识,以及丰富的英语和其他语言知识;从数据质量上做到优质,基于搜索引擎经验,夸克团队有一套科学的知识评估、对齐和校验体系,可以筛选出哪些数据是有价值的,同时过滤出无用、有害的数据;从数据与数据关系层面,采用大量知识图谱、文档和网页知识去做知识增强。最后是靠专业团队来生产和审核知识。在医疗、教育、文档行业,夸克不仅沉淀了大量的数据,还引进了专业的医生、老师等角色,一边生产出专业优质的知识喂给大模型,一边也为最后结果生成的准确性加筑了一道防线。蒋冠军告诉光锥智能,靠专业团队供给大模型训练,才让其走到了现在,“最初我们做一个版本,但是效果不太好。于是,我们立马组建起专业团队,不仅有正式员工、行业资深从业者,也建设了专门的第三方团队”。不过,真学霸还是假学霸,还得拿成绩说话。在提升准确率方面,夸克大模型在健康等高精专行业,知识错误率降到了5%以下,基本上达到较高可用性。在国内最权威的两个大语言模型测试榜单中,夸克大模型经过了上万道专业考题的检验,覆盖几十个学科和不同学段,无论是常识问题还是社会科学知识,夸克大模型都展现出了处理复杂、多层次问题的能力。

在C-Eval榜单中,夸克大模型平均分达到89分,位居榜单第一,同时在社会科学、人文科学和其他三个类目中位列榜首。

在CMMLU榜单评测中,夸克大模型以平均77.08分的成绩位列总成绩第一,并占据社会科学和其他两个类目的首位。

临床执业医师资格考试、计算机等级考试、公务员考试、教师资格证考试,夸克大模型摇身一变,成了各领域的“专业人才”。

重要的是,夸克是什么

一个以知识能力为核心,兼具对话、创作、安全的锤子打造好后,下一步就要考虑楔钉子的顺序以及怎么用大模型的底座把夸克的产品功能挨个智能化改造一遍。蒋冠军介绍,他们对夸克的最新定位是一款集搜、用、存的智能信息产品。该定位来自于夸克团队对其主要用户群体,即25岁以下的年轻用户长期使用场景的分析,蒋冠军表示,“在大家工作、学习和生活的过程中,无外乎是找资料、存资料,并且最好还能在云端进行编辑和加工”。梳理后发现,“搜”的功能中包含了通用搜索、文档、图片、视频、医疗、教育等场景;“用”的功能具体指所提供的工具,其中有扫描王、高考填报、网页、资料生成等工具;“存”则指向个人云盘系列功能,内含了资产管理、资产搜索、资产编辑等功能。搜索一向是夸克的“灵魂”,自然也成为了落下的第一颗“钉子”。对夸克来说,“搜索”是引擎,牵一发而动全身。因此,对搜索的改造,绝不能浅尝辄止。具体来看,目前有三个主要方向的升级:对通用搜索结果的优化,对生成内容的增加以及对健康、教育和法律等核心场景的再产品化。过去,用户在搜索引擎中的查询、点击和结果返回的行为,本身就是一种交互方式,只不过在这种情况下搜索不具备针对性,搜索结果呈现也是散状的。而有了大模型以后,搜索的行为更像是对话,既可以展现通用的答案,也可以针对用户个性化提问、追问进行补充。搜索结果可以聚合和整合,不用再同时打开十几个网页,并且结果正确性可追溯。夸克认为搜索本身就是一个以内容为驱动的产品,AIGC技术趋渐成熟催化了搜索内容的进一步爆发。现阶段,夸克在搜索上推出了大量的AIGC内容,比如支持消息祝福、语文作文、合同、规章制度、新闻稿等短、中、长的文案创作。健康、教育和法律行业都是对知识性要求极高的行业。首先是有进入门槛,如果没有长时间的行业积累,很难把行业摸透,做到深、精和专。再者,用户对这些行业的知识需求,量要足够大,知识的难易程度要有阶梯性的区分。更为关键的是,用户搜即用,从学术写作、实验室到手术台、法院,对准确性都有极高的要求。上述要求或许对其他玩家存在挑战,但对夸克而言,从行业经验、数据积累到知识的准确性,本该水到渠成。“在健康场景上,我们做了很多行业数据建设和知识建设,具备完整的健康知识图谱,储备了大量医典百科、医典问答的C端用户数据,还整理了大量的指南、标准和书籍等一系列数据”,蒋冠军说道。此外,夸克的优势还在于有成熟的场景和用户。大模型对健康和法律行业的改造,早在年初就在国外兴起,也被视为具有潜力的市场。几乎同时期,国内就出现了一批“Copy to China”的追随者,但却忽略了本质逻辑,国外能火是因为把昂贵的劳动力价格打了下来,却不符合国内实际情况。所以直到现在,仍有很多创业者在做2C还是2B场景中徘徊。然而,对夸克来说,做健康、法律、教育不是选择,而是发挥之所长。蒋冠军告诉光锥智能:“为什么我们要重点建设健康行业?原因在于搜索引擎的核心群体就涵盖了对健康信息的强需求,在搜索引擎上,用户可以获得更好的信息服务。”夸克大模型之于健康知识查询、获取,最大的变化在于,不仅能做健康科普问答,还具备比较好的推理能力。以一个咨询咳嗽症状的场景为例,以前在搜索引擎的操作流程如下:在搜索框输入“咳嗽了三天越来越严重了怎么回事儿?”,然后网页出现了一堆五花八门的答案,有的说是感冒,有的说是肺炎,有的说是支气管炎,问题是一点没解决,还徒增了恐慌。夸克团队注意到,上述情况存在着两个痛点:普通用户缺乏专业知识,不知道怎么精准地描述自己的症状;同样一个小症状可能对应着一堆疾病,怎么判断哪个是主要症状?夸克给出的解决方案是,线上给每位患者建立了“医疗卡”,当用户简单描述了咳嗽的症状后,会出现一系列相关的可能对应疾病症状。提交完后,大模型会根据当前的症状信息,给出一个疾病范围。通过交互和推理,大幅度提升了诊断的精确性。最后,大模型会输出参考信息,给出几个参考方案,如果是A种情况,有什么症状,确诊需要做哪些检查,可能会开什么药等等。在工具、云盘功能方面,当前夸克大模型的主要作用是提效。在云盘上,夸克网盘相册可以用自然语言去完成检索,背后是夸克大模型加持的多模态技术和能力;在扫描产品上,扫描识别、资料生成、AI智能填表等更多功能已经在升级和开发的路上。“夸克大模型基本上完成了在当前阶段的整体迭代,具备在一部分夸克App的场景里提供服务的能力”,蒋冠军总结道。

大模型是搜索引擎的未来吗?

大模型之后,微软、谷歌等都曾尝试重构搜索,但目前为止并没有确定性的结果。这同样是夸克的挑战,但也是巨大的机会。新一代的搜索引擎不单单只是一个冰冷的工具,而是由用户来重新定义,它可以是工作伙伴、情感陪伴、老师朋友。微软将之称之为“Copilot”副驾,谷歌称之为“Magi”。谷歌表示搜索不仅仅是一个工具,而是一个伙伴,一个灵感来源,一个创造力的催化剂,搜索体验将成为重点。搜索引擎的角色定位变了。这一本质的改变会带动搜索引擎走向内容化的道路,同时流量的分配逻辑和商业模式也会随之改变。“现在是大模型辅助搜索,未来是大模型改变搜索。”蒋冠军表示,搜索产品的本质就是“交互+内容”,把搜索做得极致简单就是一个“框+内容”的形式,但是搜索的局限性在于,内容没法个性化和深度化,别人生产什么,它就回答什么。大模型诞生后,搜索的内容生成能力实现了指数级增长,交互提问的数量和理解能力也相应地指数级上升。下一代的搜索引擎将在内容联动性方面进一步打通,以此来增加搜索内容的丰富性。除了现在能看到的文字、图片、视频,以后还将会有短视频、社交媒体帖子、AI生成内容等,内容排序与推荐顺序的决定权重新交还给用户。同时随着大模型的进一步的普及,流量入口可能会从现在的搜索引擎转移到大模型的对话框,这将会直接导致流量逻辑和规则的改变。换而言之,未来,谁掌握了大模型,谁能吸引来更多用户使用其大模型,就能掌握话语权。关于下一代搜索,夸克也有自己的思考,夸克认为,搜索与大模型关系是随着技术成熟度而变化。蒋冠军判断到:“5到10年以后,搜索会有大变化”。他认为理论上来说,只要大模型足够强,会打破现有的很多信息获取习惯,大模型都是可以使用的工具,打字也好、语音也好,跟它交互很方便。再进一步,大模型的基础能力会越来越往搜索里面去渗透。先是大模型辅助搜索,完成一些工作,慢慢变成以大模型为核心,用搜索帮它完成产品创新。搜索推荐、排序与流量入口改变以后,搜索的商业模式必然会重塑。光锥智能发现,商业模式渐进式的重塑已经打响,例如谷歌在对话搜索生成的结果页,同样呈现了商家广告推荐;外媒报道,微软、谷歌已经尝试在类ChatGPT对话生成结果中,增加商家投放链接,价高者排序也比较靠前。这让新一代搜索充满了想象力。也让夸克这位主攻信息服务的新星,一跃成为阿里的创新代表之一。阿里三季度财报会上,新任CEO吴泳铭宣布首批战略级创新业务,夸克位列其中。从根本上看这源于阿里的“AI驱动”战略,进一步,吴泳铭曾在公开场合发言表示:“在可见的未来,会有更智能的下一代产品进入人们的生活,AI助理会无处不在,成为每个人工作、生活、学习中的助手”。在阿里内部“工作、生活、学习的助手”直指夸克,无论从内部的重视程度还是行业重要性来看,如今的夸克已经站在了下一代搜索的临界点。

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.rhkb.cn/news/206588.html

如若内容造成侵权/违法违规/事实不符,请联系长河编程网进行投诉反馈email:809451989@qq.com,一经查实,立即删除!

相关文章

Python list列表添加元素的3种方法及删除元素的3种方法

Python list列表添加元素的3种方法 Python list 列表增加元素可调用列表的 append() 方法,该方法会把传入的参数追加到列表的最后面。 append() 方法既可接收单个值,也可接收元组、列表等,但该方法只是把元组、列表当成单个元素,这…

“逆风飞翔·事实孤儿同行计划”成长陪伴主题区域陪伴培训会

为推进各机构更好地开展事实孤儿成长陪伴工作,促进事实孤儿成长陪伴实施成效,搭建各机构间事实孤儿成长陪伴方式方法交流平台。11月26日,在中国乡村发展基金会、中国民生银行的支持下,由湖南省大爱无疆青少年公益发展中心主办&…

ZZULIOJ 2466: 楼上瞎说,楼下才是,Java

2466: 楼上瞎说,楼下才是 题目描述 《九章算术》的内容十分丰富,全书采用问题集的形式,收有246个与生产、生活实践有联系的应用问题,其中每道题有问(题目)、答(答案)、术&#xff…

MySQL事务详解

MySQL事务详解 数据库事务概述事务是如何实现的事务的ACID特性事务的状态 事务的使用显式事务隐式事务示例自动提交回滚回滚到保存点 事务的隔离级别数据并发问题MySQL 支持的四种隔离级别注意示例 设置隔离级别 事务的常见分类 数据库事务概述 数据库事务是数据库管理系统&am…

【Linux】:信号(一)产生

信号 一.前台进程和后台进程1.前台进程2。后台进程3.总结 二.自定义信号动作接口三.信号的产生1.键盘组合键2.kill信号进程pid3.系统调用1.kill函数2.raise函数3.abort函数 四.异常五.软件条件六.core文件 一.前台进程和后台进程 1.前台进程 一个简单的代码演示 像这种程序在…

华为云之云桌面Workspace的使用体验

华为云之云桌面Workspace的使用体验 一、云桌面Workspace介绍1.云桌面简介2.云桌面特点3. 云桌面应用场景①远程移动办公②协同办公③安全办公④公用终端⑤图形制作渲染 二、本次实践介绍1. 本次实践目的2. 本次实践环境 三、购买云桌面1. 进入华为云的云桌面购买界面2. 选择购…

Linux下删除当前目录下的所有目录

Linux下删除当前目录下的所有目录 Linux下删除当前目录下的所有目录,可以使用命令:rm -rf ./* rm -rf ./*可以得知rm -rf ./命令是删除当前目录下的所有文件和文件夹,但不会删除根目录下的文件。其中,".“代表当前目录&…

ps 透明印章制作

ps 透明印章制作 1、打开不透明印章2、抠出红色印章3、新建图层4、填充红色印章到新图层5、导出透明印章 1、打开不透明印章 打开ps软件,菜单栏选择 文件-打开 选择本地不透明印章 打开 2、抠出红色印章 ps菜单栏 选择 选择-色彩范围 点击色彩范围 色彩范围窗口 取…

Python实现一箭穿心

文章目录 🎄效果🏳️‍🌈Turtle模块🌹代码🌺代码讲解 🎄效果 🏳️‍🌈Turtle模块 Turtle是一个绘图工具,是Python标准库中的一个模块。它提供了一种简单而直观的方式来创…

docker环境安装

环境 主机环境 1. 宿主机环境 ubuntu-22.04.3-live-server-amd64 ,下载地址: https://mirrors.aliyun.com/ubuntu-releases/22.04.3/ubuntu-22.04.3-live-server-amd64.iso 2. apt 包管理器,镜像源修改 : 将 http://cn.archive.ubunt…

【玩转 EdgeOne】| 腾讯云下一代边缘加速CDN EdgeOne 是安全加速界的未来吗?

目录 前言边缘加速与安全加固边缘计算与CDN的融合EdgeOne优秀的安全特性EdgeOne卓越的性能表现灵活的配置和管理生态系统的支持与发展技术创新与未来展望EdgeOne试用结束语 前言 在当下互联网的迅猛发展的时刻,云计算和边缘计算技术的快速发展为网络加速领域带来了…

83基于matlab 的时钟时间识别GUI

基于matlab 的时钟时间识别GUI。图像去除背景-转化为二值化图像-找出对应的直线边缘-找到秒针、分针、时针对应的直线,并算出斜率、角度-判断时间,分针与时针 (度数)。数据可更换自己的,程序已调通,可直接运…

【WSA】无法打开 适用于 Android™ 的 Windows 子系统,因为它处于脱机状态。可能缺少存储设备,或者存储设备已断开连接。

问题描述 之前可以正常使用适用于 Android™ 的 Windows 子系统(WSA),但突然间无法启动了。 当尝试启动WSA中的软件时,都会出现以下错误提示: 无法打开 适用于 Android™ 的 Windows 子系统,因为它处于脱…

分块矩阵知识点整理:

1.分块方法:横竖线不能拐弯,思想为将矩阵分块看作向量计算 2.标准型 不一定是方的 特殊性:经过分块后会出现单位矩阵和0矩阵 3.分块矩阵的运算: 1.加减乘的运算与向量运算相同 4.分块矩阵求转置: 1.将子块看作普通元素求转置 2…

HarmonyOS开发准备(一) TypeScript基本语法

HarmonyOS开发准备(一) TypeScript基本语法 TypsScript官网:https://www.typescriptlang.org/play 可在官网 Playround 在线运行 Typescript 一、变量声明 // 创建 number(数值) 类型变量 let test_number: number 111 console.log(test_number:, tes…

python爬取robomaster论坛数据,作为后端数据

一. 内容简介 python爬取robomaster论坛数据,作为后端数据 二. 软件环境 2.1vsCode 2.2Anaconda version: conda 22.9.0 2.3代码 三.主要流程 3.1 接口分析 # 接口分析 # 全部数据 # https://bbs.robomaster.com/forum.php?modforumdisplay&fid63 2…

go学习之json和单元测试知识

文章目录 一、json以及序列化1.概述2.json应用场景图3.json数据格式说明4.json的序列化1)介绍2)应用案例 5.json的反序列化1)介绍2)应用案例 二、单元测试1.引子2.单元测试-基本介绍3.代码实现4.单元测试的细节说明5.单元测试的综…

字符串和内存函数(2)

文章目录 2.13 memcpy2.14 memmove2.15 memcmp2.16 memset 2.13 memcpy void* memcpy(void* destination, const void* source, size_t num); 函数memcpy从source的位置开始向后复制num个字节的数据到destination的内存位置。这个函数在遇到 ‘\0’ 的时候并不会停下来。如果so…

Windows系列:Windows server 2016 部署路由与远程访问服务

Windows server 2016 部署路由与远程访问服务 前言环境要求服务器配置ip 设置"远程访问" 服务安装 "远程访问" 服务配置 ”远程访问“ 服务新建用户 客户机配置添加VPNping 前言 千万不要安装图上的几个服务,如果安装了,鼠标会失灵…

【Vue】生命周期一文详解

目录 前言 生命周期 钩子函数使用方法 ​编辑 周期-----创建阶段 创建阶段做了些什么事 该阶段可以干什么 周期----挂载阶段 挂载阶段做了什么事 该阶段适合干什么 周期----更新阶段 更新阶段做了什么事 该阶段适合做什么 周期----销毁阶段 销毁阶段做了什么事 …