【AI大模型】羊驼大模型详解_零基础入门到精通，看完这篇就足够了~

【AI大模型】羊驼大模型详解_零基础入门到精通，看完这篇就足够了~

news/2024/10/18 15:39:39/文章来源:https://blog.csdn.net/heaven522/article/details/142979932

LLaMa系列模型

羊驼模型（鼻祖是LLaMa模型，Facebook公司开源模型）：即将成为大模型的安卓，国内95%的大模型都是羊驼套壳。
GPT系列（OpenAI公司）：相当于大模型的iOS（不开源）。

LLaMa模型结构：前面的词预测后面的词，经典的解码结构。位置编码用的是旋转自编码。

大语言模型为什么取名为LLaMa（美洲鸵）？
LLM发音困难。两个LL跟绕口令一样挑战舌头。大家想给它加点原音，帮助发音。有人加了A，就是LLaMa。

LLaMa是2023年Meta发布的基础LLM模型，该模型有四个版本，分别是7B、13B、33B、65B参数的模型。（LLaMa模型是从零开始训练的基础模型，国内大多数模型都是套壳LLaMa模型）

2.模型的优点：

开源。相比之前的大模型，LLaMa完全是在公共开源预训练数据上训练（通用性比较强，没有使用封闭的数据）
推理效率也是LLaMa的一个亮点，可以在单卡V100完成推理（降低了硬件使用门槛，让大模型平民化，训练模型的成本大大降低）。

3.模型的训练和数据：
65B的模型使用2048块A100 80G的GPU，训练21天左右。（训练成本还是比较高的，训练的数据集同GPT一样）

LLaMa模型训练的数据集

Alpaca模型

Alpaca是斯坦福从Meta的LLaMA 7B微调而来的全新模型（套壳是微调模型，LLaMA是全调的基础模型），仅用了52k数据，性能约等于GPT-3.5。
训练成本奇低，不到600美元。（大模型屌丝化）
在8个80GB A100 上训练了3个小时，不到100美元;
生成数据使用OpenAl的API，500美元。（正常是人工来标注数据，人工的成本很高；这里数据标注使用了OpenAl的接口，问题问ChatGPT3，用它的回答作为标注数据来进行微调，训练出Alpaca模型）

国内很多大模型都是学Alpaca模型的玩法，套壳LLaMA模型低成本训练出自己的模型。

Alpaca模型的训练流程

Alpaca模型使用了GPT3来标注数据

Vicuna模型

Vicuna模型简介

Vicuna模型训练流程

Vicuna模型使用了GPT4来做评估（效果更好）

GPT5短时间暂时不会有，因为GPT4已经突破了人类现在的硬件资源的一个极限。

羊驼系列模型对比

羊驼系列模型对比

华驼大模型（国内的医疗大模型）

华驼大模型

百川大模型（搜狗王小川搞的大模型）

LLaMa + 中文数据

业内有句俗话：一开源就自主研发，不开源就卡脖子

LLaMa2的提升

模型的提升一般模型本身没有多大的进化，主要的提升是堆数据和堆算力，使模型进行进化。

LLaMa2.0的训练也使用了ChatGPT的训练那套方法：

第一步：首先对LLaMa模型通过问答对进行有监督的训练
第二步：训练一个排序模型（就是通过人来标注这个模型输出的数据，让这个模型输出的答案更加符合人类的认知；通过人来对这些输出的结果打分，来调整这个模型，让这个模型的输出结果更加符合人的认知）；这个强化模型，就相当于具备了人的情商，理解了人类的喜好。
第三步：用具备人类喜好的这个模型，再来去微调LLaMa，让这个LLaMa模型输出的结果更加符合人的认知（相当于具备了情商），这样就训练出LLaMa2.0。

微调的效果为什么会好？
原生的基础LLaMa用的语料是通用语料。在自己的数据上进行微调，让模型能够满足自己的需求。微调的本质并不是能把模型效果变好，微调的目的是让模型更适应于我们的数据。

可能大家都想学习AI大模型技术，也想通过这项技能真正达到升职加薪，就业或是副业的目的，但是不知道该如何开始学习，因为网上的资料太多太杂乱了，如果不能系统的学习就相当于是白学。为了让大家少走弯路，少碰壁，这里我直接把全套AI技术和大模型入门资料、操作变现玩法都打包整理好，希望能够真正帮助到大家。

如何学习AI大模型？零基础入门到精通，收藏这一篇就够了

作为一名热心肠的互联网老兵，我决定把宝贵的AI知识分享给大家。至于能学习到多少就看你的学习毅力和能力了。我已将重要的AI大模型资料包括AI大模型入门学习思维导图、精品AI大模型学习书籍手册、视频教程、实战学习等录播视频免费分享出来。

这份完整版的大模型 AI 学习资料已经上传CSDN，朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

一、全套AGI大模型学习路线

AI大模型时代的学习之旅：从基础到前沿，掌握人工智能的核心技能！

二、640套AI大模型报告合集

这套包含640份报告的合集，涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师，还是对AI大模型感兴趣的爱好者，这套报告合集都将为您提供宝贵的信息和启示。

三、AI大模型经典PDF籍

随着人工智能技术的飞速发展，AI大模型已经成为了当今科技领域的一大热点。这些大型预训练模型，如GPT-3、BERT、XLNet等，以其强大的语言理解和生成能力，正在改变我们对人工智能的认识。那以下这些PDF籍就是非常不错的学习资源。

四、AI大模型商业化落地方案

作为普通人，入局大模型时代需要持续学习和实践，不断提高自己的技能和认知水平，同时也需要有责任感和伦理意识，为人工智能的健康发展贡献力量。

本文来自互联网用户投稿，该文观点仅代表作者本人，不代表本站立场。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如若转载，请注明出处：http://www.rhkb.cn/news/448543.html

如若内容造成侵权/违法违规/事实不符，请联系长河编程网进行投诉反馈email:809451989@qq.com，一经查实，立即删除！

相关文章

鸿蒙OS启动流程

鸿蒙OS启动流程

启动流程(基于openharmony4.1) 系统上电加载内核后，按照以下流程完成系统各个服务和应用的启动： 内核加载init进程，一般在bootloader启动内核时通过设置内核的cmdline来指定init的位置。init进程启动后，会挂载tmpfs，…

阅读更多...

JavaSE——泛型

JavaSE——泛型

目录一、泛型的引入二、泛型的好处三、泛型介绍四、泛型的语法 (一)泛型的声明 (二)泛型的实例化五、泛型使用的注意事项和细节六、泛型练习题1 七、自定义泛型 (一)自定义泛型类 (二)自定义泛型接口 (三)自定义泛型方法八、泛型练习题2 九、泛型的继承和…

阅读更多...

moe2024新生赛--pwn篇

moe2024新生赛--pwn篇

moe2024新生赛–pwn篇也算是复健吧。。文章目录 moe2024新生赛--pwn篇**1 二进制漏洞审计入门指北**2 NotEnoughTime3 no_more_gets4 leak_sth5 ez_shellcode6 这是什么？libc7 这是什么？shellcode8 这是什么？random9 flag_helper10 这是什么…

阅读更多...

PCB缺陷检测数据集 xml 可转yolo格式，共10688张图片

PCB缺陷检测数据集 xml 可转yolo格式，共10688张图片

PCB缺陷检测数据集（yolov5,v7,v8） 数据集总共有两个文件夹，一个是pcb整体标注，一个是pcb部分截图。整体标注有6个分类，开路，短路等都已经标注，标注格式为xml，每个文件夹下有100多张…

阅读更多...

bp intruder 四种攻击类型记录

bp intruder 四种攻击类型记录

1. Sniper 攻击（狙击手模式） 特点： Sniper 攻击是最基础的一种攻击类型，适用于单参数的简单测试。它会逐一替换每一个 payload 插入点，其他位置保持不变，从而测试单个参数对应用的影响。工作流程&#…

阅读更多...

Java-IO流使用场景

Java-IO流使用场景

Java IO 流是Java编程中非常重要的组成部分，用于处理文件读写、网络通信等数据传输任务。 1. 字节流 1.1 读取文件 import java.io.FileInputStream; import java.io.IOException;public class ReadFileExample {public static void main(String[] args) {try (FileInputSt…

阅读更多...

不用搭建服务？MemFire Cloud让开发更简单

不用搭建服务？MemFire Cloud让开发更简单

不用搭建服务？MemFire Cloud让开发更简单在当今的开发世界里，想要开发一个功能齐全的应用，往往意味着需要搭建复杂的后端、开发API接口、处理认证授权、管理数据库……这些琐碎的工作让很多开发者头疼不已，尤其是独立开发者或者…

阅读更多...

成都睿明智科技有限公司电商服务可靠不？

成都睿明智科技有限公司电商服务可靠不？

在这个短视频风起云涌的时代，抖音不仅成为了人们娱乐消遣的首选平台，更是众多商家竞相追逐的电商新蓝海。成都睿明智科技有限公司，作为抖音电商服务领域的佼佼者，正以其独到的洞察力和专业的服务，助力无数品牌在这片沃…

阅读更多...

【进阶OpenCV】（16）-- 人脸识别 -- FisherFaces算法

【进阶OpenCV】（16）-- 人脸识别 -- FisherFaces算法

文章目录 FisherFaces算法一、算法原理二、算法优势与局限三、算法实现1. 图像预处理2. 创建FisherFace人脸特征识别器3. 训练模型4. 测试图像总结 FisherFaces算法 PCA方法是EigenFaces人脸识别的核心，但是其具有明显的缺点，在操作过程中会损失许多人…

阅读更多...

程序员如何使用AI工具进行设计开发？

程序员如何使用AI工具进行设计开发？

一、需求分析阶段自然语言处理辅助理解需求： 使用自然语言处理工具，如 ChatGPT 等，将复杂的业务需求描述转化为更清晰的技术要求。例如，向 AI 解释项目的背景和目标，让它帮助梳理关键需求点和可能的技术挑战。通过与…

阅读更多...

Docker下安装RabbitMQ

Docker下安装RabbitMQ

文章目录 Docker下安装RabbitMQ1. 下载Rabbitmq镜像2. 创建并运行RabbitMQ容器3. 查看启动情况4. 启动RabbitMQ访问的Web客户端4-1 方法一进入容器开启4-2 方法二直接开启5. 浏览器访问RabbitMQ的Web客户端页面6. Web客户端页面问题6-1 问题展示6-2 解决方案 Docker下安装Rab…

阅读更多...

机器学习笔记-2

机器学习笔记-2

文章目录一、Linear model二、How to represent this function三、Function with unknown parameter四、ReLU总结、A fancy name 一、Linear model 线性模型过于简单，有很大限制，我们需要更多复杂模式蓝色是线性模型，线性模型无法去表示…

阅读更多...

【自然语言处理】Encoder-Decoder模型中Attention机制的引入

【自然语言处理】Encoder-Decoder模型中Attention机制的引入

在 Encoder-Decoder 模型中引入 Attention 机制，是为了改善基本Seq2Seq模型的性能，特别是当处理长序列时，传统的Encoder-Decoder模型容易面临信息压缩的困难。Attention机制可以帮助模型动态地选择源序列中相关的信息，从而提高翻译…

阅读更多...

了解AI绘画扩散原理-更好掌握AI绘画工具

了解AI绘画扩散原理-更好掌握AI绘画工具

AI绘画正在成为一种热门的创作工具，壁纸、模特、真人转二次元、艺术字、二维码、设计图、老照片修复、高清修复等，越来越多的使用场景，AI绘画让没有美术基础的人也能够借助工具获得自己想要的美术图片。 AI绘画的核心是“生成模型”&#xf…

阅读更多...

插件分享｜沉浸式翻译

插件分享｜沉浸式翻译

在这个全球化的时代，语言不再是交流的障碍。但你是否曾经因为一篇外文网页、一份PDF文档或是一段视频字幕而苦恼不已？现在，一款名为“沉浸式翻译”的网页翻译插件，将彻底改变你的翻译体验！（文末附安装地址&…

阅读更多...

开源医疗大模型Llama3-Aloe-8B-Alpha，性能超越 MedAlpaca 和 PMC-LLaMA

开源医疗大模型Llama3-Aloe-8B-Alpha，性能超越 MedAlpaca 和 PMC-LLaMA

前言近年来，大型语言模型 (LLM) 在医疗领域展现出巨大潜力，能够帮助医生和研究人员更快地获取信息、分析数据，并提高医疗服务效率。然而，目前市场上大多数医疗 LLM 都是闭源模型，限制了其在学术研究和应用领域的推广…

阅读更多...

基于Arduino的仿生面具

基于Arduino的仿生面具

DIY 万圣节恐怖惊喜：自制动态眼动和声音感应的仿生面具引言万圣节即将来临，你是否准备好制作一些既诡异又迷人的装饰来增添节日气氛呢？今天，我们将一起探索如何使用3D打印、伺服电机、PIR传感器和DFPlayer MP3模块来制作一个动…

阅读更多...

【黑马redis高级篇】持久化

【黑马redis高级篇】持久化

//来源[01,05]分布式缓存除了黑马，还参考了别的。目录 1.单点redis问题及解决方案2.为什么需要持久化？3.Redis持久化有哪些方式呢？为什么我们需要重点学RDB和AOF？4.RDB4.1 定义4.2 触发方式4.2.1手动触发save4.2.2被动触发bgsa…

阅读更多...

STM32 ADC学习日记

STM32 ADC学习日记

STM32 ADC学习日记 1. ADC简介 ADC 即模拟数字转换器，英文详称 Analog-to-digital converter，可以将外部的模拟信号转换为数字信号。 STM32F103 系列芯片拥有 3 个 ADC（C8T6 只有 2 个），这些 ADC 可以独立使用&…

阅读更多...

《中国林业产业》是什么级别的期刊？是正规期刊吗？能评职称吗？

《中国林业产业》是什么级别的期刊？是正规期刊吗？能评职称吗？

问题解答问：《中国林业产业》是不是核心期刊？ 答：不是，是知网收录的正规学术期刊。问：《中国林业产业》级别？ 答：国家级。主管单位：国家林业和草原局 …

阅读更多...

最新文章

推荐文章