您当前的位置：首页 > 电脑百科 > 人工智能

深度揭秘爆火MoE！GPT-4关键架构，成开源模型逆袭杀手锏

时间：2023-12-11 13:06:24 来源：新智元作者：

+ 加入收藏

Mistral上周末丢出的磁力链接震惊了开源圈子，这个7B×8E的开源MoE大模型性能已经到达了LLaMA2 70B的级别！

而根据Jim Fan猜测，如果Mistral内部训练了34B×8E或者甚至100B+×8E级别的模型，那他们的能力很有可能已经无限接近GPT-4了。

而在之前对于GPT-4结构的曝料中，大部分的信息也指向GPT-4很可能是由8个或者是16个MoE构成。

为什么MoE能成为高性能大模型的必选项？

简单来说，MoE是一种神经网络架构设计，在Transformer模块中集成了专家/模型层。

当数据流经MoE层时，每个输入token都会动态路由到专家子模型进行处理。当每个专家专门从事特定任务时，这种方法可以实现更高效的计算并获得更好的结果。

MoE最关键的组件：

- 专家（Expert）：MoE层由许多专家、小型MLP或复杂的LLM（如 Mistral 7B）组成。

- 路由器（Router）：路由器确定将哪些输入token分配给哪些专家。

路由策略有两种：token选择路由器或路由器选择token。

路由器使用softmax门控函数通过专家或token对概率分布进行建模，并选择前k个。

MoE能够带来的好处：

- 每个专家都可以专门处理不同的任务或数据的不同部分。

- MoE构架能向LLM添加可学习参数，而不增加推理成本。

- 可以利用稀疏矩阵的高效计算

- 并行计算所有专家层，以有效利用GPU的并行能力

- 帮助有效地扩展模型并减少训练时间。以更低的计算成本获得更好的结果！

MoE：建立高效大模型的关键技术

大型语言模型（LLM）席卷了机器学习领域，而随着现代数据集的复杂性和规模的增加，每个数据集都包含不同的模式，特征和标注之间的关系截然不同。

——这时，就需要MoE出手了。

专家混合（MoE）就像神经网络世界中的一种团队合作技术。

想象一下，将一项大任务分解成更小的部分，并让不同的专家处理每个部分。然后，有一个聪明的法官会根据情况，决定遵循哪位专家的建议，所有这些建议都混合在一起。

——就像你利用不同的口味，组合成一道好吃的菜。

对于复杂的数据集，可以划分为局部子集（local subsets），同样，将需要预测的问题划分为子任务（采用领域知识或者无监督聚类算法）。

然后，针对每个数据子集训练专家模型（Expert Models），专家模型可以是任何模型，比如支持向量机（SVM）或者神经网络，每个专家模型接收相同的输入模式并进行预测。

MoE还包含门控模型（Gating Model），用于解释每个专家做出的预测，并根据输入选择信任哪个专家。

最后，MoE需要一种聚合机制（Pooling Method），根据门控模型和专家的输出进行预测。

在现实的应用中，研究人员提出一种称为「稀疏门控专家混合层」的方法，作为原始MoE的迭代，这个方法提供了一个通用的神经网络组件，可以适应不同类型的任务。

稀疏门控专家混合层（Sparsely-Gated Mixture-of-Experts Layer）由许多专家网络组成，每个专家网络都是一个简单的前馈神经网络和一个可训练的门控网络。门控网络负责选择这些专家的稀疏组合来处理每个输入。

这里的重点是在门控功能中使用稀疏性，——这意味着对于每个输入实例，门控网络只选择少数专家进行处理，其余的专家保持非活动状态。

这种稀疏性和专家选择是针对每个输入动态实现的，整个过程具有高度的灵活性和适应性，而由于不需要处理网络的非活动部分，计算效率大大提高。

——简单来说就是，算得快、消耗少、省钱。

MoE层可以分层堆叠，其中主MoE选择稀疏加权的「专家」组合。每个组合都使用一个MoE图层。

此外，研究人员还提出了一种名为「Noisy Top-K Gating」的创新技术。

这种机制在门控函数中增加了一个可调的高斯噪声，只保留前K个值，并将其余值分配给负无穷大，从而转换为零门控值。

这种方法确保了门控网络的稀疏性，同时保持了对门控函数输出中潜在不连续性的鲁棒性。另外，它还有助于跨专家网络进行负载平衡。

MoE和Transformer

下面我们来看一下MoE在Transformer ，也就是当下大火的大语言模型中发挥了怎样的作用。

MoE作为一种神经网络架构设计，可以集成进Transformer的结构中。

当数据流经MoE层时，每个输入（tokens）都会动态路由到某个专家模型进行计算，这样每个专家都可以专注于特定的任务，更好、更高效地给出结果。

上图展示了具有MoE层的Transformer编码器的演化（对于解码器的修改也类似），MoE层取代了Transformer的前馈层。

上图左边是标准Transformer模型的编码器，包括自注意力层和前馈层，交错着残差连接和归一化层。

中间部分通过用MoE层替换其他前馈层，得到了MoE Transformer Encoder的模型结构。

上图右侧是当模型扩展到多个设备时的情况，MoE层将跨设备分片，而所有其他层都会被复制。

我们可以看到MoE的关键组件就是各种专家模型和路由模块。

专家模型也可以是小型MLP，或者复杂的LLM，如Mistral 7B。

而路由模块用来确定将哪些输入tokens分配给哪些专家。

一般有两种路由策略：token选择路由器，或路由器选择token。这里使用softmax门控函数，通过专家模型或者tokens，对概率分布进行建模，并选择top k。

由此，我们可知MoE层在Transformer中发挥了重要的作用。

每个专家都可以专门处理不同的任务或数据的不同部分；使用MoE可以在不增加推理成本的情况下向LLM添加可学习参数；

此外，MoE还有助于对稀疏矩阵进行高效计算；而MoE中的专家层可以并行计算，这样就有效利用了GPU的并行能力。

最后，MoE在帮助减少训练时间的同时，还可以做到有效地扩展模型，以更低的计算成本获得更好的结果。

MoE开源再受关注

在Mistral放出这个开源的7B×8E的MoE之前，英伟达和谷歌也放出过其他完全开源的MoE。

曾在英伟达实习的新加坡国立大学博士生Fuzhao Xue表示，他们的团队在4个月前也开源了一个80亿参数的MoE模型。

项目地址：https://Github.com/XueFuzhao/OpenMoE

数据来源

- 一半来自The RedPajama，另一半来自The Stack Dedup

- 为提升模型的推理能力，采用了大量的编程相关数据

模型架构

- OpenMoE模型基于「ST-MoE」，但采用了decoder-only架构。

其它设计

- 采用umT5 tokenizer

- 使用RoPE技术

- 采用SwiGLU激活函数

- 设定2000 token的上下文长度

BigBench评估

团队在BigBench-Lite上进行了少样本测试，其中包括与BIG-G、BIG-G-Sparse以及GPT-3的对比。

通过计算每个词元激活的参数数量和训练词元的数量来大致估计相对成本。图中每个点的大小代表了相应词元激活的参数数量。特别需要指出的是，浅灰色的点表示MoE模型的总参数量。

对此，Jim Fan也表示，MoE并不新鲜，它只是没有得到那么多关注而已......

比如，谷歌很早之前就开源了基于T5的MoE模型——Switch Transformer。

面临的挑战和机遇

MoE基础设施建设

由于MoE拥有大量可训练参数，理想的软件环境应该支持灵活组合的专家级、张量级、流水线级和数据并行，无论是节点内还是节点间。

此外，如果能支持简单快速的激活卸载和权重量化，从而减轻MoE权重的内存占用，就更好了。

MoE指令微调

FLAN-MoE研究提出：尽管将MoE的性能通过特定任务的微调转移到下游任务上存在挑战，但指令微调却能有效地与MoE模型协调一致。这展示了基于MoE的语言模型巨大的潜力。

MoE 评估

MoE模型的归纳偏置（Inductive bias）可能在困惑度（perplexity）之外还有其他效果，就像其他自适应模型（如Universal Transformer和AdaTape）那样。

硬件挑战

值得一提的是，GPU在跨节点通信方面面临挑战，因为每个节点通常只能配备有限数量的GPU。这使得专家并行中，通信成为瓶颈。

幸运的是，NVIDIA最近推出了DGX GH200，将256个NVIDIA Grace Hopper Superchips集成到一个单一GPU中，很大程度上解决了通信带宽问题，为开源领域的MoE模型的训练和部署提供了帮助。

Tags：GPT-4 点击:() 评论:()

声明：本站部分内容及图片来自互联网,转载是出于传递更多信息之目的,内容观点仅代表作者本人,不构成投资建议。投资者据此操作，风险自担。如有任何标注错误或版权侵犯请与我们联系，我们将及时更正、删除。

▌相关推荐

报告称 OpenAI 采集了超一百万小时的 YouTube 视频来训练 GPT-4

IT之家 4 月 7 日消息，本周早些时候，《华尔街日报》报道称 AI 公司在收集高质量训练数据方面遇到了困难。今天，《纽约时报》详细介绍了 AI 公司处理此问题的一些方法，其中涉及到...【详细内容】

2024-04-07　　Search: GPT-4 点击:(4)　　评论:(0)　　加入收藏

微软AI程序员登场，10倍AI工程师真来了？996自主生成代码，性能超GPT-4 30%

新智元报道编辑：桃子润【新智元导读】全球首个AI程序员Devin诞生之后，让码农纷纷恐慌。没想到，微软同时也整出了一个AI程序员——AutoDev，能够自主生成、执行代码等...【详细内容】

2024-03-18　　Search: GPT-4 点击:(15)　　评论:(0)　　加入收藏

前端不存在了？盲测64%的人更喜欢GPT-4V的设计，杨笛一等团队新作

3 月 9 日央视的一档节目上，百度创始人、董事长兼 CEO 李彦宏指出，以后不会存在「程序员」这种职业了，因为只要会说话，人人都会具备程序员的能力。「未来的编程语言只会剩下两种...【详细内容】

2024-03-11　　Search: GPT-4 点击:(9)　　评论:(0)　　加入收藏

多模态大模型，阿里通义千问能和GPT-4V掰手腕了

通义千问的图像推理能力，最近有了大幅提升。2024 年，大模型领域要卷什么？如果没有思路的话，不妨看看各家大厂都在押注什么方向。最近一段时间，先是 OpenAI 推出 GPT-4V，让大模型...【详细内容】

2024-01-29　　Search: GPT-4 点击:(69)　　评论:(0)　　加入收藏

微软Copilot Pro来了：个人用户也能在Word里用GPT-4，20美元/月

面向个人用户的微软Copilot会员版来了。一个月多交20刀（约合人民币142元），Microsoft 365个人版/家庭版用户就能在Word、Excel、PPT等Office全家桶中用上GPT-4。就像这样，不用在C...【详细内容】

2024-01-16　　Search: GPT-4 点击:(89)　　评论:(0)　　加入收藏

“GPT-4变傻”不只是OpenAI的苦恼，所有大模型与人类交往越久就会越蠢？

　许多大模型在处理早期数据时展现出的优异表现，实际上是受到了‘任务污染’的影响，回答问题全靠记，而非纯粹基于学习理解能力。　　ChatGPT发布一年多，已经在全世界...【详细内容】

2024-01-05　　Search: GPT-4 点击:(48)　　评论:(0)　　加入收藏

GPT-4V开源平替！清华浙大领衔，LLaVA等开源视觉模型大爆发

新智元报道编辑：Aeneas【新智元导读】GPT-4V的开源替代方案来了！极低成本，性能却类似，清华、浙大等中国顶尖学府，为我们提供了性能优异的GPT-4V开源平替。如今，GPT-4 Vision在语言...【详细内容】

2024-01-03　　Search: GPT-4 点击:(53)　　评论:(0)　　加入收藏

谷歌Gemini扳回一局！多模态能力和GPT-4V不分伯仲｜港中文128页全面测评报告

量子位 | 公众号 QbitAI谷歌扳回一局！在Gemini开放API不到一周的时间，港中文等机构就完成评测，联合发布了多达128页的报告，结果显示：在37个视觉理解任务上，Gemini-Pro表现出了和GP...【详细内容】

2023-12-22　　Search: GPT-4 点击:(117)　　评论:(0)　　加入收藏

GPT-4V 都搞不明白的未来推理有解法了！来自华科大 & 上科大

多模态大语言模型展现了强大的图像理解和推理能力。但要让它们基于当前观测来对未来事件进行预测推理仍然非常困难。即便是当前最强大的 GPT-4V（如下图所示），也无法很好地解决...【详细内容】

2023-12-18　　Search: GPT-4 点击:(58)　　评论:(0)　　加入收藏

OpenAI 宣布修复GPT-4变懒问题，将在离线评估及AB测试后更新模型

IT之家 12 月 11 日消息，OpenAI 在上周遭到部分用户投诉，许多用户声称，他们在使用 ChatGPT 或 GPT-4 API 时，会遇到回应速度慢、敷衍回答、拒绝回答、中断会话等一系列问题，OpenA...【详细内容】

2023-12-12　　Search: GPT-4 点击:(50)　　评论:(0)　　加入收藏

▌简易百科推荐

多方热议人工智能产业新机遇

编者按&emsp;&emsp;从前沿科技展会到高层对话平台，从上海、重庆到博鳌，从线上到线下……一场场高规格、大规模的盛会中，人工智能正在成为各界热议的高频词。赋能千...【详细内容】

2024-04-08　　　　中国家电网　　Tags:人工智能　点击:(4)　　评论:(0)　　加入收藏

人形机器人时代来了吗

日前，由中国人形机器人(11.080, -0.05, -0.45%)百人会主办的人形机器人大赛在北京经济技术开发区开赛。工作人员向参观者展示一款人形机器人。参观者与一款陪护型人形机器人...【详细内容】

2024-04-08　　　　中国青年报　　Tags:人形机器人　点击:(4)　　评论:(0)　　加入收藏

AI重塑社交：腾讯与字节跳动的新赛场

文|新火种一号编辑|美美最近，腾讯和字节跳动这两大互联网巨头几乎同步推出了各自的AI社交产品，尽管腾讯和字节跳动在前段时间刚刚“破冰”，但这一举措不仅意味着这两大巨头之...【详细内容】

2024-04-07　　　　蓝鲸财经　　Tags:AI 　点击:(7)　　评论:(0)　　加入收藏

第一批用 Kimi 做内容的网红已经杀疯了

作者：王东东文章来自：斗战圣佛小组技术信仰派 VS 市场信仰派朱啸虎和月之暗面老板杨植麟在前几天有一场不算 battle 的 battle。battle 的争论点是：大模型有没有戏。技术派...【详细内容】

2024-04-04　　　　斗战圣佛小组　　Tags:Kimi 　点击:(4)　　评论:(0)　　加入收藏

昆仑万维发布面向人工智能时代的六条人才宣言

过去的一年多，是人工智能取得非凡进步的一年。在这充满突破性技术飞跃和备受争议的一年里，我们见证了人工智能的快速发展和广泛的影响，人工智能已经迅速地融入了我们的生活，深刻...【详细内容】

2024-04-03　　　　砍柴网　　Tags:昆仑万维　点击:(7)　　评论:(0)　　加入收藏

AI干掉声优？音频大模型追逐“图灵时刻”

七十年前，“人工智能之父”图灵提出，如果人无法判断屏幕的另一侧究竟是人还是机器，就证明机器具备了人一样的智能。这一经典的图灵测试如同北斗星一般，指引着AI行业的工作者们不...【详细内容】

2024-04-03　　　　第一财经网　　Tags:AI 　点击:(5)　　评论:(0)　　加入收藏

生成式人工智能有哪些新趋势？

相较于去年，当下我们所能体验的人工智能技术的范围已经大幅提升。从搜索引擎、电商平台再到社媒平台，只要是以搜索结果为导向的内容，都会出现它的身影。但其实，人工智能的应用场...【详细内容】

2024-04-03　　品谈教师帮　　　　Tags:人工智能　点击:(6)　　评论:(0)　　加入收藏

AI世界的新难题：互联网的信息不够用了！

高质量数据的紧缺正成为AI发展的重要障碍。4月1日，据媒体报道，随着OpenAI、Google等企业不断深入发展AI技术，科技巨头们遇到了一个新问题：现有的互联网信息量可能不足以支撑他们...【详细内容】

2024-04-02　　硬AI　　　　Tags:AI 　点击:(6)　　评论:(0)　　加入收藏

今天起，ChatGPT无需注册就能用了！

　来源：量子位　　　　金磊克雷西发自凹非寺　　就在刚刚，OpenAI狠狠地open了一把：从今天起，ChatGPT打开即用，无需再注册帐号和登录了！　　像这样，直接登录网站，然后就可以开启对...【详细内容】

2024-04-02　　　　量子位　　　Tags:ChatGPT 　点击:(7)　　评论:(0)　　加入收藏

AI时代，面对死亡有了第二种选择？

今年春节期间，罗佩玺瞒着妈妈用AI技术“复活”了外婆，她将妈妈现在的模样和外婆留下的老照片合成在一起。时隔60多年，妈妈和外婆终于又“见面”了，这是她送给妈妈的生日礼物。收...【详细内容】

2024-04-02　　　　中国青年报　　Tags:AI时代　点击:(7)　　评论:(0)　　加入收藏

推荐资讯

访问网站显示不安全是	掌握独立站SEO策略，提
快手蓝色小钥匙跳转微	微信朋友圈如何置顶
Facebook新用户扩展怎	详解微信里面的分期可
微信表情包更新：原创设	微信朋友圈功能大改版

站内最新

栏目相关

· 多方热议人工智能产业新机遇

· 人形机器人时代来了吗

· AI重塑社交：腾讯与字节跳动的新赛场

· 第一批用 Kimi 做内容的网红已经杀疯了

· 昆仑万维发布面向人工智能时代的六条人才宣言

· AI干掉声优？音频大模型追逐“图灵时刻”

· 生成式人工智能有哪些新趋势？

· AI世界的新难题：互联网的信息不够用了！

· 今天起，ChatGPT无需注册就能用了！

· AI时代，面对死亡有了第二种选择？

· 影视业AI应用如何超乎想象？

· 当AI会作词作曲唱歌，音乐人何去何从

· 大模型Kimi火了，长文本“卷”出新高度

· 把GPT变成算命大师需要几步？

· Sora开启文生视频新纪元影视游戏产业加速变局求突破

· 微软新 AI 专利获批：帮老板追踪、评估你的工作表现

· 关于AI人工智能在写作方面有哪些优势？

· Sora超逼真视频引恐慌！Nature刊文警示AI视频模型，或在2024年颠覆科学和社会

· 8款AI视频生成产品实测，谁将成为中国Sora？

· Sora到底怎么样？第一批试用者这样说！

站内热门