全部文章标签

混合专家模型

混合专家模型(MoE)把每个 Token 只交给少数专家处理,重点讲清总参数与激活参数的区别、路由方式,以及它与稠密模型的取舍。

专题介绍

混合专家模型是一种稀疏激活的模型架构:同一层准备多组专家网络,每个 Token 只被路由器分给其中少数几个处理。相关文章会拆解它的工作原理、总参数与激活参数的区别、负载均衡等训练难点,并结合 Mixtral、DeepSeek 等代表模型说明这种架构的收益与边界。

Mellum2.1 开源发布:架构没变,JetBrains 靠强化学习练出仓库级编程能力

Mellum2.1 开源发布:架构没变,JetBrains 靠强化学习练出仓库级编程能力

AI资讯
AI导航 2 次阅读
混合专家模型是什么?总参数很大,为什么每次只算一小部分

混合专家模型是什么?总参数很大,为什么每次只算一小部分

AI百科
AI导航 1 次阅读