AI导航

Transformer 是什么?主流大模型都在用的核心架构

AI百科
4 min read
1 次阅读

Transformer 是 2017 年 Google 在论文《Attention Is All You Need》中提出的一种神经网络架构,也是今天几乎所有大语言模型的底层骨架——GPT、Claude、Gemini、Llama、DeepSeek 这些名字你都听过,它们内部跑的都是 Transformer,或者它的变体。它的核心突破可以用一句话概括:不再让机器一个词一个词地顺序读书,而是让它一眼看到整句话,自己判断每个词该关注哪里。

要理解为什么这事重要,先想想"银行"这个词。"我在银行门口等你"和"我去银行存了笔钱",同一个词意思完全不同。机器要怎么知道"银行"在这里指什么?只能看它周围的词。Transformer 做的就是这件事:让句子里的每个词都去"打量"其他词,搞清楚自己在当前语境下的真实含义。这种能力,就是大模型理解上下文的根基。

自注意力:每个词都在给自己找语境

看这句话:"小猫坐在垫子上,因为它很柔软。"人一眼就知道"它"指的是垫子。但对机器来说,"它"可以是小猫,也可以是垫子,怎么选?

Transformer 的处理方式是给每个词发三张"名片":查询(Query,我想找什么样的信息)、键(Key,我是什么样的词)、值(Value,我实际携带的内容)。然后让"它"的查询去和全句每个词的键做匹配,算出亲疏远近:和"垫子"的匹配度高,和"小猫"的匹配度低。最后按这个亲疏程度,把各词的值加权混合——"它"的向量里就混入了大量"垫子"的信息,机器于是"知道"了它指代谁。

这个过程叫自注意力(Self-Attention)。更妙的是"多头":模型会同时派出好几组查询,有的盯语法关系,有的盯指代关系,有的盯情感色彩,多个视角的结果拼在一起,就是对这句话相当完整的理解。

编码器和解码器:同一架构,两种活法

最初的 Transformer 像一条翻译流水线:编码器负责"读懂"输入,解码器负责"写出"输出。后来人们发现可以拆开用,于是分出两条路线。

只用编码器的代表是 BERT 一家:它们擅长理解——文本分类、情感分析、搜索排序,把文字变成向量表示后做判断,但不擅长长篇生成。只用解码器的代表是 GPT 一家:它们擅长生成——一个词一个词往外续写,聊天、写作、代码都靠它。今天你用的聊天大模型,清一色是解码器路线。

和 RNN、CNN 比,它赢在哪

Transformer 之前,主流是 RNN(循环神经网络)和 CNN(卷积神经网络)。RNN 的问题是必须一个词一个词顺序读:读到第 100 个词时,第 1 个词的信息已经传丢得差不多了,而且这种串行方式没法并行训练,数据再多也吃不下。CNN 擅长抓局部特征,但句子开头和结尾的远距离关系,它看不见。

Transformer 的解法是让任意两个词之间都"一步直达",没有信息传递的链条损耗;同时整个句子可以一次性并行计算。这两个特性加在一起,意味着它能吃下互联网级别的海量文本,而且模型越大效果越好——这正是大模型"大力出奇迹"的技术前提。

三个常见误解

误解一:Transformer 就是大模型。不是。Transformer 是架构,是骨架;模型是训练出来的具体成品。同一个骨架,参数规模、训练数据、调优方法不同,做出来的模型能力天差地别。把架构和模型混为一谈,就像把"砖混结构"和"一栋楼"混为一谈。

误解二:用了 Transformer 就一定聪明。不是。架构只是起点,数据质量、训练方法和对齐调优至少同等重要。一个用劣质数据训练的 Transformer 模型,照样满口胡话。架构决定上限的形状,训练决定能不能摸到上限。

误解三:Transformer 是终点。不是。它是 2017 年的设计,计算量随序列长度平方增长——这就是为什么上下文窗口有上限、长文本又贵又慢。Mamba、RWKV 这些新架构在长序列效率上各有优势,混合专家(MoE)则是在 Transformer 骨架上做扩展。今天它是主流,不代表十年后还是。

它用在哪:远不止聊天机器人

大语言模型是最出名的应用,但 Transformer 早已跨界:视觉领域的 ViT 把图片切成小块当"词"来处理;多模态模型用同一套机制对齐文字、图像和声音;扩散生图模型里也有注意力模块在协调画面各部分的关系;语音识别、代码生成,乃至预测蛋白质结构的 AlphaFold2,核心里都有注意力的影子。可以说,哪里需要处理"序列中元素之间的关系",哪里就有 Transformer 的变体。

普通人最该记住的三件事

第一,大模型是"续写"机器。它一次生成一个词,每个词都是根据前文概率最高的延续,不是在"思考"对错。这解释了它为什么文笔流畅,却可能一本正经地编造事实。

第二,上下文窗口是它的"工作记忆"。窗口之外的信息它看不见,窗口越大推理越慢越贵。给它超长文档时,关键信息放前面、结构清晰,比一股脑全塞进去更有效。

第三,它擅长的是语言模式,不是事实核查。架构本身不保证真实性,重要信息——尤其是数字、日期、人名——养成自己再核实一遍的习惯。

把这三条记住,你对大模型的理解就已经超过了大多数只把它当"更聪明的搜索引擎"的人。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。