思维链是大模型在给出最终答案之前,先把中间推理步骤一条条写出来的生成方式:遇到一道题,它不直接报结论,而是先列出已知条件、拆出计算或判断的先后顺序、逐步推导,最后才收束成答案。英文叫 Chain of Thought,常缩写为 CoT。你平时让 AI「一步一步想」或者打开某个产品的「深度思考」,看到它先刷出一长段分析再给结论,用的就是这条链。它解决的核心问题很具体:很多题不是模型不知道,而是需要好几步才能算对,一步到位时最容易在中间某一步翻车。
为什么先写步骤,正确率会变高
大模型是一个词一个词往外生成的,前面的文字会成为后面文字的依据。直接回答时,模型要在一次生成里同时完成理解题意、调用知识、计算和组织语言,任何一环出错,答案就整体崩掉。把步骤写出来,相当于把一道多步题拆成了若干道单步题:每一步只做一件小事,难度降下来了,而且已经写出的中间结果就摆在上下文里,后面的推导可以直接引用,不用在「脑子里」默记。
举个常见的例子:一个长方形周长 36 厘米,长比宽多 4 厘米,求面积。直接回答时模型很容易随口报一个数;先列方程就不一样了——设宽为 x,长为 x+4,2×(x+x+4)=36,解得 x=7,长 11,面积 77 平方厘米。每一步都能单独验算,哪一步错了也能一眼定位。对使用者来说这还有一个附带好处:过程可见,你不必盲目信任结论,可以只复核关键的那两步。
它是怎么来的:从一句提示到一类模型
思维链最早是一种提示技巧。2022 年,Google 研究团队的 Jason Wei 等人发表论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,发现只要在提问时给几个「带完整推理过程」的示例,大模型就会照着样子先推导再回答,数学和逻辑题的正确率明显提升。同年的另一项研究进一步发现,哪怕不给示例,只在问题后面加一句「让我们一步一步地思考」,也能触发类似效果。这就是为什么它最初和提示词工程绑得很紧:链是靠问法「哄」出来的。
后来发生的变化是,链被训练进了模型里。以 OpenAI 的 o 系列和 DeepSeek-R1 为代表的推理模型,通过强化学习学会了在回答前自发地生成很长的内部思考:尝试、发现走不通、回退、换一条路,用户看到的往往只是思考摘要和最终答案。这时思维链不再依赖你怎么写提示,而成了模型的工作方式,代价是厂商要为这段看不见的思考单独计费、单独限速。普通对话模型加提示词,和推理模型内化长思考,是同一条链的两种形态,前者轻便可控,后者更强也更贵。
三个最常见的误解
误解一:步骤写得清清楚楚,说明模型就是这么想的。 写出来的链同样是模型生成的一段文本,它可能忠实,也可能是先有了答案倾向、再补一段听起来合理的解释。已有研究专门讨论过这种「不忠实」现象:你删改链条里的某一步,答案有时并不跟着变。所以链条通顺只能说明表达通顺,不能当作结论可靠的证明,关键数字和关键判断仍要自己核一遍。
误解二:链越长,答案越准。 步骤每多一步,就多一个出错的位置,错误还会顺着链往下传,后面全建在错的地基上。简单问题上硬拉长思考也很常见副作用:本来直觉能答对的题,想得越多反而绕进去。现在不少产品给推理强度分档,就是为了让用户按题目难度控制链的长度。
误解三:什么任务都该开深度思考。 查一个事实、翻译一段话、润色一封邮件,答案不依赖多步推导,开长思考只会更慢、更贵,有时还会把简单的事复杂化。思维链的收益只出现在「错在中间步骤」的任务上,任务本身没有中间步骤,它就没有用武之地。
什么时候值得用,什么时候别用
判断标准就一条:这件事的难点是不是在中间步骤上。
- 值得用:多步计算和应用题、多条件取舍(比如在几个方案里按预算、时间、限制逐项排除)、代码排障(先定位再改)、长文档里的信息交叉核对、把一个大任务拆成可执行清单。
- 不必用:事实查询、翻译、摘要、改写润色、第一轮头脑风暴。这类任务要的要么是准确检索,要么是发散,长链帮不上忙。
- 用的时候注意两点:第一,要求模型先列条件和步骤、再给结论,并保留中间结果的具体数字,别只给「经过计算可得」;第二,拿到答案后只复核承重的那几步——比如方程列得对不对、关键假设有没有漏——比从头重算一遍划算得多。
它要付出的代价:Token、时间和上下文
思维链不是免费的。推理过程本身也是逐词生成的文字,按 Token 计量:在 API 计价里,推理模型生成的思考部分通常和正式回答一样收费,链越长,账单越高,等待也越久。用对话产品时还有一个隐性成本:长链会占住上下文窗口的位置,一次对话里堆了好几轮长篇推导,后面的对话能用的空间就被挤掉,这也是聊久了模型容易「忘事」的原因之一。所以合理的用法不是把思考拉满,而是按难度分配:简单问题秒回,难题才值得让它慢慢想。
把这条链看清楚,实际用法就很简单了:它是一种用时间和 Token 换正确率的交换,对多步问题划算,对一步问题浪费。下次再用 AI 解题或做决策时,先看这件事有没有真正的中间步骤,再决定要不要让它一步一步来。