AI导航

思维链是什么意思?为什么先写步骤反而更容易答对

AI百科
4 min read
1 次阅读

思维链是大模型在给出最终答案之前,先把中间推理步骤一条条写出来的生成方式:遇到一道题,它不直接报结论,而是先列出已知条件、拆出计算或判断的先后顺序、逐步推导,最后才收束成答案。英文叫 Chain of Thought,常缩写为 CoT。你平时让 AI「一步一步想」或者打开某个产品的「深度思考」,看到它先刷出一长段分析再给结论,用的就是这条链。它解决的核心问题很具体:很多题不是模型不知道,而是需要好几步才能算对,一步到位时最容易在中间某一步翻车。

为什么先写步骤,正确率会变高

大模型是一个词一个词往外生成的,前面的文字会成为后面文字的依据。直接回答时,模型要在一次生成里同时完成理解题意、调用知识、计算和组织语言,任何一环出错,答案就整体崩掉。把步骤写出来,相当于把一道多步题拆成了若干道单步题:每一步只做一件小事,难度降下来了,而且已经写出的中间结果就摆在上下文里,后面的推导可以直接引用,不用在「脑子里」默记。

举个常见的例子:一个长方形周长 36 厘米,长比宽多 4 厘米,求面积。直接回答时模型很容易随口报一个数;先列方程就不一样了——设宽为 x,长为 x+4,2×(x+x+4)=36,解得 x=7,长 11,面积 77 平方厘米。每一步都能单独验算,哪一步错了也能一眼定位。对使用者来说这还有一个附带好处:过程可见,你不必盲目信任结论,可以只复核关键的那两步。

它是怎么来的:从一句提示到一类模型

思维链最早是一种提示技巧。2022 年,Google 研究团队的 Jason Wei 等人发表论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》,发现只要在提问时给几个「带完整推理过程」的示例,大模型就会照着样子先推导再回答,数学和逻辑题的正确率明显提升。同年的另一项研究进一步发现,哪怕不给示例,只在问题后面加一句「让我们一步一步地思考」,也能触发类似效果。这就是为什么它最初和提示词工程绑得很紧:链是靠问法「哄」出来的。

后来发生的变化是,链被训练进了模型里。以 OpenAI 的 o 系列和 DeepSeek-R1 为代表的推理模型,通过强化学习学会了在回答前自发地生成很长的内部思考:尝试、发现走不通、回退、换一条路,用户看到的往往只是思考摘要和最终答案。这时思维链不再依赖你怎么写提示,而成了模型的工作方式,代价是厂商要为这段看不见的思考单独计费、单独限速。普通对话模型加提示词,和推理模型内化长思考,是同一条链的两种形态,前者轻便可控,后者更强也更贵。

三个最常见的误解

误解一:步骤写得清清楚楚,说明模型就是这么想的。 写出来的链同样是模型生成的一段文本,它可能忠实,也可能是先有了答案倾向、再补一段听起来合理的解释。已有研究专门讨论过这种「不忠实」现象:你删改链条里的某一步,答案有时并不跟着变。所以链条通顺只能说明表达通顺,不能当作结论可靠的证明,关键数字和关键判断仍要自己核一遍。

误解二:链越长,答案越准。 步骤每多一步,就多一个出错的位置,错误还会顺着链往下传,后面全建在错的地基上。简单问题上硬拉长思考也很常见副作用:本来直觉能答对的题,想得越多反而绕进去。现在不少产品给推理强度分档,就是为了让用户按题目难度控制链的长度。

误解三:什么任务都该开深度思考。 查一个事实、翻译一段话、润色一封邮件,答案不依赖多步推导,开长思考只会更慢、更贵,有时还会把简单的事复杂化。思维链的收益只出现在「错在中间步骤」的任务上,任务本身没有中间步骤,它就没有用武之地。

什么时候值得用,什么时候别用

判断标准就一条:这件事的难点是不是在中间步骤上。

  • 值得用:多步计算和应用题、多条件取舍(比如在几个方案里按预算、时间、限制逐项排除)、代码排障(先定位再改)、长文档里的信息交叉核对、把一个大任务拆成可执行清单。
  • 不必用:事实查询、翻译、摘要、改写润色、第一轮头脑风暴。这类任务要的要么是准确检索,要么是发散,长链帮不上忙。
  • 用的时候注意两点:第一,要求模型先列条件和步骤、再给结论,并保留中间结果的具体数字,别只给「经过计算可得」;第二,拿到答案后只复核承重的那几步——比如方程列得对不对、关键假设有没有漏——比从头重算一遍划算得多。

它要付出的代价:Token、时间和上下文

思维链不是免费的。推理过程本身也是逐词生成的文字,按 Token 计量:在 API 计价里,推理模型生成的思考部分通常和正式回答一样收费,链越长,账单越高,等待也越久。用对话产品时还有一个隐性成本:长链会占住上下文窗口的位置,一次对话里堆了好几轮长篇推导,后面的对话能用的空间就被挤掉,这也是聊久了模型容易「忘事」的原因之一。所以合理的用法不是把思考拉满,而是按难度分配:简单问题秒回,难题才值得让它慢慢想。

把这条链看清楚,实际用法就很简单了:它是一种用时间和 Token 换正确率的交换,对多步问题划算,对一步问题浪费。下次再用 AI 解题或做决策时,先看这件事有没有真正的中间步骤,再决定要不要让它一步一步来。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。