本地部署大模型,意思就是把大模型装在你自己的电脑或公司服务器上运行,而不是去调云端的 API。你平时用 ChatGPT、豆包、Kimi,提问发到人家的服务器上算完再返回;本地部署是反过来的:模型文件下载到本机,对话、文档、代码全在本地算,数据不经过任何第三方服务器。
值不值得折腾,看你是哪种情况。数据敏感的人最先想到它:病历、合同、没公开的代码库,不想让任何云服务商碰到,本地跑是最直接的办法。第二种是长期高频用:每天几千次调用,云端 API 的账单会越跑越贵,一次性配台机器反而划算。第三种是没网或弱网环境,本地模型断网照样能用。但反过来,如果你追的是最强推理能力,或者只是偶尔问两句,本地部署大概率是给自己找事,这一点后面细说。
和调云端 API 用起来到底差在哪
先把两者的真实差别摆出来,再决定要不要动手。
| 维度 | 本地部署 | 云端 API |
|---|---|---|
| 数据流向 | 不出本机/内网 | 发到服务商服务器 |
| 模型能力 | 开源模型,弱一档 | 前沿闭源模型,最强 |
| 成本 | 一次性硬件投入 + 电费 | 按调用量付费,用得多贵 |
| 运维 | 自己管:更新、排错、备份 | 服务商全包 |
| 断网 | 模型下好就能离线用 | 没网就用不了 |
核心取舍其实很简单:本地部署换的是数据控制权和长期成本,代价是模型能力和省心程度。想清楚你要的是哪一边,再往下看。
你的电脑能跑多大的模型
这是新手翻车最多的地方。模型能不能跑,不看 CPU 多强,看内存和显存够不够装下它。经过量化(后面解释)之后,有个粗算法:每 10 亿参数大约占 0.5GB 显存。
| 模型规模 | 需要显存/内存 | 常见可行硬件 |
|---|---|---|
| 7-8B | 约 8GB | 主流独显,16GB 内存的 Mac |
| 13-14B | 约 16GB | RTX 4070 级别,18GB 以上 Mac |
| 32B | 约 24GB | RTX 4090,36GB 以上 Mac |
| 70B | 约 40GB 以上 | 双卡、64GB 以上 Mac 或服务器卡 |
苹果芯片的 Mac 有个优势:内存是 CPU 和 GPU 共用的统一内存,所以一台 36GB 的 MacBook 能跑 32B 的模型,而同价位的 Windows 独显本可能只有 8GB 显存。反过来,纯 CPU 跑也不是不行,只是速度会慢到影响使用,只适合尝鲜。
一个实在的建议:第一次玩,先从 7-8B 档开始。硬件吃不消就换更小的,别一上来就拉 70B,下载几十个 GB 的文件最后跑不动,最打击积极性。
模型和工具:Ollama 一行命令就能上手
本地跑大模型,绕不开三个东西:模型、量化格式、运行工具。
模型选开源权重的:Qwen3 中文能力强,Apache 2.0 协议;DeepSeek-R1 推理见长;Gemma 3 轻量,对低配机器友好;Llama 系列生态最成熟。注意看许可协议,Apache 2.0、MIT 这类允许商用,个别模型有自己的使用条款,商用前要确认。
量化是把模型"压小"的技术。原始模型动辄几十上百 GB,量化成 GGUF 格式的 Q4 版本后体积缩小到原来的四分之一左右,精度损失对日常问答几乎无感。Ollama 下载的默认就是量化好的版本,你不用自己动手压。
工具按水平选:新手直接装 Ollama,一行命令就行:
ollama run qwen3:8b
第一次执行会自动下载模型,下完直接进对话,输入 /bye 退出。不想碰命令行就用 LM Studio,有图形界面,点几下鼠标。Ollama 自带兼容 OpenAI 的本地 API(http://localhost:11434),你自己的程序也能接。如果是公司多人用、要接生产流量,Ollama 的并发能力不够,得换 vLLM 这类生产级推理框架,这是另一档的事。
隐私这件事,本地部署保得了什么、保不住什么
很多人把"本地部署"等同于"绝对安全",这个要掰开看。
保得住的是:你的提问内容、上传的文档,确实不会再发到某个云服务商的服务器上。对医疗、法律、研发这类敏感场景,这是实打实的价值。
保不住的有三样。第一,你用的客户端或插件可能自己联网:模型在本地跑,不代表你装的那个聊天软件不上传日志,装之前看清它的网络权限。第二,模型文件来源要可靠,只从 Ollama 官方库、Hugging Face 等可信渠道下,来路不明的权重文件有被植入恶意的风险。第三,合规不等于"放本地就自动合规":等保、数据出境评估这些要求,该走的流程一样要走,部署位置只是其中一环。
说到底,本地部署是"数据不出内网"的必要条件,不是充分条件。隐私这件事,部署方式只解决了一半。
哪些情况其实不适合本地部署
最后说点劝退的,帮你省钱省时间。
第一,数据本来就可以出域。如果你处理的是公开资料、日常写作、学英语,云端 API 在能力、稳定性和单次成本上都更优,本地模型能力弱一档,显卡、运维、模型更新的成本全得自己扛,别为了"感觉更可控"而本地化。
第二,任务需要前沿档的推理能力。8B 级本地模型做分类、摘要、翻译够用,做复杂数学、多步推理、长文档分析会明显掉链子。检验方法很直接:拿你最难的三个真实任务,在本地模型上实测一遍,别只看跑分。
第三,并发量上来了。Ollama 适合一个人用,多人共享或接业务流量时,不上 vLLM 这类带批处理的框架,吞吐会差很多,显存也浪费。这一步不是优化,是能不能用的分界线。
想清楚这三条,再决定是装 Ollama 还是继续用云端 API。工具没有高低,只有合不合适。
常见问题
Q:模型下载完,断网还能用吗?
A:可以。联网只在第一次下载模型文件时需要,之后 Ollama、LM Studio 都能完全离线运行,这也是很多人选本地部署的原因之一。
Q:本地部署的模型能联网搜索吗?
A:默认不能。本地模型只知道训练时的数据,不会自动查最新信息。想让它联网查资料,得自己接搜索工具或搭 RAG,不是开箱即用的功能。