全部文章标签

模型量化

把模型权重从高精度换成低精度存储与计算,在尽量保住效果的前提下压小显存占用、加快推理速度,讲清 INT8、INT4、GGUF 与 AWQ 的取舍。

专题介绍

权重该用几比特存、哪些层最怕精度损失、校准数据怎么选,以及量化之后的速度和效果该怎么验,是理解模型量化绕不开的四件事。相关内容会把 GPTQ、AWQ、GGUF 这类常见方案放在本地部署和推理优化的真实约束下比较,帮你判断一个模型该不该量化、量化到哪一档,而不是只看文件小了多少。

混合专家模型是什么?总参数很大,为什么每次只算一小部分

混合专家模型是什么?总参数很大,为什么每次只算一小部分

AI百科
AI导航 1 次阅读
模型量化是什么意思?把大模型变小变快为什么不明显变笨

模型量化是什么意思?把大模型变小变快为什么不明显变笨

AI百科
AI导航 2 次阅读
本地部署大模型要什么电脑配置?显存、模型和隐私一次讲清

本地部署大模型要什么电脑配置?显存、模型和隐私一次讲清

AI问答
AI导航 11 次阅读
本地部署大模型是什么意思?和云 API 比有什么取舍

本地部署大模型是什么意思?和云 API 比有什么取舍

AI百科
AI导航 11 次阅读
Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

AI资讯
AI导航 9 次阅读