全部文章标签

本地部署

数据不许出内网、云账单越跑越贵,就该考虑把模型搬回本地。llama.cpp、Ollama、GGUF 量化这些本地推理方案怎么搭、硬件怎么选,这里一次讲透。

专题介绍

本地部署不是把云端模型下载下来那么简单:显存、量化格式、推理框架,哪个环节没算对都会翻车。本专题讲清本地跑大模型与调云 API 的取舍,整理 llama.cpp、MLX、GGUF 等方案的实操要点,帮你在隐私、成本与效果之间找到平衡。

腾讯Hy翻译App今日上线:33种语言互译,语音拍照离线都能用

腾讯Hy翻译App今日上线:33种语言互译,语音拍照离线都能用

AI资讯
AI导航 2 次阅读
本地部署大模型是什么意思?和云 API 比有什么取舍

本地部署大模型是什么意思?和云 API 比有什么取舍

AI百科
AI导航 1 次阅读
Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

AI资讯
AI导航 0 次阅读
llama.cpp发布b8234:本地大模型推理框架继续强化性能与部署适配

llama.cpp发布b8234:本地大模型推理框架继续强化性能与部署适配

AI资讯
AI导航 34 次阅读
Qwen3 MLX 与 LLaMA3 MLX 性能对比:谁更适合本地推理?

Qwen3 MLX 与 LLaMA3 MLX 性能对比:谁更适合本地推理?

AI资讯
AI导航 132 次阅读
Google 开源 Gemma 3n 与 AI Edge 应用:端侧大模型正式登场

Google 开源 Gemma 3n 与 AI Edge 应用:端侧大模型正式登场

AI资讯
AI导航 635 次阅读