全部文章标签

大模型推理优化

从注意力架构、KV 缓存到量化与推测解码,追踪让大模型推理更快、显存更省的关键技术进展,帮你看懂每次提速背后的原理。

专题介绍

模型越来越大,推理成本成了真正的门槛。这个专题追踪注意力架构、KV 缓存优化、量化、推测解码、推理框架与部署调优等方向的实质进展:每次提速是怎么做到的、省了多少显存、代价是什么。适合关心模型落地成本与响应速度的开发者和产品团队。

Claude Opus 5.5 降价 40% 背后:缓存读取降价 60%,长会话编码场景最受益

Claude Opus 5.5 降价 40% 背后:缓存读取降价 60%,长会话编码场景最受益

AI资讯
AI导航 0 次阅读
Cursor 上线 Rollouts 与 Security Reviewer:PR 到生产交给机器人

Cursor 上线 Rollouts 与 Security Reviewer:PR 到生产交给机器人

AI资讯
AI导航 0 次阅读
Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 直降 40%

Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 直降 40%

AI资讯
AI导航 0 次阅读
小米 MiMo 团队公布 HySparse2:MiMo-V3 架构让 Agent 长上下文更快更省

小米 MiMo 团队公布 HySparse2:MiMo-V3 架构让 Agent 长上下文更快更省

AI资讯
AI导航 1 次阅读
Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp

AI资讯
AI导航 0 次阅读
DeepSeek-V4.1-Flash 发布:原生多模态进入新架构起点

DeepSeek-V4.1-Flash 发布:原生多模态进入新架构起点

AI资讯
AI导航 11 次阅读
DeepSeek 发布 DSpark 检查点,V4 推理最高提速 85%

DeepSeek 发布 DSpark 检查点,V4 推理最高提速 85%

AI资讯
AI导航 34 次阅读
llama.cpp发布b8234:本地大模型推理框架继续强化性能与部署适配

llama.cpp发布b8234:本地大模型推理框架继续强化性能与部署适配

AI资讯
AI导航 34 次阅读