大模型推理优化
从注意力架构、KV 缓存到量化与推测解码,追踪让大模型推理更快、显存更省的关键技术进展,帮你看懂每次提速背后的原理。
专题介绍
模型越来越大,推理成本成了真正的门槛。这个专题追踪注意力架构、KV 缓存优化、量化、推测解码、推理框架与部署调优等方向的实质进展:每次提速是怎么做到的、省了多少显存、代价是什么。适合关心模型落地成本与响应速度的开发者和产品团队。
Claude Opus 5.5 降价 40% 背后:缓存读取降价 60%,长会话编码场景最受益
AI资讯 AI导航 0 次阅读
Cursor 上线 Rollouts 与 Security Reviewer:PR 到生产交给机器人
AI资讯 AI导航 0 次阅读
Fireworks 发布 Ember-1:基于 Kimi K3,推理 token 直降 40%
AI资讯 AI导航 0 次阅读
小米 MiMo 团队公布 HySparse2:MiMo-V3 架构让 Agent 长上下文更快更省
AI资讯 AI导航 1 次阅读
Hugging Face 让 transformers 直接加载 GGUF:本机推理提速,接近 llama.cpp
AI资讯 AI导航 0 次阅读
DeepSeek-V4.1-Flash 发布:原生多模态进入新架构起点
AI资讯 AI导航 11 次阅读
DeepSeek 发布 DSpark 检查点,V4 推理最高提速 85%
AI资讯 AI导航 34 次阅读
llama.cpp发布b8234:本地大模型推理框架继续强化性能与部署适配
AI资讯 AI导航 34 次阅读