external-cannbot-model-model-infer-kvcache
Installation
SKILL.md
KVCache 优化技能
本技能按渐进式披露组织:快速选型 → 实现模式 → 深入原理 → 参考附录。 根据需要的深度选择阅读层级。
第一层:快速选型
根据模型类型,选择 KVCache 模式和参考实现:
| 模型类型 | 选择模式 | 参考实现 | 要点 |
|---|---|---|---|
| 标准 LLM(MHA/GQA) | 模式一:连续缓存 | gpt-oss, qwen3-moe | 最简单,无需 block_table |
| 高性能 LLM | 模式二:分页注意力 + FA | deepseek-r1, kimi-k2 | 需构造 block_table + slot_mapping |
| MLA 架构(DeepSeek 系列) | 模式三:MLA 压缩 | deepseek-r1, deepseek-v3.2 | 叠加在模式一或模式二之上 |
| 扩散/视频模型 | FA 直接计算 | hunyuan-video, wan2.2-i2v | 无 KVCache 分页,BNSD layout |