external-cannbot-model-model-infer-kvcache

Installation
SKILL.md

KVCache 优化技能

本技能按渐进式披露组织:快速选型 → 实现模式 → 深入原理 → 参考附录。 根据需要的深度选择阅读层级。


第一层:快速选型

根据模型类型,选择 KVCache 模式和参考实现:

模型类型 选择模式 参考实现 要点
标准 LLM(MHA/GQA) 模式一:连续缓存 gpt-oss, qwen3-moe 最简单,无需 block_table
高性能 LLM 模式二:分页注意力 + FA deepseek-r1, kimi-k2 需构造 block_table + slot_mapping
MLA 架构(DeepSeek 系列) 模式三:MLA 压缩 deepseek-r1, deepseek-v3.2 叠加在模式一或模式二之上
扩散/视频模型 FA 直接计算 hunyuan-video, wan2.2-i2v 无 KVCache 分页,BNSD layout
Installs
2
GitHub Stars
143
First Seen
May 19, 2026
external-cannbot-model-model-infer-kvcache — ascend-ai-coding/awesome-ascend-skills