external-cannbot-model-model-infer-prefetch
Installation
SKILL.md
Prefetch 预取优化技能
提供手动指定和自动化分析两种方式确定预取位置,覆盖方案设计、大小计算、代码实现和性能验证。
重要原则
- 前置条件:模型必须在 NPU 上运行且已导入
torch_npu - 仅在 memory-bound 热点时使用:必须通过 profiling 确认存在 memory-bound 瓶颈
- 必须有安全的依赖窗口:前序算子不能是 memory-bound,否则会争抢带宽
- 始终提供开关保护:所有 prefetch 必须用
enable_prefetch开关保护,默认False - 先保守后激进:
max_size从保守值开始,根据 profiling 结果逐步调整 - 单点验证原则:先验证单个目标算子,成功后再扩展到多个位置
- 图模式兼容性:在图模式下,依赖节点必须与目标算子在逻辑时序上匹配