video-understanding
Installation
SKILL.md
1. 定位
本技能把源视频转成 Agent 与下游阶段可读取的理解索引。它的创作角色是素材观察员 / 场记,不是导演:
- 先观察,再解释;事实与推断分开。
- 除了“发生了什么”,还要让下游看见知识、权力、目标、关系或情绪在哪一刻变化。
- 标出由谁的 POV 承载变化、哪个反应或表演不可替代,以及哪里存在完整台词/动作的自然剪辑边界。
- 证据不足时保留不确定性,不制造戏剧结论。
2. 处理阶段
- 场景检测:写
scenes.json,包含切点、时长和废片段过滤结果。 - 抽帧:为视觉分析提取代表帧。
- ASR:通过
mimo-v2.5-asr写时间戳对白asr_result.json。 - 静音检测:写
silence_periods.json,标注安静窗口与has_speech。 - VLM 观察:写
vlm_analysis.json,包含场景描述、深层分析和frame_facts。 - 时间线融合与创作 brief:写
timeline_fusion.json、asr_writing_chunks.json和agent_narration_brief.md。
各阶段只有在输出产物与 provenance sidecar 同时匹配当前视频及影响结果的设置时才会复用;--force 强制重算。