light-result-analysis
Installation
SKILL.md
结果与数据深度分析
分析层次(逐层深入)
- 描述:指标汇总、分布、与 baseline 的差距,配误差棒/置信区间。
- 解释:为什么是这个结果?归因到方法的哪个组件(结合消融)。
- 诊断:哪些结果证明创新点有效,哪些反而暴露问题或矛盾。
- 洞察:能成为论文亮点的规律;意外发现;可解释性证据(SHAP/特征重要性/注意力)。
- 行动:哪些异常需排查,哪些结论需补实验验证,哪些不能过度声称。
必查清单
- 显著性:≥5 随机种子;算力受限 ≥3 且须在报告显式标注(与 m05 实验设计同口径),报均值±标准差;两组用 Welch t(不假设等方差)、非正态用 Mann-Whitney U、多组用 ANOVA+Tukey、比例用 two-proportion z-test。p 值 + 效应量(Cohen's d) + 置信区间三件套,别只报 p。多比较用 BH-FDR 校正(
multipletests(method="fdr_bh"))。 - 配对设计识别(先判再选检验):方法是否在同一组单元(同一批种子/CV 折/测试样本)上评测?是 → 用配对 t / Wilcoxon 符号秩(功效更高,扣除单元间方差),不是独立 Welch/Mann-Whitney;误当独立会低估显著性。
analyze_results.py --paired-by seed自动按共享列对齐配对,配对效应量用 d_z、差值 CI 用 bootstrap(详见 references「配对设计识别」节)。 - 切片分析(防聚合指标盲区):整体指标会掩盖子群失败(整体 85% 但某类别只 50%)。按类别/域/难度/敏感属性/时间段切片,逐切片复算指标并带样本量 n,对照整体找异常切片;多切片比较过 BH-FDR;小 n 切片禁下强结论(详见 references「切片分析协议」节,公平性维度关联 a10)。
- 一致性:跨数据集/跨设置是否稳定?哪里反常?
- 消融自洽:移除组件性能确实下降?方向对不对?用 anova_lm 或回归系数看组件贡献是否显著。
- 失败案例:错例分析找系统性偏差;用 SHAP(beeswarm/bar) 看模型实际依赖哪些特征是否合理。
- 公平性:对比是否同设置、同算力、同数据,避免不公平比较。
- 过拟合/泄漏:train/val/test 差距是否异常;特征-标签相关过高或时间穿越要查(deepchecks data_integrity / 漂移用 Evidently DataDriftPreset)。