研究流程的泄漏审计
把「时点对齐、purged 交叉验证、幸存者偏差」从口头纪律变成会让构建失败的断言。
作品说明
时点对齐 → 泄漏审计 → 事件研究 → 每日分诊队列
按最自然的方式写出来的流程,在真实 SEC 申报上报出 0.888 的 ROC AUC;通过自身泄漏审计的版本是 0.768。按反应强度而非涨跌方向给每个交易日的 8-K 排序,让分析师读五份而不是四十份。
面向披露分诊:用 EDGAR 的受理时间戳(而非申报日期)确定每份 8-K 何时可交易,以市场模型事件研究测量反应强度(|CAR| / 残差标准差,前十分位记为「值得读」),再用 purged、带禁售期的 walk-forward 交叉验证做排序。四类泄漏被逐个关闭并量化:shuffle 交叉验证、滚动窗口未右移、非时点股票池、按申报日期入场——每一个都让指标变好看,没有一个会自己报错。天真流程的 11,681 笔成交里有 11,168 笔(95.6%)定价在申报公开之前,偷看时长中位数 10.6 小时,而这项修正几乎不改变分数:它需要的是断言,不是更好的指标。审计守卫抛异常而非记日志,并作为 CI 任务运行;摄入与评分之间的每一份申报都有去向记账,且由测试断言账目平衡。数据为真实 EDGAR 申报 + yfinance 价格;仓库另附合成语料,使流程在无 SEC 凭据时也能端到端运行,每份报告在横幅中标明自己出自哪条路径。
把「时点对齐、purged 交叉验证、幸存者偏差」从口头纪律变成会让构建失败的断言。
每个交易日中位 9 份申报,读前 5 份的命中率是随机读 5 份的 1.56 倍(15.6% 对 10% 基准)。
市场模型、估计窗与事件窗之间留 20 日间隔、按发行人自身噪声标准化反应强度。