--- title: 统计动量类技术指标因子(cn_stock_factors_ta_stat_momentum) source: bigfactorwarehouse / cn_stock / cn_stock_factors_ta_stat_momentum format: markdown --- # 统计动量类技术指标因子(cn_stock_factors_ta_stat_momentum) > 最朴素也最常用的一类因子:N 日累计收益率与创新高标志。短周期(5/10/20 日)在 A 股通常表现为反转,中长周期(60/120/250 日)表现为动量,创新高标志则用于突破类策略与趋势确认。 > > - **因子数量**:8 个因子 / 8 个数据列 > - **主键**:`date` + `instrument`(按 `cn_stock_instruments` 对齐全市场标的) > - **数据起始**:2010-01-01,日频增量更新 > - **复权口径**:后复权(`cn_stock_bar1d` 全表统一) --- ## 1. 上游依赖(基础数据表) | 上游表 | 用途 | 本表用到的字段 | |---|---|---| | `cn_stock_bar1d` | 后复权日行情,全部因子的计算输入 | `date`, `instrument`, `high`, `close` | | `cn_stock_instruments` | 全市场标的清单,决定本表每日的 `date` / `instrument` 组合 | `date`, `instrument` | > `cn_stock_bar1d` 为分区表,SQL 的 date 过滤由 `dai.query(filters={"date": [...]})` 下推完成。 --- ## 2. 因子清单(8 列) | # | 因子中文名 | 字段名 | 参数 | 因子逻辑 | 所属因子族 | |---|---|---|---|---|---| | 1 | 5 日动量 | `ret5` | 5 | 5 日累计收益率 | 区间动量族 | | 2 | 10 日动量 | `ret10` | 10 | 10 日累计收益率 | 区间动量族 | | 3 | 20 日动量 | `ret20` | 20 | 20 日累计收益率 | 区间动量族 | | 4 | 60 日动量 | `ret60` | 60 | 60 日累计收益率 | 区间动量族 | | 5 | 120 日动量 | `ret120` | 120 | 120 日累计收益率 | 区间动量族 | | 6 | 250 日动量 | `ret250` | 250 | 250 日累计收益率 | 区间动量族 | | 7 | 创 20 日新高 | `new_high20` | 20 | 收盘创 20 日新高为 1 | 创新高标志族 | | 8 | 创 60 日新高 | `new_high60` | 60 | 收盘创 60 日新高为 1 | 创新高标志族 | --- ## 3. 因子族公式与 DAI SQL ### 3.1 区间动量族 **公式**:Ret_N = Close / Close_N日前 − 1 **输出列(6)**:`ret5`、`ret10`、`ret20`、`ret60`、`ret120`、`ret250` ```sql SELECT date, instrument, close / NULLIF(m_lag(close, 5), 0) - 1 AS ret5, close / NULLIF(m_lag(close, 10), 0) - 1 AS ret10, close / NULLIF(m_lag(close, 20), 0) - 1 AS ret20, close / NULLIF(m_lag(close, 60), 0) - 1 AS ret60, close / NULLIF(m_lag(close, 120), 0) - 1 AS ret120, close / NULLIF(m_lag(close, 250), 0) - 1 AS ret250 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` ### 3.2 创新高标志族 **公式**:创 N 日新高 = 1(Close ≥ MAX_N(Close)),否则 0 **输出列(2)**:`new_high20`、`new_high60` ```sql SELECT date, instrument, if(close >= m_max(close, 20), 1, 0) AS new_high20, if(close >= m_max(close, 60), 1, 0) AS new_high60 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` --- ## 4. 数据加工说明 ### 4.1 加工链路 ``` cn_stock_bar1d(后复权,WHERE close IS NOT NULL) → 2 组因子族 SQL 并行执行(joblib loky, n_jobs=8) → 按 cn_stock_instruments 左连接对齐全市场标的 → schema 归一化(列序 / 类型 / 缺失值) → dai_write 按 date 的年份分区落库 ``` - 历史构建:`create()`,自 **2010-01-01** 起按 **2 年**一段滚动执行,每段结束后 `gc.collect()` 释放内存。 - 增量构建:`build()`,默认覆盖最近 5 个自然日;落库前跑 `tester.py`,落库后更新前端文档。 ### 4.2 回溯冗余(避免窗口未预热导致的缺失值) 窗口算子只在查询下推后的行集上计算,所以每次计算都会**向前多取一段行情**: | 参数 | 取值 | 说明 | |---|---|---| | `lookback_days` | **600 个自然日**(≈ 401 个交易日) | 本表最长窗口 / 预热需求约 250 个交易日 | 多读一段历史不改变任何输出值(窗口算子只向前看),只是把区间首日的"本可避免的缺失"消掉。 EMA / RSI / ATR / MACD / TRIX 属于 IIR 递推算子,理论上预热期无限长,因此这些表的冗余按 **约 5 倍最长周期**取值,而非刚好等于窗口长度。 ### 4.3 停牌空值行的处理 `cn_stock_bar1d` 在停牌日会保留一行、但 `open/high/low/close/amount` 全为 NULL、`volume` 为 0。 `m_ta_*` 递推类算子只要吃到一个 NULL,之后就永久输出 NULL。因此所有 SQL 统一加 `WHERE close IS NOT NULL`,把停牌行从计算输入中剔除(此时 `m_lag(close, 1)` 指向上一个**交易日**, 符合技术指标的常规口径)。 实测(2024-01 全市场,回溯起点 2021-06): | 处理方式 | bbands_middle_20 | atr14 | kdj_j_9 | macd_diff_12_26_9 | |---|---|---|---|---| | 不加过滤 | 88.3% | 88.3% | 88.4% | 88.1% | | **加 `WHERE close IS NOT NULL`** | **99.7%** | **99.7%** | **99.7%** | **99.5%** | ### 4.4 累计型因子的锚点 本表不含累计型因子,全部因子都是固定长度的滚动窗口计算,因此只受 `lookback_days` 影响。 ### 4.5 标的对齐与覆盖度 落库前以 `cn_stock_instruments` 为基准左连接,因此**每个交易日都是全市场标的的完整行**, 停牌股与上市不足窗口长度的新股在对应因子列上为 NULL。入库校验要求单因子整体覆盖度 ≥ 85% (`tester.py` 关键测试点),单日覆盖度 ≥ 80%(非关键,仅告警)。 ### 4.6 本表实现要点 - `ret*` 用后复权收盘价计算,已包含分红送转的影响,可直接作为收益动量使用。 - 短周期 `ret5`/`ret10` 在 A 股多为反转信号(IC 常为负),使用时注意方向;另外反转类因子对前向收益口径极敏感,回测请用次日开盘价口径而非收盘价口径。 - `new_high20`/`new_high60` 用 `close >= m_max(close, N)` 判定(窗口含当日,故等价于 `close = 窗口最高`),相比浮点等号判断更稳。 - 最长窗口 250 个交易日,回溯冗余取 600 个自然日(约 400 个交易日)。 --- ## 5. 覆盖度实测 实测区间 **2026-09-07 ~ 2026-09-17**(9 个交易日、50052 行,已按 `cn_stock_instruments` 对齐全市场标的): | 指标 | 数值 | |---|---| | 因子列数 | 8 | | 最低覆盖度 | **96.89%**(ret250) | | 中位覆盖度 | 99.55% | | 最高覆盖度 | 99.79% | | 覆盖度 < 85% 的列数 | 0 | | `tester.py` 关键测试点 | ✅ 通过 | 覆盖度最低的三列:`ret250`(96.9%)、`ret120`(98.2%)、`ret60`(99.0%)。缺失主要来自**上市不足窗口长度的新股**与**当日停牌**,逐列明细见 `testdata/coverage_report.md`,数据示例见 `testdata/sample_data.csv`。 --- ## 6. 示例数据 {{sample_data}} --- ## 7. 使用建议 1. **横截面标准化**:本表含绝对量纲列(价位、波幅、成交量等),跨股票比较前建议用 `c_zscore(因子, group=date)` 或 `c_rank(因子, group=date)` 处理,或改用同族的比值型因子。 2. **去极值**:比值类因子分母虽已做 `NULLIF` 保护,但小分母仍会放大尾部,建议按日做分位数截断。 3. **冗余筛选**:同一指标的多参数档位之间相关性很高,建模前建议按 IC / 相关性 / 特征重要性做筛选, 而不是把全部列直接喂给模型。 4. **无未来函数**:全部因子只用当期与历史滚动数据;回测时注意前向收益口径(建议用次日开盘价), 收盘价口径会系统性高估短周期反转类因子的收益。
统计动量类因子 (cn_stock_factors_ta_stat_momentum)
数据描述: 统计动量类技术指标因子
文档
用例
表结构
| 字段 | 字段类型 | 字段描述 |
| new_high20 | double | 创 20 日新高(参数 20)。收盘创 20 日新高为 1。计算式:if(close >= m_max(close, 20), 1, 0) |
| instrument | string | 证券代码 |
| __PARTITION__ | int64 | - |
| new_high60 | double | 创 60 日新高(参数 60)。收盘创 60 日新高为 1。计算式:if(close >= m_max(close, 60), 1, 0) |
| ret5 | double | 5 日动量(参数 5)。5 日累计收益率。计算式:close / NULLIF(m_lag(close, 5), 0) - 1 |
| date | timestamp[ns] | 日期 |
| ret10 | double | 10 日动量(参数 10)。10 日累计收益率。计算式:close / NULLIF(m_lag(close, 10), 0) - 1 |
| ret20 | double | 20 日动量(参数 20)。20 日累计收益率。计算式:close / NULLIF(m_lag(close, 20), 0) - 1 |
| ret60 | double | 60 日动量(参数 60)。60 日累计收益率。计算式:close / NULLIF(m_lag(close, 60), 0) - 1 |
| ret120 | double | 120 日动量(参数 120)。120 日累计收益率。计算式:close / NULLIF(m_lag(close, 120), 0) - 1 |
| ret250 | double | 250 日动量(参数 250)。250 日累计收益率。计算式:close / NULLIF(m_lag(close, 250), 0) - 1 |
表名:cn_stock_factors_ta_stat_momentum
起始时间:
最近更新时间: