均线类技术指标因子 (cn_stock_factors_ta_ma)

数据描述: 移动平均线类技术指标因子

文档
数据简介

--- title: 移动平均线类技术指标因子(cn_stock_factors_ta_ma) source: bigfactorwarehouse / cn_stock / cn_stock_factors_ta_ma format: markdown --- # 移动平均线类技术指标因子(cn_stock_factors_ta_ma) > 以收盘价为输入的均线价位族,覆盖简单(SMA)、指数(EMA)、线性加权(WMA)三种平滑方式,档位从 5 日到 250 日。与乖离率、多头排列等派生指标不同,本类因子保留“价位本身”的量纲,可直接用于分组、通道、止损线等场景。 > > - **因子数量**:18 个因子 / 18 个数据列 > - **主键**:`date` + `instrument`(按 `cn_stock_instruments` 对齐全市场标的) > - **数据起始**:2010-01-01,日频增量更新 > - **复权口径**:后复权(`cn_stock_bar1d` 全表统一) --- ## 1. 上游依赖(基础数据表) | 上游表 | 用途 | 本表用到的字段 | |---|---|---| | `cn_stock_bar1d` | 后复权日行情,全部因子的计算输入 | `date`, `instrument`, `close` | | `cn_stock_instruments` | 全市场标的清单,决定本表每日的 `date` / `instrument` 组合 | `date`, `instrument` | > `cn_stock_bar1d` 为分区表,SQL 的 date 过滤由 `dai.query(filters={"date": [...]})` 下推完成。 --- ## 2. 因子清单(18 列) | # | 因子中文名 | 字段名 | 参数 | 因子逻辑 | 所属因子族 | |---|---|---|---|---|---| | 1 | 简单移动平均 | `ma5` | 5 | 5 日简单移动平均(绝对价位) | MA / EXPMA 绝对价位 | | 2 | 指数平均数 | `ema5` | 5 | 5 日指数移动平均(绝对价位) | MA / EXPMA 绝对价位 | | 3 | 简单移动平均线 | `sma_10` | 10 | 计算 n1 个时间周期内收盘价的平均值 | 简单移动平均线族 | | 4 | 简单移动平均线 | `sma_20` | 20 | 计算 n1 个时间周期内收盘价的平均值 | 简单移动平均线族 | | 5 | 简单移动平均线 | `sma_60` | 60 | 计算 n1 个时间周期内收盘价的平均值 | 简单移动平均线族 | | 6 | 简单移动平均线 | `sma_120` | 120 | 计算 n1 个时间周期内收盘价的平均值 | 简单移动平均线族 | | 7 | 简单移动平均线 | `sma_250` | 250 | 计算 n1 个时间周期内收盘价的平均值 | 简单移动平均线族 | | 8 | 指数移动平均线 | `ema_10` | 10 | 对 n1 个周期收盘价指数加权平均,对近期价格更敏感 | 指数移动平均线族 | | 9 | 指数移动平均线 | `ema_20` | 20 | 对 n1 个周期收盘价指数加权平均,对近期价格更敏感 | 指数移动平均线族 | | 10 | 指数移动平均线 | `ema_60` | 60 | 对 n1 个周期收盘价指数加权平均,对近期价格更敏感 | 指数移动平均线族 | | 11 | 指数移动平均线 | `ema_120` | 120 | 对 n1 个周期收盘价指数加权平均,对近期价格更敏感 | 指数移动平均线族 | | 12 | 指数移动平均线 | `ema_250` | 250 | 对 n1 个周期收盘价指数加权平均,对近期价格更敏感 | 指数移动平均线族 | | 13 | 加权移动平均线 | `wma_5` | 5 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | | 14 | 加权移动平均线 | `wma_10` | 10 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | | 15 | 加权移动平均线 | `wma_20` | 20 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | | 16 | 加权移动平均线 | `wma_60` | 60 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | | 17 | 加权移动平均线 | `wma_120` | 120 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | | 18 | 加权移动平均线 | `wma_250` | 250 | 对 n1 个周期收盘价线性加权平均,对近期价格更敏感 | 加权移动平均线族 | --- ## 3. 因子族公式与 DAI SQL ### 3.1 MA / EXPMA 绝对价位 **公式**:MA5 = SMA(Close, 5);EXPMA5 = EMA(Close, 5) **输出列(2)**:`ma5`、`ema5` ```sql SELECT date, instrument, m_avg(close, 5) AS ma5, m_ta_ema(close, 5) AS ema5 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` ### 3.2 简单移动平均线族 **公式**:SMA_N = m_ta_sma(close, N) **输出列(5)**:`sma_10`、`sma_20`、`sma_60`、`sma_120`、`sma_250` ```sql SELECT date, instrument, m_ta_sma(close, 10) AS sma_10, m_ta_sma(close, 20) AS sma_20, m_ta_sma(close, 60) AS sma_60, m_ta_sma(close, 120) AS sma_120, m_ta_sma(close, 250) AS sma_250 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` ### 3.3 指数移动平均线族 **公式**:EMA_N = m_ta_ema(close, N) **输出列(5)**:`ema_10`、`ema_20`、`ema_60`、`ema_120`、`ema_250` ```sql SELECT date, instrument, m_ta_ema(close, 10) AS ema_10, m_ta_ema(close, 20) AS ema_20, m_ta_ema(close, 60) AS ema_60, m_ta_ema(close, 120) AS ema_120, m_ta_ema(close, 250) AS ema_250 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` ### 3.4 加权移动平均线族 **公式**:WMA_N = m_ta_wma(close, N) **输出列(6)**:`wma_5`、`wma_10`、`wma_20`、`wma_60`、`wma_120`、`wma_250` ```sql SELECT date, instrument, m_ta_wma(close, 5) AS wma_5, m_ta_wma(close, 10) AS wma_10, m_ta_wma(close, 20) AS wma_20, m_ta_wma(close, 60) AS wma_60, m_ta_wma(close, 120) AS wma_120, m_ta_wma(close, 250) AS wma_250 FROM cn_stock_bar1d WHERE close IS NOT NULL ORDER BY date, instrument ``` --- ## 4. 数据加工说明 ### 4.1 加工链路 ``` cn_stock_bar1d(后复权,WHERE close IS NOT NULL) → 4 组因子族 SQL 并行执行(joblib loky, n_jobs=8) → 按 cn_stock_instruments 左连接对齐全市场标的 → schema 归一化(列序 / 类型 / 缺失值) → dai_write 按 date 的年份分区落库 ``` - 历史构建:`create()`,自 **2010-01-01** 起按 **2 年**一段滚动执行,每段结束后 `gc.collect()` 释放内存。 - 增量构建:`build()`,默认覆盖最近 5 个自然日;落库前跑 `tester.py`,落库后更新前端文档。 ### 4.2 回溯冗余(避免窗口未预热导致的缺失值) 窗口算子只在查询下推后的行集上计算,所以每次计算都会**向前多取一段行情**: | 参数 | 取值 | 说明 | |---|---|---| | `lookback_days` | **1900 个自然日**(≈ 1270 个交易日) | 本表最长窗口 / 预热需求约 250 个交易日 | 多读一段历史不改变任何输出值(窗口算子只向前看),只是把区间首日的"本可避免的缺失"消掉。 EMA / RSI / ATR / MACD / TRIX 属于 IIR 递推算子,理论上预热期无限长,因此这些表的冗余按 **约 5 倍最长周期**取值,而非刚好等于窗口长度。 ### 4.3 停牌空值行的处理 `cn_stock_bar1d` 在停牌日会保留一行、但 `open/high/low/close/amount` 全为 NULL、`volume` 为 0。 `m_ta_*` 递推类算子只要吃到一个 NULL,之后就永久输出 NULL。因此所有 SQL 统一加 `WHERE close IS NOT NULL`,把停牌行从计算输入中剔除(此时 `m_lag(close, 1)` 指向上一个**交易日**, 符合技术指标的常规口径)。 实测(2024-01 全市场,回溯起点 2021-06): | 处理方式 | bbands_middle_20 | atr14 | kdj_j_9 | macd_diff_12_26_9 | |---|---|---|---|---| | 不加过滤 | 88.3% | 88.3% | 88.4% | 88.1% | | **加 `WHERE close IS NOT NULL`** | **99.7%** | **99.7%** | **99.7%** | **99.5%** | ### 4.4 累计型因子的锚点 本表不含累计型因子,全部因子都是固定长度的滚动窗口计算,因此只受 `lookback_days` 影响。 ### 4.5 标的对齐与覆盖度 落库前以 `cn_stock_instruments` 为基准左连接,因此**每个交易日都是全市场标的的完整行**, 停牌股与上市不足窗口长度的新股在对应因子列上为 NULL。入库校验要求单因子整体覆盖度 ≥ 85% (`tester.py` 关键测试点),单日覆盖度 ≥ 80%(非关键,仅告警)。 ### 4.6 本表实现要点 - 本类含 EMA/WMA 等 IIR 型平滑算子,历史值对起点敏感,因此回溯冗余天数取 1900 个自然日(约 1270 个交易日,≈ 5 倍最长窗口 250),保证 250 日档位的 EMA 已充分收敛。 - `ma5` 用 `m_avg`(等价 SMA),`sma_10` 起改用 TA-Lib 移植算子 `m_ta_sma`,两者在窗口满足时数值一致;文档保留两种写法以对齐上游因子表命名。 --- ## 5. 覆盖度实测 实测区间 **2026-09-07 ~ 2026-09-17**(9 个交易日、50052 行,已按 `cn_stock_instruments` 对齐全市场标的): | 指标 | 数值 | |---|---| | 因子列数 | 18 | | 最低覆盖度 | **96.90%**(sma_250) | | 中位覆盖度 | 99.24% | | 最高覆盖度 | 99.72% | | 覆盖度 < 85% 的列数 | 0 | | `tester.py` 关键测试点 | ✅ 通过 | 覆盖度最低的三列:`sma_250`(96.9%)、`ema_250`(96.9%)、`wma_250`(96.9%)。缺失主要来自**上市不足窗口长度的新股**与**当日停牌**,逐列明细见 `testdata/coverage_report.md`,数据示例见 `testdata/sample_data.csv`。 --- ## 6. 示例数据 {{sample_data}} --- ## 7. 使用建议 1. **横截面标准化**:本表含绝对量纲列(价位、波幅、成交量等),跨股票比较前建议用 `c_zscore(因子, group=date)` 或 `c_rank(因子, group=date)` 处理,或改用同族的比值型因子。 2. **去极值**:比值类因子分母虽已做 `NULLIF` 保护,但小分母仍会放大尾部,建议按日做分位数截断。 3. **冗余筛选**:同一指标的多参数档位之间相关性很高,建模前建议按 IC / 相关性 / 特征重要性做筛选, 而不是把全部列直接喂给模型。 4. **无未来函数**:全部因子只用当期与历史滚动数据;回测时注意前向收益口径(建议用次日开盘价), 收盘价口径会系统性高估短周期反转类因子的收益。

用例
表结构
字段 字段类型 字段描述
date timestamp[ns] 日期
wma_250 double 加权移动平均线(参数 250)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 250)
instrument string 证券代码
__PARTITION__ int64 -
wma_120 double 加权移动平均线(参数 120)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 120)
ma5 double 简单移动平均(参数 5)。5 日简单移动平均(绝对价位)。计算式:m_avg(close, 5)
ema5 double 指数平均数(参数 5)。5 日指数移动平均(绝对价位)。计算式:m_ta_ema(close, 5)
wma_5 double 加权移动平均线(参数 5)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 5)
ema_10 double 指数移动平均线(参数 10)。对 n1 个周期收盘价指数加权平均,对近期价格更敏感。计算式:m_ta_ema(close, 10)
ema_20 double 指数移动平均线(参数 20)。对 n1 个周期收盘价指数加权平均,对近期价格更敏感。计算式:m_ta_ema(close, 20)
ema_60 double 指数移动平均线(参数 60)。对 n1 个周期收盘价指数加权平均,对近期价格更敏感。计算式:m_ta_ema(close, 60)
sma_10 double 简单移动平均线(参数 10)。计算 n1 个时间周期内收盘价的平均值。计算式:m_ta_sma(close, 10)
sma_20 double 简单移动平均线(参数 20)。计算 n1 个时间周期内收盘价的平均值。计算式:m_ta_sma(close, 20)
sma_60 double 简单移动平均线(参数 60)。计算 n1 个时间周期内收盘价的平均值。计算式:m_ta_sma(close, 60)
wma_10 double 加权移动平均线(参数 10)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 10)
wma_20 double 加权移动平均线(参数 20)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 20)
wma_60 double 加权移动平均线(参数 60)。对 n1 个周期收盘价线性加权平均,对近期价格更敏感。计算式:m_ta_wma(close, 60)
ema_120 double 指数移动平均线(参数 120)。对 n1 个周期收盘价指数加权平均,对近期价格更敏感。计算式:m_ta_ema(close, 120)
ema_250 double 指数移动平均线(参数 250)。对 n1 个周期收盘价指数加权平均,对近期价格更敏感。计算式:m_ta_ema(close, 250)
sma_120 double 简单移动平均线(参数 120)。计算 n1 个时间周期内收盘价的平均值。计算式:m_ta_sma(close, 120)
sma_250 double 简单移动平均线(参数 250)。计算 n1 个时间周期内收盘价的平均值。计算式:m_ta_sma(close, 250)

表名:cn_stock_factors_ta_ma

起始时间:

最近更新时间: