# hf_bar1m_fz_institution_trace ## 文献来源 - **标题**: 《本福特的启示:从分钟成交量看机构痕迹——“聆听高频世界的声音”系列研究(六)》 - **作者**: 魏建榕、高子剑 - **机构**: 方正证券 - **时间**: 2017-08-13 本福特法则指出,许多真实数据集中首位数字的出现频率并不均匀,而是服从 $P(n) = \log_{10}(n+1) - \log_{10}(n)$ 的递减分布。研报发现个股分钟成交量整体上很好地贴近这一理想分布,而偏离的大小可作为「机构行为痕迹」的代理变量:机构单笔成交量更大,更容易干扰首位数字的分布,因此偏离越大、机构的行为痕迹越重。 本表基于 `cn_stock_bar1m` 输出两个因子:偏离度本身 `institution_trace`(研报第 2 节,即研报中的 X 指标),以及研报用于划分情景空间的偏离度环比变化 `institution_trace_chg`(研报第 3 节,即研报中的 ΔX)。两者共用同一次分钟成交量扫描,故合并为一张表。研报强调 X 指标不带买卖方向性,本身不具备选股能力,用途是对其他因子做横截面的「情景分析」(判断因子对哪些股票有效),而非直接选股。 ## 表结构 - **表名**: `hf_bar1m_fz_institution_trace` - **主键**: `date` + `instrument` - **记录粒度**: 每个交易日每只股票一条记录 | 字段 | 类型 | 可空 | 含义 | | ---- | ---- | ---- | ---- | | `date` | `PlDatetime` | 否 | 交易日期 | | `instrument` | `PlString` | 否 | 股票代码 | | `institution_trace` | `PlFloat64` | 是 | 机构痕迹指标,最近 5000 个非零分钟成交量的首位数字频率分布与本福特理想分布的平方偏差之和,值越大说明偏离越大、机构行为痕迹越重 | | `institution_trace_chg` | `PlFloat64` | 是 | 机构痕迹指标的环比变化率,当日 `institution_trace` 相对 20 个交易日前的增长比例,值越大说明机构行为痕迹的增量越大 | ## 依赖数据 | 依赖表 | 频率 | 用到的字段 | 用途 | | ---- | ---- | ---- | ---- | | `cn_stock_bar1m` | 1 分钟 | `date`、`instrument`、`volume` | `volume` 取首位数字统计频率分布并计算与本福特分布的偏差,`date` 用于限定回溯区间、按交易日切分与滚动排序,`instrument` 用于分股票统计 | `institution_trace` 单日需回溯至多 40 个交易日的分钟数据以凑足 5000 个非零成交量;`institution_trace_chg` 还需 20 个交易日前的 `institution_trace`,因此实际回溯约 60 个交易日,单日增量的分钟数据扫描量约为输出区间的 60 倍。 ## 因子列表 ### institution_trace **中文名**: 机构痕迹指标 **描述**: 用分钟成交量首位数字分布对本福特理想分布的偏离程度,度量个股上的机构交易痕迹。机构相对散户单笔成交量更大,更容易干扰首位数字的分布,因此偏离越大、机构行为痕迹越重。研报指出该指标不带买卖方向,本身不具备选股能力,用于对其他因子做情景分析。 **构建逻辑**: 1. 在每个月月底,对每只股票向前取其最近 5000 个非零的分钟成交量数据。若向前推 40 个交易日仍未凑足 5000 个非零数据,则该股票当期不参与 X 指标的计算。 2. 对步骤 1 得到的 5000 个成交量数据,统计首位数字出现的频率,分别记为 $f(1), f(2), \ldots, f(9)$。 3. 计算该频率分布与本福特理想分布的偏差 X,即各项偏差的平方和: ```math X = \sum_{n=1}^{9} \bigl(f(n) - P(n)\bigr)^2 ``` 其中 $P(n)$ 为本福特理想分布中首位数字出现 $n$ 的频率: ```math P(n) = \log_{10}(n+1) - \log_{10}(n) ``` X 的数值越大,则成交量数据与本福特理想分布的偏离越大,机构的行为痕迹也越大。 **项目实现说明**: - 计算频率:研报原文为每月月底计算,本项目按项目规范改为每个交易日计算。窗口口径不变,仍为「截至该交易日收盘的最近 5000 个非零分钟成交量,且不早于该交易日前推 40 个交易日」,凑不足 5000 个时该股当日因子为空。 - 日内时段的落地口径:研报只要求「非零」,未要求剔除任何日内时段,因此 `cn_stock_bar1m` 全天的分钟 bar(含开盘集合竞价汇总的那一根)只要 `volume > 0` 就都参与首位数字统计,不做时段裁剪。首位数字统计对数量级不敏感(本福特分布具有尺度不变性),集合竞价那一根成交量偏大也不会系统性改变分布形态,且在 5000 个样本中占比可忽略。 ### institution_trace_chg **中文名**: 机构痕迹指标增量 **描述**: 机构痕迹指标的环比变化率,刻画机构行为痕迹是在增强还是减弱。研报按该指标把全市场股票排序分为 3 个情景空间,用于检验其他因子在「机构痕迹增量大 / 中 / 小」的股票上分别有多强的选股能力;研报结论是机构行为痕迹增量大的股票上,换手率变化率、聪明钱 Q 因子、净利润同比增长率的选股效果都更显著。 **构建逻辑**: 在每个月月底,用本月 X 指标除以上月 X 指标再减 1,得到 X 指标的增量 ΔX: ```math \Delta X = \frac{X_t}{X_{t-1}} - 1 ``` 其中 $t$ 为月度序号。研报按 ΔX 对全体 A 股排序分组,划分为 3 个情景空间。 **项目实现说明**: - 计算频率:研报原文为每月月底计算,本项目按项目规范改为每个交易日计算 - 环比间隔:研报为月度环比(本月 X / 上月 X - 1),本项目改为逐日计算后取 20 个交易日的间隔(当日 X / 20 个交易日前 X - 1),以 20 个交易日近似研报的一个月 - 情景空间分组:研报的「排序分 3 组」是截面分组动作,取决于下游的股票池与分组数,不属于因子值本身,本表只输出 ΔX 原始值,不做分组 ## 复现核对 **核对口径**: 待因子入库后按 2013-04 ~ 2017-05(研报回测区间)与全样本区间分别核对;全市场不做任何股票过滤;前向收益取 20 个交易日;rankIC(Spearman,按 `hfwarehouse.utils.ic.validate_factor_ic` 的口径先做截面百分位排名再算 Pearson 相关);研报为月末截面、本项目逐日,故同时给出月末子样本与逐日全样本两列。 | 因子 | 本项目(月末口径) | 本项目(逐日全样本) | 研报原文 | 出处 | | ---- | ---- | ---- | ---- | ---- | | `institution_trace` | 待回填 | 待回填 | 研报未披露,无法核对 | — | | `institution_trace_chg` | 待回填 | 待回填 | 研报未披露,无法核对 | — | 研报**没有披露** X 指标或 ΔX 自身的 IC / ICIR:研报明确指出 X 指标「因其不带『买』或『卖』的方向性,天然地不具备选股能力」,全文给出的数值都是**被测因子在 X 情景空间内**的表现(图表 5 换手率变化率因子 ICIR 1.26 / 0.63 / 0.90、多空年化 18.2% / 5.0% / 6.8%;图表 6 聪明钱 Q 因子 ICIR 2.93 / 2.06 / 1.88、多空年化 29.2% / 20.3% / 17.3%,按 ΔX 从大到中到小排列)。 因此本表的复现核对分两层,第二层需要在本表之外另建被测因子: 1. **因子值层面**(本表可自证):检查分钟成交量首位数字的真实分布是否贴近本福特分布(对应研报图表 4),以及 `institution_trace` 的量级与横截面分布是否合理。研报图表 4 只给了万科 A 在 2017 年 4 月的柱状图、未给数值表,只能做形态比对。 2. **情景分析层面**(对应研报图表 5):需要额外构建「换手率的变化率」因子(近 20 个交易日平均换手率 / 近 40 个交易日平均换手率 - 1,可由 `cn_stock_prefactors` 直接算出),按 `institution_trace_chg` 分 3 组后分别计算 ICIR 与五分组多空对冲年化收益,与研报图表 5 的 6 个数值对照。图表 6 的聪明钱 Q 因子来自另一篇研报(《跟踪聪明钱:从分钟行情到数据选股因子》,20160708),本仓库尚未构建,无法核对。 上述两层核对均在因子入库后补做,数值出来后回填本小节;对不上时如实记录差异,不调参数去凑研报。 ## 示例数据 按 `date`、`instrument` 排序后的前 5 行与后 5 行,由 `update_docs()` 推送文档时自动填充。 | date | instrument | institution_trace | institution_trace_chg | |---------------------|------------|-------------------|-----------------------| | 2026-09-22 00:00:00 | 000001.SZ | 0.000620 | 4.021238 | | 2026-09-22 00:00:00 | 000002.SZ | 0.000430 | 0.062348 | | 2026-09-22 00:00:00 | 000006.SZ | 0.000233 | -0.092232 | | 2026-09-22 00:00:00 | 000007.SZ | 0.000279 | 0.052737 | | 2026-09-22 00:00:00 | 000008.SZ | 0.000091 | 0.545104 | | 2026-09-22 00:00:00 | 688835.SH | null | null | | 2026-09-22 00:00:00 | 688836.SH | 0.001318 | null | | 2026-09-22 00:00:00 | 688837.SH | null | null | | 2026-09-22 00:00:00 | 688981.SH | 0.003139 | -0.709690 | | 2026-09-22 00:00:00 | 689009.SH | 0.000688 | -0.221941 |
机构痕迹高频因子 (hf_bar1m_fz_institution_trace)
数据描述: * 来自方正证券,**标题**: 《本福特的启示:从分钟成交量看机构痕迹——“聆听高频世界的声音”系列研究(六)》
文档
用例
表结构
| 字段 | 字段类型 | 字段描述 |
| date | timestamp[ns] | 交易日期 |
| instrument | string | 股票代码 |
| __PARTITION__ | string | - |
| institution_trace | double | 机构痕迹指标,最近 5000 个非零分钟成交量的首位数字频率分布与本福特理想分布的平方偏差之和,值越大说明偏离越大、机构行为痕迹越重。来源:魏建榕、高子剑. 2017-08-13. 《本福特的启示:从分钟成交量看机构痕迹——“聆听高频世界的声音”系列研究(六)》. 方正证券 |
| institution_trace_chg | double | 机构痕迹指标的环比变化率,当日机构痕迹指标相对 20 个交易日前的增长比例,值越大说明机构行为痕迹的增量越大。来源:魏建榕、高子剑. 2017-08-13. 《本福特的启示:从分钟成交量看机构痕迹——“聆听高频世界的声音”系列研究(六)》. 方正证券 |
表名:hf_bar1m_fz_institution_trace
起始时间:
最近更新时间: