Files
worldquant-alpha-system/docs/worldquant-knowledge-base/07-professional-knowledge/data-and-signal-semantics.md
T
yuxuanhui a1b160e1b0 Update knowledge base with recent forum insights and clarifications
- Added new sections on missing data handling and experimental variables in data and signal semantics (2026-09-25).
- Included clarifications on clustering representatives and candidate evaluations in portfolio and correlation optimization (2026-09-25).
- Updated README to reflect the latest forum synchronization and new post counts, including significant additions and revisions across multiple topics (2026-09-25).
2026-09-25 10:38:15 +08:00

56 lines
8.3 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 专业知识:先理解数据,再构造信号
范围仅为 2026-01-01 起发布的论坛帖子。下文把社区经验转成可检验的问题;算子细节、数据类型和可用权限仍以运行时平台文档为准。
## 1. 覆盖率至少有三个维度
时间覆盖、每天的股票覆盖和数据新鲜度需要分别检查。`dateCoverage` 不能告诉你缺失在开头、末端还是中间,也不能证明早期股票数量足够。VECTOR 的“当天存在列表”还可能与“列表中存在有效观测”不同。作者提出的 0.6 等阈值仅是筛选经验,不能写成平台标准。来源:[【平台新功能】字段新特征:datecoverage的介绍、应用与勘误。](https://support.worldquantbrain.com/hc/en-us/community/posts/37581194344215)(2026-01-10)。
建议体检输出:每日有效股票数、最长连续缺失、最后有效日期、有效值更新次数、常数比例、各地区覆盖、早中晚三个时期的分布。PnL 走平时先排查字段停更、标准差归零和无持仓,再判断信号衰减。
## 2. NaN 不是统一的经济事件
短暂采集中断、尚未披露、没有发生事件、不适用、停更,都可能表现为 NaN。短窗回填可能修复断点,也可能把旧事件无限延长;季度数据的前值在下一次披露前是否仍有意义,要由字段定义决定,不能一律判定“该填”或“不该填”。`group_backfill` 会引入同行信息,已改变信号来源。来源:[【字段处理】nan 不是一种:断粮型该填、真缺型别填(GLB/MINVOL1M & IND/TOP500/D1)](https://support.worldquantbrain.com/hc/en-us/community/posts/42078729821591)(2026-07-20)、[冷门数据集分享【earnings】](https://support.worldquantbrain.com/hc/en-us/community/posts/42187906212247)(2026-07-24)。
比较原始值、有限回填、事件年龄过滤和同行填充时,必须同时记录覆盖变化。不能将填充后收益改善全部归因于原字段。零值也不能统一替换为缺失。
## 3. 跨地区迁移需要重新对齐
同字段在 USA、IND、GLB 的覆盖、流动性和可交易股票结构可能差异很大;拼接后可能主要暴露于规模或流动性。GROUP 的数字编码也不能跨地区照搬,应重新查对应关系并对齐日期和 instrument。来源:[别盲目全region遍历:同一个字段在USA/IND/GLB覆盖差太多,裸concat直接变size beta](https://support.worldquantbrain.com/hc/en-us/community/posts/41974186627351)(2026-07-15)、[通过Labs查看group类型字段的字符串与对应数字id的方法(附部分对应表格)](https://support.worldquantbrain.com/hc/en-us/community/posts/42160653418647)(2026-07-23)。
因此可迁移的是机制假设和诊断流程;字段、窗口、中性化、交易成本及组规模都要重验。`shortinterest7` 在分享帖中被指出实际归到 model 类,名字并不是充分分类依据。来源:[【GLB】冷门数据集分享](https://support.worldquantbrain.com/hc/en-us/community/posts/42062231758103)(2026-07-19)。
## 4. 比率、差值与派生字段的量纲
比率可消除部分规模影响,但必须先确认分子分母代表什么。利润是期间流量,资产是时点存量;每股量、总额、预测 surprise 和 consensus 也不能仅因名称相近就直接运算。来源:[0帧起手的字段构建【传奇耐打王系列三】](https://support.worldquantbrain.com/hc/en-us/community/posts/40760257415959)(2026-05-27)、[USA analyst一些具有经济学意义的重组数据字段](https://support.worldquantbrain.com/hc/en-us/community/posts/38927191768343)(2026-03-10)。
对后者主帖的直接检查发现:列表包含同一字段减自身,非缺失位置结果恒为零;另有总额除每股量、预测 surprise 减 consensus 等需要口径核验的组合。故该表只能作为候选草稿,不能整体认定为“具有经济意义的字段库”。负债/资产等比率也未消除全部规模风险。
每个派生字段至少记录:单位、财务期间、发布日期、预测期限、分母近零比例、负值处理和方向假设。`log(A)-log(B)` 要求正值;`A/(A+B)` 要检查分母和互补关系。
## 5. 时序与截面操作不能随意交换
`ts_scale` 与 z-score 不同;组内排序也不等于线性回归残差。先行业处理再时间归一化,与先时间归一化再行业处理,通常不是同一个信号。来源:[行业中性加时序标准化:一个干净的 Alpha 模板](https://support.worldquantbrain.com/hc/en-us/community/posts/40902892248983)(2026-06-02)。
[【alpha模板】行业中性化残差信号IND模板](https://support.worldquantbrain.com/hc/en-us/community/posts/37669317975959)(2026-01-14) 标题称残差,但 `ts_zscore(A)-ts_zscore(group_neutralize(A,sector))` 是两次不同标准化后的差,不能直接解释为剥离行业后的残差。该差可能包含共同成分;应分别回测两项与差值,辨认收益来源。
[通俗易懂,从另一个角度理解一下方法vector_neut(x, y)、ts_vector_neut(x, y, d)、ts_vector_proj(x, y, d)](https://support.worldquantbrain.com/hc/en-us/community/posts/39524416948887)(2026-04-05) 区分横截面投影/残差与单只股票时间窗口内的投影/残差。残差消除的是选定解释变量的线性部分,不等于消除了所有风险或建立了因果关系。
## 6. 频率与衰减
短长均值差可以研究不同时间尺度;`x-ts_mean(x,5)` 可作去除缓慢成分的近似,但不等于严格 FFT 分解。来源:[傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造](https://support.worldquantbrain.com/hc/en-us/community/posts/41208709211671)(2026-06-14)。新闻、财报、分析师信号的持续时间应分别估计,不能把社区给出的几天或几十天写成固定生命周期。来源:[【SPC实战】信号衰减5-7天:数据源“时效性”比“全面性”更重要](https://support.worldquantbrain.com/hc/en-us/community/posts/42955680180247)(2026-08-24)。
## 7. 字段数量、算子数量与独立信息
增加同类字段可能只是叠加相关噪声和缺失。帖子记录了同域克隆失败、跨类别组合更好的样本,但没有证明多类别组合必然有效。来源:[字段堆越多alpha越牛?我替你们试过了,真不是这么回事](https://support.worldquantbrain.com/hc/en-us/community/posts/41908323673111)(2026-07-13)。
保持主字段、方向与覆盖语义后,才讨论删除冗余算子;降低 OpCount 不能靠偷偷改变信号。来源:[【Quant101】OpCount 拯救计划:因子化简](https://support.worldquantbrain.com/hc/en-us/community/posts/41105918774807)(2026-06-10)。详见 [优化流程](../08-alpha-optimization/diagnostic-workflow.md)。
## 2026-09-25 补充:缺失设置是实验变量
[按数据类型选择回填](https://support.worldquantbrain.com/hc/en-us/community/posts/43273417454487)(2026-09-05,本轮补录)和 [NanHandling 讨论](https://support.worldquantbrain.com/hc/en-us/community/posts/43562519639063)(2026-09-17,本轮补录)提醒,事件未发生、状态尚未更新与采集缺失不能用同一填法。NanHandling ON/OFF、算子及字段组合可能改变有效股票数和信号含义;文中观测不是平台所有算子的统一定义,尤其不能推广“其他情况无所谓”。
[新闻密度帖的新增可见评论](https://support.worldquantbrain.com/hc/en-us/community/posts/43541109631895#community_comment_43582240044695)(评论发表于 2026-09-18)提出:若无新闻日为缺失且均值忽略缺失,得到的是有新闻日的条件均值,并非每个交易日的新闻密度。应先核对实际返回值,再比较零填充、原缺失和有限回填,同时观察覆盖与集中度;不能预先把缺失都当无事件。[预处理讨论评论](https://support.worldquantbrain.com/hc/en-us/community/posts/43527457608087#community_comment_43552980010775)(2026-09-17,本轮补齐)进一步提醒,回填后的 Sharpe 提升可能只是股票构成改变,需并看信号年龄、多空数量、换手及分组暴露。这些是评论者的机制建议,不是已确认因果结果。
历史频域来源 41208709211671 在本次列表缺失,2026-09-25 直接 API 请求返回 404;保留此前归纳和来源,不据此判断作者删除或内容失效。