# 专业知识:先理解数据,再构造信号 范围仅为 2026-01-01 起发布的论坛帖子。下文把社区经验转成可检验的问题;算子细节、数据类型和可用权限仍以运行时平台文档为准。 ## 1. 覆盖率至少有三个维度 时间覆盖、每天的股票覆盖和数据新鲜度需要分别检查。`dateCoverage` 不能告诉你缺失在开头、末端还是中间,也不能证明早期股票数量足够。VECTOR 的“当天存在列表”还可能与“列表中存在有效观测”不同。作者提出的 0.6 等阈值仅是筛选经验,不能写成平台标准。来源:[【平台新功能】字段新特征:datecoverage的介绍、应用与勘误。](https://support.worldquantbrain.com/hc/en-us/community/posts/37581194344215)(2026-01-10)。 建议体检输出:每日有效股票数、最长连续缺失、最后有效日期、有效值更新次数、常数比例、各地区覆盖、早中晚三个时期的分布。PnL 走平时先排查字段停更、标准差归零和无持仓,再判断信号衰减。 ## 2. NaN 不是统一的经济事件 短暂采集中断、尚未披露、没有发生事件、不适用、停更,都可能表现为 NaN。短窗回填可能修复断点,也可能把旧事件无限延长;季度数据的前值在下一次披露前是否仍有意义,要由字段定义决定,不能一律判定“该填”或“不该填”。`group_backfill` 会引入同行信息,已改变信号来源。来源:[【字段处理】nan 不是一种:断粮型该填、真缺型别填(GLB/MINVOL1M & IND/TOP500/D1)](https://support.worldquantbrain.com/hc/en-us/community/posts/42078729821591)(2026-07-20)、[冷门数据集分享【earnings】](https://support.worldquantbrain.com/hc/en-us/community/posts/42187906212247)(2026-07-24)。 比较原始值、有限回填、事件年龄过滤和同行填充时,必须同时记录覆盖变化。不能将填充后收益改善全部归因于原字段。零值也不能统一替换为缺失。 ## 3. 跨地区迁移需要重新对齐 同字段在 USA、IND、GLB 的覆盖、流动性和可交易股票结构可能差异很大;拼接后可能主要暴露于规模或流动性。GROUP 的数字编码也不能跨地区照搬,应重新查对应关系并对齐日期和 instrument。来源:[别盲目全region遍历:同一个字段在USA/IND/GLB覆盖差太多,裸concat直接变size beta](https://support.worldquantbrain.com/hc/en-us/community/posts/41974186627351)(2026-07-15)、[通过Labs查看group类型字段的字符串与对应数字id的方法(附部分对应表格)](https://support.worldquantbrain.com/hc/en-us/community/posts/42160653418647)(2026-07-23)。 因此可迁移的是机制假设和诊断流程;字段、窗口、中性化、交易成本及组规模都要重验。`shortinterest7` 在分享帖中被指出实际归到 model 类,名字并不是充分分类依据。来源:[【GLB】冷门数据集分享](https://support.worldquantbrain.com/hc/en-us/community/posts/42062231758103)(2026-07-19)。 ## 4. 比率、差值与派生字段的量纲 比率可消除部分规模影响,但必须先确认分子分母代表什么。利润是期间流量,资产是时点存量;每股量、总额、预测 surprise 和 consensus 也不能仅因名称相近就直接运算。来源:[0帧起手的字段构建【传奇耐打王系列三】](https://support.worldquantbrain.com/hc/en-us/community/posts/40760257415959)(2026-05-27)、[USA analyst一些具有经济学意义的重组数据字段](https://support.worldquantbrain.com/hc/en-us/community/posts/38927191768343)(2026-03-10)。 对后者主帖的直接检查发现:列表包含同一字段减自身,非缺失位置结果恒为零;另有总额除每股量、预测 surprise 减 consensus 等需要口径核验的组合。故该表只能作为候选草稿,不能整体认定为“具有经济意义的字段库”。负债/资产等比率也未消除全部规模风险。 每个派生字段至少记录:单位、财务期间、发布日期、预测期限、分母近零比例、负值处理和方向假设。`log(A)-log(B)` 要求正值;`A/(A+B)` 要检查分母和互补关系。 ## 5. 时序与截面操作不能随意交换 `ts_scale` 与 z-score 不同;组内排序也不等于线性回归残差。先行业处理再时间归一化,与先时间归一化再行业处理,通常不是同一个信号。来源:[行业中性加时序标准化:一个干净的 Alpha 模板](https://support.worldquantbrain.com/hc/en-us/community/posts/40902892248983)(2026-06-02)。 [【alpha模板】行业中性化残差信号IND模板](https://support.worldquantbrain.com/hc/en-us/community/posts/37669317975959)(2026-01-14) 标题称残差,但 `ts_zscore(A)-ts_zscore(group_neutralize(A,sector))` 是两次不同标准化后的差,不能直接解释为剥离行业后的残差。该差可能包含共同成分;应分别回测两项与差值,辨认收益来源。 [通俗易懂,从另一个角度理解一下方法vector_neut(x, y)、ts_vector_neut(x, y, d)、ts_vector_proj(x, y, d)](https://support.worldquantbrain.com/hc/en-us/community/posts/39524416948887)(2026-04-05) 区分横截面投影/残差与单只股票时间窗口内的投影/残差。残差消除的是选定解释变量的线性部分,不等于消除了所有风险或建立了因果关系。 ## 6. 频率与衰减 短长均值差可以研究不同时间尺度;`x-ts_mean(x,5)` 可作去除缓慢成分的近似,但不等于严格 FFT 分解。来源:[傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造](https://support.worldquantbrain.com/hc/en-us/community/posts/41208709211671)(2026-06-14)。新闻、财报、分析师信号的持续时间应分别估计,不能把社区给出的几天或几十天写成固定生命周期。来源:[【SPC实战】信号衰减5-7天:数据源“时效性”比“全面性”更重要](https://support.worldquantbrain.com/hc/en-us/community/posts/42955680180247)(2026-08-24)。 ## 7. 字段数量、算子数量与独立信息 增加同类字段可能只是叠加相关噪声和缺失。帖子记录了同域克隆失败、跨类别组合更好的样本,但没有证明多类别组合必然有效。来源:[字段堆越多alpha越牛?我替你们试过了,真不是这么回事](https://support.worldquantbrain.com/hc/en-us/community/posts/41908323673111)(2026-07-13)。 保持主字段、方向与覆盖语义后,才讨论删除冗余算子;降低 OpCount 不能靠偷偷改变信号。来源:[【Quant101】OpCount 拯救计划:因子化简](https://support.worldquantbrain.com/hc/en-us/community/posts/41105918774807)(2026-06-10)。详见 [优化流程](../08-alpha-optimization/diagnostic-workflow.md)。