6.7 KiB
专业知识:先理解数据,再构造信号
范围仅为 2026-01-01 起发布的论坛帖子。下文把社区经验转成可检验的问题;算子细节、数据类型和可用权限仍以运行时平台文档为准。
1. 覆盖率至少有三个维度
时间覆盖、每天的股票覆盖和数据新鲜度需要分别检查。dateCoverage 不能告诉你缺失在开头、末端还是中间,也不能证明早期股票数量足够。VECTOR 的“当天存在列表”还可能与“列表中存在有效观测”不同。作者提出的 0.6 等阈值仅是筛选经验,不能写成平台标准。来源:【平台新功能】字段新特征:datecoverage的介绍、应用与勘误。(2026-01-10)。
建议体检输出:每日有效股票数、最长连续缺失、最后有效日期、有效值更新次数、常数比例、各地区覆盖、早中晚三个时期的分布。PnL 走平时先排查字段停更、标准差归零和无持仓,再判断信号衰减。
2. NaN 不是统一的经济事件
短暂采集中断、尚未披露、没有发生事件、不适用、停更,都可能表现为 NaN。短窗回填可能修复断点,也可能把旧事件无限延长;季度数据的前值在下一次披露前是否仍有意义,要由字段定义决定,不能一律判定“该填”或“不该填”。group_backfill 会引入同行信息,已改变信号来源。来源:【字段处理】nan 不是一种:断粮型该填、真缺型别填(GLB/MINVOL1M & IND/TOP500/D1)(2026-07-20)、冷门数据集分享【earnings】(2026-07-24)。
比较原始值、有限回填、事件年龄过滤和同行填充时,必须同时记录覆盖变化。不能将填充后收益改善全部归因于原字段。零值也不能统一替换为缺失。
3. 跨地区迁移需要重新对齐
同字段在 USA、IND、GLB 的覆盖、流动性和可交易股票结构可能差异很大;拼接后可能主要暴露于规模或流动性。GROUP 的数字编码也不能跨地区照搬,应重新查对应关系并对齐日期和 instrument。来源:别盲目全region遍历:同一个字段在USA/IND/GLB覆盖差太多,裸concat直接变size beta(2026-07-15)、通过Labs查看group类型字段的字符串与对应数字id的方法(附部分对应表格)(2026-07-23)。
因此可迁移的是机制假设和诊断流程;字段、窗口、中性化、交易成本及组规模都要重验。shortinterest7 在分享帖中被指出实际归到 model 类,名字并不是充分分类依据。来源:【GLB】冷门数据集分享(2026-07-19)。
4. 比率、差值与派生字段的量纲
比率可消除部分规模影响,但必须先确认分子分母代表什么。利润是期间流量,资产是时点存量;每股量、总额、预测 surprise 和 consensus 也不能仅因名称相近就直接运算。来源:0帧起手的字段构建【传奇耐打王系列三】(2026-05-27)、USA analyst一些具有经济学意义的重组数据字段(2026-03-10)。
对后者主帖的直接检查发现:列表包含同一字段减自身,非缺失位置结果恒为零;另有总额除每股量、预测 surprise 减 consensus 等需要口径核验的组合。故该表只能作为候选草稿,不能整体认定为“具有经济意义的字段库”。负债/资产等比率也未消除全部规模风险。
每个派生字段至少记录:单位、财务期间、发布日期、预测期限、分母近零比例、负值处理和方向假设。log(A)-log(B) 要求正值;A/(A+B) 要检查分母和互补关系。
5. 时序与截面操作不能随意交换
ts_scale 与 z-score 不同;组内排序也不等于线性回归残差。先行业处理再时间归一化,与先时间归一化再行业处理,通常不是同一个信号。来源:行业中性加时序标准化:一个干净的 Alpha 模板(2026-06-02)。
【alpha模板】行业中性化残差信号IND模板(2026-01-14) 标题称残差,但 ts_zscore(A)-ts_zscore(group_neutralize(A,sector)) 是两次不同标准化后的差,不能直接解释为剥离行业后的残差。该差可能包含共同成分;应分别回测两项与差值,辨认收益来源。
通俗易懂,从另一个角度理解一下方法vector_neut(x, y)、ts_vector_neut(x, y, d)、ts_vector_proj(x, y, d)(2026-04-05) 区分横截面投影/残差与单只股票时间窗口内的投影/残差。残差消除的是选定解释变量的线性部分,不等于消除了所有风险或建立了因果关系。
6. 频率与衰减
短长均值差可以研究不同时间尺度;x-ts_mean(x,5) 可作去除缓慢成分的近似,但不等于严格 FFT 分解。来源:傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造(2026-06-14)。新闻、财报、分析师信号的持续时间应分别估计,不能把社区给出的几天或几十天写成固定生命周期。来源:【SPC实战】信号衰减5-7天:数据源“时效性”比“全面性”更重要(2026-08-24)。
7. 字段数量、算子数量与独立信息
增加同类字段可能只是叠加相关噪声和缺失。帖子记录了同域克隆失败、跨类别组合更好的样本,但没有证明多类别组合必然有效。来源:字段堆越多alpha越牛?我替你们试过了,真不是这么回事(2026-07-13)。
保持主字段、方向与覆盖语义后,才讨论删除冗余算子;降低 OpCount 不能靠偷偷改变信号。来源:【Quant101】OpCount 拯救计划:因子化简(2026-06-10)。详见 优化流程。