Files
worldquant-alpha-system/docs/worldquant-knowledge-base/01-alpha-ideas/relationship-and-extension-cards.md
T
yuxuanhui 69c19ed25f
Deploy production / deploy (push) Successful in 51s
Refactor project components and workflows
2026-09-20 11:20:51 +08:00

82 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 2026 Alpha idea:从单字段到关系型假设
与 [已有机制卡](mechanism-cards.md) 和 [数据模板卡](data-template-cards.md) 配合阅读。本页是研究候选,不是已回测 Alpha;不收入 2025 年及更早原帖。每个方向至少设置单腿、关系式和不含经济信息的对照。
## 1. 双字段的关系与角色
今年的系统分类把双字段拆成比率、差值、变化差、残差、领先滞后、期限结构、门控、状态切换和条件分组。真正需要先确定的是 A、B 各自的角色,随后才挑算子。来源:[双字段 Alpha 构建](https://support.worldquantbrain.com/hc/en-us/community/posts/41134957392663)(2026-06-11)、[【alpha灵感】双字段alpha构建提示次,助力各位60塔](https://support.worldquantbrain.com/hc/en-us/community/posts/40433238987159)(2026-05-13)。
| 结构 | 可以研究的问题 | 首要证伪点 |
| --- | --- | --- |
| 比率 | 盈利相对投入或估值是否异常 | 分母本身是否解释全部收益;口径是否匹配 |
| 差值 | 实际与预期、正向与负向信息是否背离 | 同单位、同期限、同披露时点 |
| 残差 | 相对某经济锚点是否过高/过低 | 锚点是否遗漏关键风险;估计只能使用过去 |
| 变化差 | 两类信息的修订速度是否不同 | 数据更新频率是否制造机械差异 |
| 领先滞后 | 信息是否先于价格或另一字段变化 | 可得时间和 delay,不能使用未来观测 |
| 门控 | 原信号是否只在特定状态有效 | 门控单独的收益、覆盖与交易频次 |
| 分组 | 同一状态内是否存在条件异常 | 小组样本量、动态换组引发的换手 |
组合常数权重可以作为透明基线,但不应通过无限调权来代替经济关系。双稀有事件的共振尤其需要报告有效样本量,低相关可能仅来自稀疏持仓。
## 2. 同概念的极性配对
用字段 ID 和 description 找到同一数据集内正/负情绪、上调/下调、增加/减少的配对,构造差、占比或对数差。模型不确定时应返回无配对,不能捏造字段。来源:[【Alpha灵感】AI搜索字段极性配对,构建低PC因子(附提示词)](https://support.worldquantbrain.com/hc/en-us/community/posts/39845230299927)(2026-04-18)。
实验:分别测试正腿、负腿、总量、净差和归一化净差;检查收益是否仅来自总关注度、公司规模或分母。作者关于低 PC 的经验不是保证,也不意味着各地区都能直接复制。
## 3. 基本面与分析师字段重构
从经济上可解释的盈利/投入、实际/预测偏差、不同预测期限修订差出发;相近字段只能生成候选。来源:[USA analyst一些具有经济学意义的重组数据字段](https://support.worldquantbrain.com/hc/en-us/community/posts/38927191768343)(2026-03-10)、[0帧起手的字段构建【传奇耐打王系列三】](https://support.worldquantbrain.com/hc/en-us/community/posts/40760257415959)(2026-05-27)。
先清除同字段相减、重复反向表达式和不匹配量纲,确认每股与总额、流量与存量、surprise 与预测水平。再比较单字段与重构字段。可复用的是“定义经济量→映射字段→核查口径”的方法,不是机械执行原表。
## 4. 行业内相对位置的时间异常
`ts_scale(group_rank(field,industry),30)` 研究股票在同行中的相对位置是否处于自身历史高低位。来源:[行业中性加时序标准化:一个干净的 Alpha 模板](https://support.worldquantbrain.com/hc/en-us/community/posts/40902892248983)(2026-06-02)。对照原始字段、仅组内排序、仅时序处理;检验窗口改变后是否有稳定区间,并记录行业小组大小。
## 5. 新闻与回报的关系
nip/news 数据与回报的相关、协方差或回归关系可以作为候选,但必须区分新闻信息与回报本身。来源:[【Alpha灵感】使用nip族数据点亮news塔](https://support.worldquantbrain.com/hc/en-us/community/posts/40847481080087)(2026-05-30)。对照纯 returns 结构、滞后新闻、单新闻信号;核查新闻发布时间,否则同时期关系不能解释为预测优势。
## 6. Earnings 事件与盈利意外
稀疏 earnings 数据可从事件新鲜度、有限回填与滚动聚合研究。来源:[【Alpha 模板】Earnings模板分享,低相关性,助你横向点塔(干货满满,不来将会错失一个亿)](https://support.worldquantbrain.com/hc/en-us/community/posts/40790666727575)(2026-05-28)、[冷门数据集分享【earnings】](https://support.worldquantbrain.com/hc/en-us/community/posts/42187906212247)(2026-07-24)。滚动均值与回填含义不同,不能作为语义等价替换。
SUE 模板的今年复用案例见 [【Alpha灵感】MEA地区靠SUE模板点亮了Fnd](https://support.worldquantbrain.com/hc/en-us/community/posts/41162316064023)(2026-06-12)、[【Alpha灵感】全球第一个MEA因子(零PC alpha),我是怎么做出来的?](https://support.worldquantbrain.com/hc/en-us/community/posts/40134245568663)(2026-04-30);后者零 PC 是新地区早期个案,不能据此证明质量。模板若只是盈利水平的均值偏离除标准差,应称平滑标准化偏离,不能自动等同严格的标准化盈利意外。MEA 当前新提交暂停,见 [平台更新](../04-platform/current-updates.md)。
## 7. 风险字段与新 Universe
ASI/TOP500 的 risk70 模板使用时间操作后按 exchange 中性化。来源:[【Alpha 模板】ASI推出新的universes:TOP500,成功点亮Risk Pyramid](https://support.worldquantbrain.com/hc/en-us/community/posts/40020159075607)(2026-04-26)。可检验风险字段在不同交易所是否有相对异常,但新 Universe 早期低相关可能随着池增长消失;需检查是否只是规模、流动性或反转暴露。
## 8. 分层拼接
根据规模分层,让主信号与补充信号分别处理表现不同的股票群。IND 实例把低 Robust 的主信号和大盘表现较好的信号拼接。作者承认可能过度优化。来源:[【Community Leader -因子构造 💎】拯救IND地区Robust universe Sharpe测试不通过的一个新思路](https://support.worldquantbrain.com/hc/en-us/community/posts/37525915867671)(2026-01-08)。
先看资本化分层表现;分别测试两条腿、简单等权和分层组合。若分界点只在单一数值有效,或为了过线才挑边界,应停止扩展。拼接可能改变 dataset 数量和提交类别,不能仅观察总 Sharpe。
## 9. 多频率信号与 Python 自适应
短长均值差与高频残差可测试多尺度信息,来源:[傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造](https://support.worldquantbrain.com/hc/en-us/community/posts/41208709211671)(2026-06-14)。Python 贝叶斯更新和蒙特卡洛预测见 [[Python Alpha 挑战赛] Monte Carlo GBM + 贝叶斯自适应:AI Agent 量化研究工作流实战](https://support.worldquantbrain.com/hc/en-us/community/posts/41540700959639)(2026-06-27):帖子目标指标不能当作已实现成绩,GBM、先验、路径数、窗口和随机种子都需控制。
建议先做确定性的简单模型,再比较自适应版本;若收益只来自额外平滑、缩短窗口或风险暴露变化,不应宣称获得 Python-native 新信息。
## 10. 当前优先级
已有九月四张卡覆盖 SNR、机构拥挤、Wikipedia 关注和订单流。新补充方向优先选择“极性配对、同行相对位置、明确口径的实际/预测偏差”中你能取得完整数据的少量假设。优先级属于本库研究建议,未实际运行或比较这些方向的收益。
## 2026-09-18 补充:差分、正交化与类别编码
### 同源做差不会保证降低 PC
[同源信号与噪声对冲](https://support.worldquantbrain.com/hc/en-us/community/posts/43501264459799)(2026-09-15)比较两条弱信号做差和两条强信号做差;[后续讨论](https://support.worldquantbrain.com/hc/en-us/community/posts/43536370604567)(2026-09-16)要求拆开两腿验证,但其中“做差一定会让 PC 下降”的说法不成立。数学反例:令 P 与 N 独立且方差相同,A=P+N、B=N,则 A 与 P 的相关系数为 1/√2,而 A−B 与 P 的相关系数为 1。对某些生产池成分,相关性反而会上升。
保留的实验是 A、B、A−B 分别比较收益、成本、覆盖和与已有池的相关性;两腿都弱也不自动证明共享噪声被成功剥离,需要样本外和稳定性证据。[周频量价概率正交化案例](https://support.worldquantbrain.com/hc/en-us/community/posts/43500671638551)(2026-09-15)自报 Max Prod Corr 在加入运营效率控制后从 0.6806 升至 0.7068,再加国家中性化降至 0.6681。与指定控制变量正交,不等于与整个生产池低相关;作者还报告覆盖及收益损失,应把这些变化同时列入对照,不将单个检查过线称为新机制成立。
### 分析师差分先对齐经济口径
[analyst10 预期差异帖](https://support.worldquantbrain.com/hc/en-us/community/posts/43524498271895)(2026-09-16)提出近远期预期差、上调与下调差等候选。可取的是同单位、同口径、只改变一个经济维度的配对方式;覆盖人数与预测 surprise 不能直接相减,已表示净修订的字段也不能未经语义核对再机械差分。120 日回填是作者参数,须另外检查数据可得时点、陈旧观测及两腿实际覆盖,不当作字段的通用配置。
### 类别编号不是有量纲的数值
[JPN 另类行业分类协方差帖](https://support.worldquantbrain.com/hc/en-us/community/posts/43308165478935)(2026-09-07,本轮补录)把两套类别整数标签做时间协方差,报告低换手,同时承认解释偏弱和 OS 检查 PENDING。任意置换簇编号可能改变该协方差,而经济分类没有改变,因此不能直接将结果解释为“分类分歧强度”。至少应检验标签重编码不变性,并与基于类别成员关系的一致性度量比较;不同聚类方法也不自动意味着统计独立。本轮没有复现其回测。