docs: add 2026 WorldQuant research knowledge base

This commit is contained in:
yuxuanhui
2026-09-07 20:03:16 +08:00
parent 647621e5ea
commit 25ecd0a6c5
35 changed files with 3182 additions and 0 deletions
@@ -0,0 +1,16 @@
# Alpha idea 候选地图
这里按研究价值排序,不按帖子宣称的 Sharpe 排名。所有方向均需在你的账户、当前字段权限和验证窗口重做,表达式不承诺可直接执行。
| 优先级 | 方向 | 核心问题 | 先读 |
| --- | --- | --- | --- |
| P1 | SNR 标准化 | 收益来自原信号,还是分母的低波暴露? | [机制卡 1](mechanism-cards.md#1-snr基本面偏离的信噪比) |
| P1 | 机构持仓拥挤反转 | 股数变化与市值变化是否混入不同价格暴露? | [机制卡 2](mechanism-cards.md#2-机构持仓聪明钱还是拥挤) |
| P1 | 关注度脉冲 | 关注突增是否带来独立信息,收益是否只在特殊年份? | [机制卡 3](mechanism-cards.md#3-关注度脉冲wikipedia-访问量) |
| P2 | 订单流双频机制 | 信号半衰期是否随流动性变化? | [机制卡 4](mechanism-cards.md#4-订单流攻击性与双频测量) |
| P2 | earnings 稀疏事件 | 回填是否引入过期事件信号? | [数据模板卡](data-template-cards.md) |
| P2 | news/nip 关系型因子 | 捕捉信息反应,还是拟合同期价格关系? | [数据模板卡](data-template-cards.md) |
| P2 | 同数据集极性配对 | 模型能否正确理解语义、单位与互补关系? | [数据模板卡](data-template-cards.md) |
| 历史参考 | IND 差值与 MEA/SUE | 模板数学解释是否成立;地区是否仍开放提交? | [数据模板卡](data-template-cards.md) |
每张卡都应转成 [实验记录](../05-research-practice/experiment-template.md)。优先把假设做简单,再用数据判断哪里需要复杂度。
@@ -0,0 +1,45 @@
# 数据与模板候选
## earnings:稀疏事件信号
`earnings_sent_matrix` 有 `positive_sentiment_probability_3`、`sentiment_weighting_method1` 等原帖示例。模板结构是“有限回填 → 时间序列算子”,可比较事件新鲜度、变化与相对水平。回填 10/252、外层 252 是作者示例,不能无条件搬用。
作者称 2000 多次回测产生 6 个提交;未提供足以独立复现的统一指标,另有约束后表现很低的案例。先核实字段时间覆盖、事件发布日期和持仓集中,再比较不回填/短回填/长回填。切 universe 降相关也可能只是改变风险敞口。
来源:[【Alpha 模板】Earnings模板分享,低相关性,助你横向点塔(干货满满,不来将会错失一个亿)](https://support.worldquantbrain.com/hc/en-us/community/posts/40790666727575)(发帖 2026-05-28,社区经验);[冷门数据集分享【earnings】](https://support.worldquantbrain.com/hc/en-us/community/posts/42187906212247)(发帖 2026-07-24,社区经验)。
## news/nip:信息与市场反应的关系
原帖提出在 EUR D0/D1 对 news18 或其他 nip 字段与 returns 做滚动相关、协方差或回归,再配 FAST 中性化。没有公开统一数值证据,属于可测试思路。
研究问题:同一新闻冲击是否在不同股票中被不同程度吸收?需要核查字段可用时间与 delay,避免同期收益拟合被误写成预测能力。先做滞后关系和反向预测对照,再决定回归形式。
来源:[【Alpha灵感】使用nip族数据点亮news塔](https://support.worldquantbrain.com/hc/en-us/community/posts/40847481080087)(发帖 2026-05-30,社区经验)。
## 同数据集极性配对:适合 AI 做语义检索
让 AI 从真实字段目录找“正/负”“上调/下调”“乐观/悲观”等配对,输出真实字段 ID、单位、配对理由和不确定性。候选结构可为差值、正值条件下的对数差,或分量和为正时的比例。
研究价值是减少同质单字段搜索;但原帖没有具体可独立核验的成功率。AI 的 confidence 不是正确概率。人工核查描述、频率和单位;零分母、负值取对数、重复字段、不同发布时间必须在生成前处理。优先与单独两条腿做消融。
来源:[【Alpha灵感】AI搜索字段极性配对,构建低PC因子(附提示词)](https://support.worldquantbrain.com/hc/en-us/community/posts/39845230299927)(发帖 2026-04-18,社区经验)。
## IND “行业残差”差值:需要先纠正数学解释
帖子给出的结构是 `ts_zscore(A,63) - ts_zscore(group_neutralize(A,sector),63)`。**这个差值不是直接取行业中性残差**;标准化与中性化不交换,差值可能重新提取行业共同成分。
建议比较 A、neutralize(A)、两者标准化结果及上述差值的行业暴露和表现。原帖“泛用性很强”缺少统一数值证据,不应沉淀成固定生产模板。
来源:[【alpha模板】行业中性化残差信号IND模板](https://support.worldquantbrain.com/hc/en-us/community/posts/37669317975959)(发帖 2026-01-14,社区经验)。
## MEA/SUE:保留方法,暂停作为新提交目标
SUE 类方向的可迁移问题是“盈利变化相对于自身历史波动是否异常”。地区变化时要重新核对财务披露节奏、行业覆盖和中性化。MEA 当前暂停新提交,不能因旧帖成功就把恢复预算优先投入该区域。
来源:[【Alpha灵感】MEA地区靠SUE模板点亮了Fnd](https://support.worldquantbrain.com/hc/en-us/community/posts/41162316064023)(发帖 2026-06-12,社区经验);暂停依据:[BRAIN 本周资源更新:课程、答疑、活动及平台更新](https://mail.google.com/mail/#all/1a0602d8dca17e14)(邮件 2026-09-02)。
## 所有模板的共同前置检查
dateCoverage 只是一项元数据,不告诉你缺失发生在哪几年,也不完整表达横截面质量;VECTOR 非空容器也可能没有有效元素。不要把社区的 40%/60%/80% 建议阈值当官方规则。检查逐年、逐区覆盖及事件时点,比固定门槛更重要。
来源:[【平台新功能】字段新特征:datecoverage的介绍、应用与勘误。](https://support.worldquantbrain.com/hc/en-us/community/posts/37581194344215)(发帖 2026-01-10,社区经验)。
@@ -0,0 +1,53 @@
# 四类机制型 Alpha idea
下面的流程是研究伪代码,字段名来自原帖。数值全部是作者自报的样本内/平台结果,不是本次复现;不要用结果最高的版本代替机制验证。
## 1. SNR:基本面偏离的信噪比
**假设**:相同幅度的基本面变化,在历史噪音较小的股票上更有信息。用长期标准化的信号,除以短窗标准化信号的滚动波动,再做组内处理。
原帖字段包括 `enterprise_value`、`fnd6_newqint_ibq`、`fnd31_pfcomtt`。结构为 `ts_zscore(a, long) / ts_std_dev(ts_zscore(a, short), vol_window)`,再按 country/subindustry 等比较组处理。不同字段不能自动沿用同一正负方向。
作者给出 USA/GLB/EUR IS Sharpe 1.83/1.85/2.59,约束后降到 1.10/1.28/2.08;其中一个例子仍有 OS checks pending。说明约束与验证状态比原始最佳数值更有决策价值。
**建议实验**:分别回测分子、倒数分母、二者比值;检查零/近零分母与低波暴露;比较不同年份、成本约束及组内处理。先固定窗口,再看方向和持仓。若只有倒数分母有效,就不应解释成“基本面显著性”。不能把这个比值直接称为统计显著性检验或 t 值。
来源:[【Alpha Idea】不看幅度看"显著性":一个信噪比(SNR)模板在 USA / GLB / EUR 三个市场的因子化尝试](https://support.worldquantbrain.com/hc/en-us/community/posts/43179521660823)(发帖 2026-09-02,社区经验)。
## 2. 机构持仓:聪明钱还是拥挤
**假设**:持仓变化可能先体现信息、后体现拥挤;持续平滑后的加仓可能表现为反转。
数据集 `institutions18`。作者比较 `cur_holding - pre_holding` 与 `cur_mv - vm_erp`;以持仓股数差的平滑负向信号,结合市值分桶后的组内 rank。原帖 GLB/MINVOL1M、Delay1;20–40 日是作者测试范围,不是通用周期。
作者将市值差 20 日版本与股数差比较,APAC Sharpe 从 0.23 改善到 1.23;最终候选 Sharpe 2.78,但分区域表现不对称。这个对照的价值在于区分“持仓行为”与“价格上涨导致持仓市值增加”。
**建议实验**:拆开股数变化、价格变化、持仓水平;双向测试动量/反转;核对真实披露日与修订数据、同一基金持仓重复、地区覆盖。对平滑窗口做有限敏感性分析,不把几十日的结果推广到所有机构资金流。
来源:[【Alpha Idea】机构持仓变化与拥挤反转:institutions18 在 GLB 市场的因子化尝试](https://support.worldquantbrain.com/hc/en-us/community/posts/43151729306647)(发帖 2026-09-01,社区经验)。此帖可从论坛取得,但并未出现在本次匹配到的同名邮件通知中,说明不能只依赖邮箱。
## 3. 关注度脉冲:Wikipedia 访问量
**假设**:短期关注跃升可能早于交易反应;关注度水平容易混入长期知名度。
原帖先聚合 `snt7_all_languages_views`,经有限回填、短窗峰值和平滑、历史强度处理,再去除 `snl27_relpopularity08` 的热门度方向。DEU/TOP500、Delay1,示例使用 SUBINDUSTRY、decay 16。这里保留步骤而不照抄各算子位置参数,避免将帖子写法当成已验证语法。
作者自报 Sharpe 2.04、Fitness 1.92,同时承认约 90% 收益集中在 2021–2022。后者是核心风险,不能被“所有检查通过”掩盖。
**建议实验**:关注水平 vs 脉冲;去除热门度前后;不回填 vs 有限回填;分疫情期/非疫情期;正负事件分解。尝试新闻或搜索热度替代时重新验证覆盖、频率和相关性,不能假设相同窗口通用。
来源:[【Alpha Idea】维基百科关注度的"突压"信号(sent)在德国DEU市场的因子化尝试](https://support.worldquantbrain.com/hc/en-us/community/posts/43179860065303)(发帖 2026-09-02,社区经验)。
## 4. 订单流攻击性与双频测量
**假设**:主动买入信息在流动性高低的股票中以不同速度消化,因此需要快、慢两种测量。
`pv103_ivam_sum` 为主字段,`session_1600to1600_total_traded_volume` 用于比率,`session_1600to1600_market_value` 作为流动性门控。作者在 GBR/TOP700/Delay1 使用短窗比率标准化与长窗绝对量标准化,示例窗口 21/500 日;再以自适应换手整形、行业回填、面板约束组成候选。
作者自报 Sharpe 1.96、Fitness 1.58、Turnover 24.3%、Margin 13.07bp;测试过 500+ 变体。这是复杂搜索后的单数据集案例,阈值 0.28 与窗口不能视为外部证实的最优值。
**建议实验**:单快、单慢、双路由;成交额门控 vs 成交量门控;不同成交成本与不同年份。核对单位和零分母,检查慢分支是否主要暴露于规模,比较参数邻域,保留每一次试验以衡量选择偏差。
**需纠正的解释**:付 spread 不必然代表知情交易;不同数据集也不必然正交。原帖把目标换手 0.15 称为“年化 15%”,本次未取得该算子正式口径,不沿用这个单位断言。回填也不能保证每只股票都有可交易持仓。
来源:[【Alpha Idea】谁在付 Spread?——订单流攻击性、半衰期分层与一个双引擎架构的诞生](https://support.worldquantbrain.com/hc/en-us/community/posts/43181411147287)(发帖 2026-09-02,社区经验)。
@@ -0,0 +1,65 @@
# 2026 Alpha idea:从单字段到关系型假设
与 [已有机制卡](mechanism-cards.md) 和 [数据模板卡](data-template-cards.md) 配合阅读。本页是研究候选,不是已回测 Alpha;不收入 2025 年及更早原帖。每个方向至少设置单腿、关系式和不含经济信息的对照。
## 1. 双字段的关系与角色
今年的系统分类把双字段拆成比率、差值、变化差、残差、领先滞后、期限结构、门控、状态切换和条件分组。真正需要先确定的是 A、B 各自的角色,随后才挑算子。来源:[双字段 Alpha 构建](https://support.worldquantbrain.com/hc/en-us/community/posts/41134957392663)(2026-06-11)、[【alpha灵感】双字段alpha构建提示次,助力各位60塔](https://support.worldquantbrain.com/hc/en-us/community/posts/40433238987159)(2026-05-13)。
| 结构 | 可以研究的问题 | 首要证伪点 |
| --- | --- | --- |
| 比率 | 盈利相对投入或估值是否异常 | 分母本身是否解释全部收益;口径是否匹配 |
| 差值 | 实际与预期、正向与负向信息是否背离 | 同单位、同期限、同披露时点 |
| 残差 | 相对某经济锚点是否过高/过低 | 锚点是否遗漏关键风险;估计只能使用过去 |
| 变化差 | 两类信息的修订速度是否不同 | 数据更新频率是否制造机械差异 |
| 领先滞后 | 信息是否先于价格或另一字段变化 | 可得时间和 delay,不能使用未来观测 |
| 门控 | 原信号是否只在特定状态有效 | 门控单独的收益、覆盖与交易频次 |
| 分组 | 同一状态内是否存在条件异常 | 小组样本量、动态换组引发的换手 |
组合常数权重可以作为透明基线,但不应通过无限调权来代替经济关系。双稀有事件的共振尤其需要报告有效样本量,低相关可能仅来自稀疏持仓。
## 2. 同概念的极性配对
用字段 ID 和 description 找到同一数据集内正/负情绪、上调/下调、增加/减少的配对,构造差、占比或对数差。模型不确定时应返回无配对,不能捏造字段。来源:[【Alpha灵感】AI搜索字段极性配对,构建低PC因子(附提示词)](https://support.worldquantbrain.com/hc/en-us/community/posts/39845230299927)(2026-04-18)。
实验:分别测试正腿、负腿、总量、净差和归一化净差;检查收益是否仅来自总关注度、公司规模或分母。作者关于低 PC 的经验不是保证,也不意味着各地区都能直接复制。
## 3. 基本面与分析师字段重构
从经济上可解释的盈利/投入、实际/预测偏差、不同预测期限修订差出发;相近字段只能生成候选。来源:[USA analyst一些具有经济学意义的重组数据字段](https://support.worldquantbrain.com/hc/en-us/community/posts/38927191768343)(2026-03-10)、[0帧起手的字段构建【传奇耐打王系列三】](https://support.worldquantbrain.com/hc/en-us/community/posts/40760257415959)(2026-05-27)。
先清除同字段相减、重复反向表达式和不匹配量纲,确认每股与总额、流量与存量、surprise 与预测水平。再比较单字段与重构字段。可复用的是“定义经济量→映射字段→核查口径”的方法,不是机械执行原表。
## 4. 行业内相对位置的时间异常
`ts_scale(group_rank(field,industry),30)` 研究股票在同行中的相对位置是否处于自身历史高低位。来源:[行业中性加时序标准化:一个干净的 Alpha 模板](https://support.worldquantbrain.com/hc/en-us/community/posts/40902892248983)(2026-06-02)。对照原始字段、仅组内排序、仅时序处理;检验窗口改变后是否有稳定区间,并记录行业小组大小。
## 5. 新闻与回报的关系
nip/news 数据与回报的相关、协方差或回归关系可以作为候选,但必须区分新闻信息与回报本身。来源:[【Alpha灵感】使用nip族数据点亮news塔](https://support.worldquantbrain.com/hc/en-us/community/posts/40847481080087)(2026-05-30)。对照纯 returns 结构、滞后新闻、单新闻信号;核查新闻发布时间,否则同时期关系不能解释为预测优势。
## 6. Earnings 事件与盈利意外
稀疏 earnings 数据可从事件新鲜度、有限回填与滚动聚合研究。来源:[【Alpha 模板】Earnings模板分享,低相关性,助你横向点塔(干货满满,不来将会错失一个亿)](https://support.worldquantbrain.com/hc/en-us/community/posts/40790666727575)(2026-05-28)、[冷门数据集分享【earnings】](https://support.worldquantbrain.com/hc/en-us/community/posts/42187906212247)(2026-07-24)。滚动均值与回填含义不同,不能作为语义等价替换。
SUE 模板的今年复用案例见 [【Alpha灵感】MEA地区靠SUE模板点亮了Fnd](https://support.worldquantbrain.com/hc/en-us/community/posts/41162316064023)(2026-06-12)、[【Alpha灵感】全球第一个MEA因子(零PC alpha),我是怎么做出来的?](https://support.worldquantbrain.com/hc/en-us/community/posts/40134245568663)(2026-04-30);后者零 PC 是新地区早期个案,不能据此证明质量。模板若只是盈利水平的均值偏离除标准差,应称平滑标准化偏离,不能自动等同严格的标准化盈利意外。MEA 当前新提交暂停,见 [平台更新](../04-platform/current-updates.md)。
## 7. 风险字段与新 Universe
ASI/TOP500 的 risk70 模板使用时间操作后按 exchange 中性化。来源:[【Alpha 模板】ASI推出新的universes:TOP500,成功点亮Risk Pyramid](https://support.worldquantbrain.com/hc/en-us/community/posts/40020159075607)(2026-04-26)。可检验风险字段在不同交易所是否有相对异常,但新 Universe 早期低相关可能随着池增长消失;需检查是否只是规模、流动性或反转暴露。
## 8. 分层拼接
根据规模分层,让主信号与补充信号分别处理表现不同的股票群。IND 实例把低 Robust 的主信号和大盘表现较好的信号拼接。作者承认可能过度优化。来源:[【Community Leader -因子构造 💎】拯救IND地区Robust universe Sharpe测试不通过的一个新思路](https://support.worldquantbrain.com/hc/en-us/community/posts/37525915867671)(2026-01-08)。
先看资本化分层表现;分别测试两条腿、简单等权和分层组合。若分界点只在单一数值有效,或为了过线才挑边界,应停止扩展。拼接可能改变 dataset 数量和提交类别,不能仅观察总 Sharpe。
## 9. 多频率信号与 Python 自适应
短长均值差与高频残差可测试多尺度信息,来源:[傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造](https://support.worldquantbrain.com/hc/en-us/community/posts/41208709211671)(2026-06-14)。Python 贝叶斯更新和蒙特卡洛预测见 [[Python Alpha 挑战赛] Monte Carlo GBM + 贝叶斯自适应:AI Agent 量化研究工作流实战](https://support.worldquantbrain.com/hc/en-us/community/posts/41540700959639)(2026-06-27):帖子目标指标不能当作已实现成绩,GBM、先验、路径数、窗口和随机种子都需控制。
建议先做确定性的简单模型,再比较自适应版本;若收益只来自额外平滑、缩短窗口或风险暴露变化,不应宣称获得 Python-native 新信息。
## 10. 当前优先级
已有九月四张卡覆盖 SNR、机构拥挤、Wikipedia 关注和订单流。新补充方向优先选择“极性配对、同行相对位置、明确口径的实际/预测偏差”中你能取得完整数据的少量假设。优先级属于本库研究建议,未实际运行或比较这些方向的收益。