Files
yuxuanhui 69c19ed25f
Deploy production / deploy (push) Successful in 51s
Refactor project components and workflows
2026-09-20 11:20:51 +08:00

10 KiB
Raw Permalink Blame History

2026 Alpha idea:从单字段到关系型假设

与 已有机制卡 和 数据模板卡 配合阅读。本页是研究候选,不是已回测 Alpha;不收入 2025 年及更早原帖。每个方向至少设置单腿、关系式和不含经济信息的对照。

1. 双字段的关系与角色

今年的系统分类把双字段拆成比率、差值、变化差、残差、领先滞后、期限结构、门控、状态切换和条件分组。真正需要先确定的是 A、B 各自的角色,随后才挑算子。来源:双字段 Alpha 构建(2026-06-11)、【alpha灵感】双字段alpha构建提示次,助力各位60塔(2026-05-13)。

结构 可以研究的问题 首要证伪点
比率 盈利相对投入或估值是否异常 分母本身是否解释全部收益;口径是否匹配
差值 实际与预期、正向与负向信息是否背离 同单位、同期限、同披露时点
残差 相对某经济锚点是否过高/过低 锚点是否遗漏关键风险;估计只能使用过去
变化差 两类信息的修订速度是否不同 数据更新频率是否制造机械差异
领先滞后 信息是否先于价格或另一字段变化 可得时间和 delay,不能使用未来观测
门控 原信号是否只在特定状态有效 门控单独的收益、覆盖与交易频次
分组 同一状态内是否存在条件异常 小组样本量、动态换组引发的换手

组合常数权重可以作为透明基线,但不应通过无限调权来代替经济关系。双稀有事件的共振尤其需要报告有效样本量,低相关可能仅来自稀疏持仓。

2. 同概念的极性配对

用字段 ID 和 description 找到同一数据集内正/负情绪、上调/下调、增加/减少的配对,构造差、占比或对数差。模型不确定时应返回无配对,不能捏造字段。来源:【Alpha灵感】AI搜索字段极性配对,构建低PC因子(附提示词)(2026-04-18)。

实验:分别测试正腿、负腿、总量、净差和归一化净差;检查收益是否仅来自总关注度、公司规模或分母。作者关于低 PC 的经验不是保证,也不意味着各地区都能直接复制。

3. 基本面与分析师字段重构

从经济上可解释的盈利/投入、实际/预测偏差、不同预测期限修订差出发;相近字段只能生成候选。来源:USA analyst一些具有经济学意义的重组数据字段(2026-03-10)、0帧起手的字段构建【传奇耐打王系列三】(2026-05-27)。

先清除同字段相减、重复反向表达式和不匹配量纲,确认每股与总额、流量与存量、surprise 与预测水平。再比较单字段与重构字段。可复用的是“定义经济量→映射字段→核查口径”的方法,不是机械执行原表。

4. 行业内相对位置的时间异常

ts_scale(group_rank(field,industry),30) 研究股票在同行中的相对位置是否处于自身历史高低位。来源:行业中性加时序标准化:一个干净的 Alpha 模板(2026-06-02)。对照原始字段、仅组内排序、仅时序处理;检验窗口改变后是否有稳定区间,并记录行业小组大小。

5. 新闻与回报的关系

nip/news 数据与回报的相关、协方差或回归关系可以作为候选,但必须区分新闻信息与回报本身。来源:【Alpha灵感】使用nip族数据点亮news塔(2026-05-30)。对照纯 returns 结构、滞后新闻、单新闻信号;核查新闻发布时间,否则同时期关系不能解释为预测优势。

6. Earnings 事件与盈利意外

稀疏 earnings 数据可从事件新鲜度、有限回填与滚动聚合研究。来源:【Alpha 模板】Earnings模板分享,低相关性,助你横向点塔(干货满满,不来将会错失一个亿)(2026-05-28)、冷门数据集分享【earnings】(2026-07-24)。滚动均值与回填含义不同,不能作为语义等价替换。

SUE 模板的今年复用案例见 【Alpha灵感】MEA地区靠SUE模板点亮了Fnd(2026-06-12)、【Alpha灵感】全球第一个MEA因子(零PC alpha),我是怎么做出来的?(2026-04-30);后者零 PC 是新地区早期个案,不能据此证明质量。模板若只是盈利水平的均值偏离除标准差,应称平滑标准化偏离,不能自动等同严格的标准化盈利意外。MEA 当前新提交暂停,见 平台更新。

7. 风险字段与新 Universe

ASI/TOP500 的 risk70 模板使用时间操作后按 exchange 中性化。来源:【Alpha 模板】ASI推出新的universes:TOP500,成功点亮Risk Pyramid(2026-04-26)。可检验风险字段在不同交易所是否有相对异常,但新 Universe 早期低相关可能随着池增长消失;需检查是否只是规模、流动性或反转暴露。

8. 分层拼接

根据规模分层,让主信号与补充信号分别处理表现不同的股票群。IND 实例把低 Robust 的主信号和大盘表现较好的信号拼接。作者承认可能过度优化。来源:【Community Leader -因子构造 💎】拯救IND地区Robust universe Sharpe测试不通过的一个新思路(2026-01-08)。

先看资本化分层表现;分别测试两条腿、简单等权和分层组合。若分界点只在单一数值有效,或为了过线才挑边界,应停止扩展。拼接可能改变 dataset 数量和提交类别,不能仅观察总 Sharpe。

9. 多频率信号与 Python 自适应

短长均值差与高频残差可测试多尺度信息,来源:傅里叶变换在 Alpha 开发中的应用:频率域视角下的信号分解与策略构造(2026-06-14)。Python 贝叶斯更新和蒙特卡洛预测见 [Python Alpha 挑战赛] Monte Carlo GBM + 贝叶斯自适应:AI Agent 量化研究工作流实战(2026-06-27):帖子目标指标不能当作已实现成绩,GBM、先验、路径数、窗口和随机种子都需控制。

建议先做确定性的简单模型,再比较自适应版本;若收益只来自额外平滑、缩短窗口或风险暴露变化,不应宣称获得 Python-native 新信息。

10. 当前优先级

已有九月四张卡覆盖 SNR、机构拥挤、Wikipedia 关注和订单流。新补充方向优先选择“极性配对、同行相对位置、明确口径的实际/预测偏差”中你能取得完整数据的少量假设。优先级属于本库研究建议,未实际运行或比较这些方向的收益。

2026-09-18 补充:差分、正交化与类别编码

同源做差不会保证降低 PC

同源信号与噪声对冲(2026-09-15)比较两条弱信号做差和两条强信号做差;后续讨论(2026-09-16)要求拆开两腿验证,但其中“做差一定会让 PC 下降”的说法不成立。数学反例:令 P 与 N 独立且方差相同,A=P+N、B=N,则 A 与 P 的相关系数为 1/√2,而 A−B 与 P 的相关系数为 1。对某些生产池成分,相关性反而会上升。

保留的实验是 A、B、A−B 分别比较收益、成本、覆盖和与已有池的相关性;两腿都弱也不自动证明共享噪声被成功剥离,需要样本外和稳定性证据。周频量价概率正交化案例(2026-09-15)自报 Max Prod Corr 在加入运营效率控制后从 0.6806 升至 0.7068,再加国家中性化降至 0.6681。与指定控制变量正交,不等于与整个生产池低相关;作者还报告覆盖及收益损失,应把这些变化同时列入对照,不将单个检查过线称为新机制成立。

分析师差分先对齐经济口径

analyst10 预期差异帖(2026-09-16)提出近远期预期差、上调与下调差等候选。可取的是同单位、同口径、只改变一个经济维度的配对方式;覆盖人数与预测 surprise 不能直接相减,已表示净修订的字段也不能未经语义核对再机械差分。120 日回填是作者参数,须另外检查数据可得时点、陈旧观测及两腿实际覆盖,不当作字段的通用配置。

类别编号不是有量纲的数值

JPN 另类行业分类协方差帖(2026-09-07,本轮补录)把两套类别整数标签做时间协方差,报告低换手,同时承认解释偏弱和 OS 检查 PENDING。任意置换簇编号可能改变该协方差,而经济分类没有改变,因此不能直接将结果解释为“分类分歧强度”。至少应检验标签重编码不变性,并与基于类别成员关系的一致性度量比较;不同聚类方法也不自动意味着统计独立。本轮没有复现其回测。