33 lines
4.2 KiB
Markdown
33 lines
4.2 KiB
Markdown
|
|
# AI 因子挖掘:把研究做成可审阅闭环
|
|||
|
|
|
|||
|
|
优先采用“假设 → 数据核验 → 小批候选 → 回测证据 → 定向修复 → 稳健性/相关性 → 人工裁定”。AI 负责扩展、实现和归纳,经济假设与结果之间必须有可追溯证据。
|
|||
|
|
|
|||
|
|
## 2026 社区方案值得吸收什么
|
|||
|
|
|
|||
|
|
| 来源 | 有用机制 | 不应照搬 |
|
|||
|
|
| --- | --- | --- |
|
|||
|
|
| 5 个 Agent Skill,7 月 28 日 | research/orchestrator/repair/robustness/Labs 分工;预算、失败记录、算子预检 | 28 批 280 次最终只完成 3 个数据集目标中的 1 个,且候选未提交;不能宣传为完整成功流水线 |
|
|||
|
|
| 一二三阶实践,7 月 24 日 | 生成、语法修复、字段过滤、批回测、二轮定向优化 | 1.2/0.8、1.3/1.0 是探索阈值,不是提交门槛;并发和轮数不是账户规则 |
|
|||
|
|
| 频率感知 Seed,6 月 17 日 | 在源头匹配更新频率,分 trend/cycle/reversal 方向 | 66、22−120、10 日为示例,缺独立对照,不是最优参数 |
|
|||
|
|
| 可复盘流程,8 月 6 日 | 理解数据含义,每次改一个主变量,记录失败 | “Skill 无用”是个人观点,与前述流程固化主张有分歧 |
|
|||
|
|
| raw/decision,8 月 2 日 | 完整结果留本地,对话仅按需取关键状态与增量 | 截断表达式不能作唯一标识,空指标不能当通过 |
|
|||
|
|
|
|||
|
|
来源:[【工作流分享】我把整套 BRAIN 挖矿流程写成了 5 个 Agent Skill(含使用教程 + 真实实验记录 + 全套文件打包下载)](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119)(发帖 2026-07-28,社区经验);[浅谈我的一二三阶开发流程----记7.23日新人答疑课](https://support.worldquantbrain.com/hc/en-us/community/posts/42184733027991)(发帖 2026-07-24,社区经验);[频率感知的 Seed 构造 × CW 前置分层诊断 × 多 GEM 降相关:让自动化 Alpha 挖掘在"源头"而非"后处理"解决问题](https://support.worldquantbrain.com/hc/en-us/community/posts/41292678360727)(发帖 2026-06-17,社区经验);[【7月新顾问分享】从盲目试错到建立可复盘的 Alpha ai研究流程。 随着大模型的增强,我个人认为skill是无用之举,并且会限制你的ai去挖掘更多方向](https://support.worldquantbrain.com/hc/en-us/community/posts/42513455206423)(发帖 2026-08-06,社区经验);[【工程优化】Agent 挖 Alpha 时 Token 黑洞:raw 留磁盘,对话只读 decision](https://support.worldquantbrain.com/hc/en-us/community/posts/42406158561943)(发帖 2026-08-02,社区经验)。
|
|||
|
|
|
|||
|
|
## 适合你的最小流程(整理建议)
|
|||
|
|
|
|||
|
|
1. **Research brief**:固定研究问题、地区、数据时点与预算。AI 从真实字段目录中选材,每条候选附来源及反例。
|
|||
|
|
2. **Preflight**:检查字段存在、类型/单位、当前算子可用性、表达式结构、完整 settings、时间泄漏风险和历史重复。
|
|||
|
|
3. **Baseline batch**:基线与消融共享数据/设置;有限变体,生成 manifest 后再执行。不要临时改指标筛选口径。
|
|||
|
|
4. **Evidence capture**:保存输入 hash、simulation ID、alpha ID、原始响应、错误、时间和数据版本;状态用显式枚举。
|
|||
|
|
5. **Repair**:按实际失败原因路由。覆盖差先处理数据,集中度高先拆持仓原因,相关性高先审视同质逻辑,而不是万能加 decay。
|
|||
|
|
6. **Review**:检查分年、子宇宙、成本、稳健性与个人池增量。根据证据决定保留、再实验或停止。
|
|||
|
|
|
|||
|
|
Skill 适合固化数据契约、授权边界、记录和终验关卡;研究方向保持可变。这个取舍是本知识库建议,不是社区共识。应允许 AI 提出新假设,但要求变更有理由、有对照、有预算。
|
|||
|
|
|
|||
|
|
## 给 AI 的研究 brief 示例
|
|||
|
|
|
|||
|
|
> 研究同数据集内语义相反字段之差是否比单字段具有更低相关性。只从给定的真实字段目录选择,返回 ID、含义、单位、更新频率、正负方向依据、基线与消融计划。未知信息写“待核实”。预算先设计 12 个实验,不执行。不要编造字段、把样本内提升当成功,或自行提交 Alpha。
|
|||
|
|
|
|||
|
|
这只是当前知识库中的示例,不安装为全局 Skill 或项目规则。
|