Files
worldquant-alpha-system/docs/worldquant-knowledge-base/02-ai-mining/research-workflow.md
T
2026-09-07 20:03:16 +08:00

33 lines
4.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# AI 因子挖掘:把研究做成可审阅闭环
优先采用“假设 → 数据核验 → 小批候选 → 回测证据 → 定向修复 → 稳健性/相关性 → 人工裁定”。AI 负责扩展、实现和归纳,经济假设与结果之间必须有可追溯证据。
## 2026 社区方案值得吸收什么
| 来源 | 有用机制 | 不应照搬 |
| --- | --- | --- |
| 5 个 Agent Skill,7 月 28 日 | research/orchestrator/repair/robustness/Labs 分工;预算、失败记录、算子预检 | 28 批 280 次最终只完成 3 个数据集目标中的 1 个,且候选未提交;不能宣传为完整成功流水线 |
| 一二三阶实践,7 月 24 日 | 生成、语法修复、字段过滤、批回测、二轮定向优化 | 1.2/0.8、1.3/1.0 是探索阈值,不是提交门槛;并发和轮数不是账户规则 |
| 频率感知 Seed,6 月 17 日 | 在源头匹配更新频率,分 trend/cycle/reversal 方向 | 66、22−120、10 日为示例,缺独立对照,不是最优参数 |
| 可复盘流程,8 月 6 日 | 理解数据含义,每次改一个主变量,记录失败 | “Skill 无用”是个人观点,与前述流程固化主张有分歧 |
| raw/decision,8 月 2 日 | 完整结果留本地,对话仅按需取关键状态与增量 | 截断表达式不能作唯一标识,空指标不能当通过 |
来源:[【工作流分享】我把整套 BRAIN 挖矿流程写成了 5 个 Agent Skill(含使用教程 + 真实实验记录 + 全套文件打包下载)](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119)(发帖 2026-07-28,社区经验);[浅谈我的一二三阶开发流程----记7.23日新人答疑课](https://support.worldquantbrain.com/hc/en-us/community/posts/42184733027991)(发帖 2026-07-24,社区经验);[频率感知的 Seed 构造 × CW 前置分层诊断 × 多 GEM 降相关:让自动化 Alpha 挖掘在"源头"而非"后处理"解决问题](https://support.worldquantbrain.com/hc/en-us/community/posts/41292678360727)(发帖 2026-06-17,社区经验);[【7月新顾问分享】从盲目试错到建立可复盘的 Alpha ai研究流程。 随着大模型的增强,我个人认为skill是无用之举,并且会限制你的ai去挖掘更多方向](https://support.worldquantbrain.com/hc/en-us/community/posts/42513455206423)(发帖 2026-08-06,社区经验);[【工程优化】Agent 挖 Alpha 时 Token 黑洞:raw 留磁盘,对话只读 decision](https://support.worldquantbrain.com/hc/en-us/community/posts/42406158561943)(发帖 2026-08-02,社区经验)。
## 适合你的最小流程(整理建议)
1. **Research brief**:固定研究问题、地区、数据时点与预算。AI 从真实字段目录中选材,每条候选附来源及反例。
2. **Preflight**:检查字段存在、类型/单位、当前算子可用性、表达式结构、完整 settings、时间泄漏风险和历史重复。
3. **Baseline batch**:基线与消融共享数据/设置;有限变体,生成 manifest 后再执行。不要临时改指标筛选口径。
4. **Evidence capture**:保存输入 hash、simulation ID、alpha ID、原始响应、错误、时间和数据版本;状态用显式枚举。
5. **Repair**:按实际失败原因路由。覆盖差先处理数据,集中度高先拆持仓原因,相关性高先审视同质逻辑,而不是万能加 decay。
6. **Review**:检查分年、子宇宙、成本、稳健性与个人池增量。根据证据决定保留、再实验或停止。
Skill 适合固化数据契约、授权边界、记录和终验关卡;研究方向保持可变。这个取舍是本知识库建议,不是社区共识。应允许 AI 提出新假设,但要求变更有理由、有对照、有预算。
## 给 AI 的研究 brief 示例
> 研究同数据集内语义相反字段之差是否比单字段具有更低相关性。只从给定的真实字段目录选择,返回 ID、含义、单位、更新频率、正负方向依据、基线与消融计划。未知信息写“待核实”。预算先设计 12 个实验,不执行。不要编造字段、把样本内提升当成功,或自行提交 Alpha。
这只是当前知识库中的示例,不安装为全局 Skill 或项目规则。