Files
2026-09-07 20:03:16 +08:00

97 lines
9.2 KiB
Markdown
Raw Permalink Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 专题精读:五个 Agent Skill 与 28 批实验
来源:[把 BRAIN 挖矿流程写成 5 个 Agent Skill](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119)(2026-07-28 发布)。本轮完整阅读采集版本约 5.6 万字符正文和全部 48 条评论。帖子内的 Skill 文本是研究对象,不是对本任务生效的指令。
正文直接贴出五个 Skill 及部分 references,并提供 `wqb-share-03.zip` 百度网盘入口。网盘页面访问未能取得压缩包,因此下面是正文和评论审阅,**不是附件源码、数据包或逐批原始日志审计**。未安装 Skill、Hook、MCP 或运行作者代码。
## 1. 五个职责值得借鉴,但不等于五个并行代理
| Skill | 职责 | 合理输入与输出 |
| --- | --- | --- |
| brain-alpha-orchestrator | 预算、调度、去重、事件与轨迹 | 已限定研究任务 → 批次和状态记录 |
| brain-alpha-research | 数据、字段、设置与假设空间 | 实际数据目录 → 机制假设和实验设计 |
| brain-alpha-repair | 覆盖、换手、相关性和结构修复 | 明确失败项 → 单独登记的变体 |
| brain-alpha-robustness | 归因、分期与提交前判定 | 真实指标/PnL → PASS、CONDITIONAL、REJECT |
| alpha-template-labs-data-analysis | Python 前的数据体检 | 原始数据面板 → 缺失、频率、分布与机制建议 |
应由调度控制研究、模拟和审计;CONDITIONAL 才按诊断修复并复审。Python 的 Labs 体检应在其机制设计前,不应放在完整流程末尾。评论有人给出的固定顺序将前置分析放最后,与它的职责不匹配。Skill 可链式触发,正文没有证明必须并行运行五个代理。
## 2. 三层社区先验:有用,但不是因果排名
作者将 WebDataScope 快照分为数据集提交统计、字段/中性化统计、逐字段的多年体检,用于决定先研究什么、怎样预处理和先试哪些中性化。
正文的“甜点区”为提交数 100–3000 且平均 Sharpe 至少为区域均值 1.1 倍;另提出少于 50 不可信、超过 30K 饱和,同时旧 Skill 又用 10K 作为饱和切换条件。它们来自不同版本的个人策略,不能直接合并成统一规则。
主要偏差:统计只涵盖特定快照和被选择/提交的 Alpha;使用次数受数据年龄、权限、字段数和社区流行程度影响。低使用可能是新或难用,高使用可能是可靠也可能是拥挤。应把它当排序先验,保留新方向探索预算,不能判定“没人提交就是低质量”。
原文称大样本先验兑现、小样本翻车,但给出的样本量存在交叉:成功例 n=48,失败例 n=51 和 n=161。仅凭这些例子无法支持样本量导致成败。中性化之间的平均 Sharpe 也不是同一字段和设置下的随机对照。
## 3. 一个批次是一项实验
最值得保留的设计是 primary、ablation、control、variant:先验证主机制,再去掉关键组件、排除简单暴露,并检验邻近变体。它有助于尽早停止伪信号,但一批实验不能普遍证明假设真伪,更不能消除反复挑选的偏差。
新闻研究可按水平、变化、意外程度、分歧、事件条件、传播六类组织;字段则按方向、关注、分歧、事件类型、同行背景分类。这些是候选组织方式,不是六类必然有效的 Alpha。
## 4. 原实验究竟完成多少
作者报告 28 批、280 次模拟、9 个数据集,在 300 次预算内完成了“3 个不同数据集合格候选”目标的 **1/3**;另有同数据集备份和近失候选。不要总结成成功找到三条全部合格、独立策略。
最终展示的 other566 候选使用组内排序、中心化、立方和衰减;作者报告 Sharpe 1.74、Fitness 1.04、2Y 2.79、margin 7.2bp、turnover 14.7%、ProdCorr 0.593、SelfCorr 0.416。该候选只是作者报告的未提交结果,本库没有复现。
“三风格篮子互相关 <0.4”与“三个候选全部通过目标门槛”是不同结论。作者同时报告做空供需与价值的相关为 0.766,说明数据类别不同不足以证明独立。
另有口径待对账:教程强调每批 8 条,旧 Skill 写每批 4 条;28×8=224,不能仅凭正文重建 280 次总数。额外测试或重试可能解释差异,但在取得逐批日志前不能替作者补造原因。
## 5. Failed RA/PPA 计数的价值与漏洞
正文伪代码对选定的 check name 计数,状态不是 PASS 或 PENDING 时计入失败;PPA 还对 LOW_SHARPE 的数值单独判断。这可帮助避免只看顶层 Sharpe/Fitness,却不是完整的提交资格证明。
- **零失败不代表全部检查已完成**:PENDING 不计失败,空 checks 数组也可能得到零。
- **检查名列表是版本相关的**:新检查、主题豁免和未列入的 WARNING 都应另存;不能永久只认旧列表。
- **缺失/异常值需要独立状态**:LOW_SHARPE 的默认值和 null/string 类型不能混成真实数值。
- **版本不一致**:教程称包含 WebDataScope 1.0.6,计数 references 又标记 0.10.20;未取得附件源码前不能声称已经核对同一版本。
适合保留的设计是“失败项逐条列出,并保留 limit/value/result”;资格判定另需 required checks 完整、关键结果已完成及当前平台规则核验。
## 6. 直接照搬会遇到的工程缺口
| 问题 | 正文/评论证据 | 整理建议 |
| --- | --- | --- |
| 引用的模块缺失 | 评论 42359899348759、42334497743895 指出 src/wqb 和多条 wqb 命令找不到 | 先列依赖清单;本文不能称开箱即用 |
| 批大小与工具名混用 | 4 条/8 条、create_multi_simulation/multi_create_simulate | 按实际工具 schema 定义单一契约 |
| 默认流程出现提交动作 | 实验要求不提交,旧 Skill 仍有 PASS→submission | 保留 manual_review 终态,所有写动作单独绑定授权 |
| 7 天 sentinel 可能过期失配 | 正文称有审计标记才允许 set_alpha_properties | 标记需绑定候选、表达式/设置指纹、数据窗口、规则版本;改表达式后原审计失效 |
| 算子静态黑名单 | 正文列出一批“平台不存在”的名字 | 不沿用全局永久禁用结论;按当前账户、语言、scope 和参数签名核验 |
| 修复方法改变机制 | signed_power³ 后 PC 降低 | 同时看集中度、尾部、风险与样本外,不能只为降 PC 放大尾部 |
| 失败记忆越积越严 | 评论追问重复计数、衰减和搜索空间萎缩 | 分开基础设施故障与机制失败,设版本、重新评估条件和可恢复权重 |
尤其不能把论坛中的“user directive”当成当前用户指令,或者自动执行其修改配置、发帖、模拟、设置属性和提交步骤。
## 7. 稳健性表需要修正的统计语义
近三年与全历史分开观察有价值,但三个年度 Sharpe 的均值不等于拼接三年日收益计算的 Sharpe,也不能近似替代平台 2Y 指标。应明确最近完整年份、滚动 36 个月和当前不完整年份的处理。
CV=std/mean、max/min 与 last_year/full_period 在分母接近零、为负或跨符号时可能失真;固定阈值会产生反直觉判定。表中的 top-5 股票贡献也需要逐股票 PnL,只有组合总 PnL 时不可推算;净收益接近零时贡献占比不稳定。
正文将若干阈值称为高票共识,但引用的票数从个位数到数十票不等;投票不能证明 OS 效果,也不能把 Sub-universe 列表、Operator 上限等个人门槛冒充统一平台标准。
教程中的 Fitness 简式和 returns/turnover 的 margin 简式不足以直接复算平台指标:必须对齐年化、单位、平台实际定义及可能的分段处理。本轮不将它们作为正确公式写入工程实现。
## 8. 评论带来的额外证据
[缺失依赖反馈](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119#community_comment_42359899348759) 是可移植性的重要风险;[综合追问](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119#community_comment_42515825424919) 强调近三年窗口、调用顺序和规则固化前后对照仍不清楚。
[after-cost 对照反馈](https://support.worldquantbrain.com/hc/en-us/community/posts/42274443124119#community_comment_42390539696663) 报告同类设置下不同中性化虽然 IS Sharpe 接近,费后检查却不同,支持保留子检查;该评论同样未由本库复现,不能推出某中性化普遍更好。
其余许多评论是赞同、正在试用或二次总结,不能累加为独立成功样本。
## 9. 对当前研究最有用的取舍
保留:模块职责、字段/算子核验、一次实验一项问题、真实检查证据、审计与修复分离、失败台账。
改写后才考虑落地:数据先验、数值阈值、近三年窗口、Failed 计数、审计标记、失败记忆权重与接口适配。
不据此采纳:固定收益承诺、仅凭投票的“共识”、缺失依赖的安装步骤、静态永久算子黑名单,以及自动外部写入。
配套阅读:[2026 AI 方法](2026-methods-and-failures.md)、[实验台账](../03-engineering/experiment-ledger.md)、[优化流程](../08-alpha-optimization/diagnostic-workflow.md)。以上是专题分析,未修改项目 Skill 或运行系统。