你找到了一个指标。回测很漂亮:过去五年,它每次发出信号之后平均涨 3%。
你上手做了二十笔,净结果是负的。
指标没坏,回测也没造假。问题出在一个你没问的问题上:如果这个规律这么好用,为什么它还在那里等着你?
前六篇讲的是机制和数学:确定的、可查证的、不会过期的东西。它们决定你能不能留在牌桌上,但它们本身不产生任何收益。这一篇处理另一半问题:收益从哪里来。
需要先承认一件事:这一篇不可能给你一个优势。真有效的信号一旦被公开就开始被套利掉——这不是谦虚,是第五节要用数据说明的一个可测量的现象。这一篇能做的是别的三件事:
- 把「优势」这个词拆成四个具体的来源,看看你现实中能拿到哪个
- 梳理哪些规律有像样的证据,哪些没有,以及有证据的那些衰减得多快
- 给一套检验方法,让你能判断自己手上的想法是真信号还是噪声
本文仅用于记录和普及基础知识,不构成投资建议。文中提到的任何指标、异象或策略都不是推荐。
一、有效市场假说:约束条件,不是判决
任何关于「我能通过分析跑赢市场」的想法,都要先面对这个理论。
Eugene Fama 提出的有效市场假说(EMH)有三种强度:
| 形式 | 主张 | 如果成立,则无效的方法 |
|---|---|---|
| 弱式 | 价格已反映全部历史价格信息 | 技术分析 |
| 半强式 | 价格已反映全部公开信息 | 技术分析 + 基本面分析 |
| 强式 | 价格已反映全部信息(含内幕) | 一切方法 |
现在的主流认识大致是:强式基本被否定(内幕交易确实能赚钱,这也是它违法的原因);弱式和半强式在流动性好的大市场里近似成立,但存在可测量的偏离。
一个更有用的替代框架是 Andrew Lo 提出的适应性市场假说:市场效率不是一个是非题,而是随参与者结构、资本量和竞争程度动态变化的。一个策略可以在某段时期有效、在资本涌入后失效、在参与者退出后重新有效。
这个框架的实际含义:
打个比方
把「优势」想成地上掉的钱。
一条每天有十万人走过的大街,地上不太可能有钱躺着——不是因为没人掉钱,是因为掉了几秒钟内就被捡走了。而一条没什么人走的小巷,钱可能在那儿躺一整天。
这个比方能一次说清好几件事:
为什么大盘股上很难有优势 那条街上人太多了
为什么小市值标的上更可能有 那条巷子没人走
为什么公开的优势会衰减 你把巷子的位置发到网上了
为什么优势会"复活" 人走光之后,钱又开始能躺住了
⭐ 所以问题不是「市场有效吗」,而是「在这个具体的角落里,现在有多少聪明的钱在做同一件事」。
⚠️ 但这个比方还有一半,很多人只记住了前一半:没人走的巷子,通常有没人走的理由。 那里可能流动性极差(你捡得起来但换不成钱)、可能信息不透明(你看到的"钱"是假的)、可能干脆是个陷阱。天下没有免费的午餐,也没有免费的低效率。
在苹果公司的股票上,你面对的是全世界数千名全职分析师和无数台低延迟服务器。在一个市值很小、无人覆盖的标的上,信息优势更可能存在——但那里的流动性风险和欺诈风险也高得多。
天下没有免费的午餐,也没有免费的低效率。
二、优势的四个来源,以及你现实中能拿到哪个
「优势(edge)」不是一个笼统的褒义词。它只有四种具体形态。
来源一:信息优势
你知道别人不知道的事。
- 合法路径:一手调研、专有数据集(信用卡消费流水、卫星图像、招聘数据)、行业内的专业背景
- 现实约束:内幕信息交易违法;另类数据集的年费通常在数万到数十万美元量级,是机构的游戏
- 散户可得性:⭐☆☆☆☆ 除非你的职业本身就在某个行业深处,且必须小心合规边界
来源二:分析优势
大家看同样的信息,你解读得更好。
- 现实约束:在有大量分析师覆盖的大盘股上,这几乎不存在。在无人覆盖的小市值公司、复杂的资本结构、分拆重组等特殊情形中,它更可能存在
- 代价:需要投入的时间是全职级别的
- 散户可得性:⭐☆☆☆ 理论上可得,但需要真实的深度工作,且回报高度集中在你能覆盖的极少数标的上
来源三:速度优势
你比别人先做出反应。
- 现实:这是高频交易公司的战场,竞争尺度是微秒。他们花钱买交易所机房里离撮合引擎更近的机柜位置
- 散户可得性:☆☆☆☆ 不要在这个维度上竞争。 你的网络延迟比他们慢几个数量级
来源四:行为与结构优势
这是散户唯一有真实优势的维度,而且它经常被低估。
⚠️ 被低估的原因值得说一句:前三种优势听起来都像"能力"——知道得更多、算得更准、跑得更快,符合人们对"高手"的想象。而这一种听起来像"什么都不做",一点都不性感。
但回到上面那个比方:你的优势不是眼力更好,是你可以在巷子口站三年。而机构不能——他们每个季度都要向人解释自己为什么还站在这儿。
机构受到的约束,你没有:
| 机构的约束 | 你的自由 |
|---|---|
| 季度/年度业绩考核,跑输就有职业风险 | 可以承受三年跑输而不用向任何人解释 |
| 客户在低点赎回,被迫在最差时点卖出 | 没有赎回压力,只要不用杠杆 |
| 规模太大,小市值和小流动性池子进不去 | 规模小是优势,能玩的角落更多 |
| 必须持续持仓(现金拖累业绩) | 可以长期空仓,不交易也是一种仓位 |
| 需要跟踪基准,不能偏离太远 | 不需要跟任何指数比较 |
同时,行为纪律本身就是优势的一种:在第一篇引用的研究里,绝大多数散户的亏损不是因为分析错误,而是因为换手过高、追涨杀跌、在恐慌时卖出。不做这些事,就已经领先了群体的平均水平。
一个诚实的推论
对绝大多数人,可实现的优势排序是:
行为与结构优势 >> 分析优势 > 信息优势 > 速度优势
↑ ↑
唯一可靠的 不要去碰
如果你说不清自己的优势属于哪一类,那默认答案是:没有优势。这时最合理的做法不是更努力地找信号,而是降低换手率、降低成本、拉长持有期——把唯一真实的那项优势用满。
第 46 篇把这一段展开成了一整篇,并给出两条这里没说的性质:它是全手册唯一「公开也不衰减」的优势(因为它不是信息差,无法被套利);以及它必须被拆成加数项(成本、频率、不被迫出场、税——即使你毫无优势也成立)和乘数项(一致执行——⚠️ 作用在负数上仍是负数)。
三、基本面分析
股票:它在回答什么
基本面分析试图估算一家公司的内在价值,然后与市场价格比较。
核心材料是财务报表(美股公司需向 SEC 提交 10-K 年报和 10-Q 季报,可在 EDGAR 免费查阅原文):
- 利润表:收入、成本、利润 —— 赚不赚钱
- 资产负债表:资产、负债、股东权益 —— 家底和杠杆
- 现金流量表:经营/投资/融资现金流 —— 钱是不是真的进来了
第三张表值得特别注意。利润受会计政策影响的空间比现金大得多,长期的「有利润但没有经营现金流」是一个值得追问的信号。
常用指标及其局限:
| 指标 | 含义 | 局限 |
|---|---|---|
| P/E | 市盈率 | 亏损公司无意义;周期股在盈利高点 P/E 最低 |
| P/B | 市净率 | 对轻资产公司参考价值低(见第五节的价值因子讨论) |
| EV/EBITDA | 含债务的估值 | EBITDA 忽略了真实的资本开支 |
| 自由现金流 | 可自由支配的现金 | 高增长期可能为负但不代表差 |
| ROE | 净资产收益率 | 可以靠加杠杆做高 |
| 毛利率/毛利资产比 | 盈利能力 | 见第五节的质量因子 |
| 负债率 | 财务杠杆 | 行业间不可比 |
没有任何单一指标可以用来筛选。 低 P/E 可能是便宜,也可能是市场正确地预期了盈利下滑——这被称为价值陷阱。
会计红旗:可检查的清单
上面说「现金流量表最难粉饰」,这里把它展开成可以逐项核对的东西。
这些不是造假的证据,它们是需要解释的异常——找不到合理解释时,才成为问题。
数字层面
| 红旗 | 为什么值得追问 |
|---|---|
| 应收账款增速持续超过收入增速 | 可能是激进确认收入,或向渠道压货 |
| 存货增速持续超过收入增速 | 可能是滞销,未来面临减值 |
| 经营现金流长期低于净利润 | 利润没有变成现金 |
| 毛利率显著高于同业且无机制解释 | 需要能说清楚优势来自哪里 |
| 每年都出现的「一次性」费用 | 一次性项目连续出现,就不是一次性的 |
| 收入确认政策与同业不同 | 可比性问题,也可能是选择的结果 |
第三行有学术支撑:Sloan(1996)记录了应计项目异象——利润中由应计(而非现金)构成的比例越高,公司后续的股价表现越差。这是把「现金流比利润重要」这句话变成可测量指标的经典工作。
治理与披露层面
这一类往往比数字更值得警惕,因为它们更难被粉饰:
- 🚩 审计师变更,尤其是从大所换到小所
- 🚩 财报延迟提交(美股会有 NT 10-K / NT 10-Q 备案,公开可查)
- 🚩 业绩重述(restatement)
- 🚩 披露内部控制存在重大缺陷
- 🚩 CFO 频繁更换
- 🚩 大量关联方交易
- 🚩 公司结构异常复杂、存在大量表外实体
以上项目在美股都要向 SEC 备案,可在 EDGAR 检索。
怎么用
这份清单的正确用法是排除,不是选股。它回答的是「这家公司是否存在需要解释的异常」,而不是「这家公司会不会涨」。
按第二节的框架,认真做这件事属于分析优势——它需要真实的时间投入,回报也集中在少数标的上。但它有一个特点:它排除掉的是尾部风险,而尾部风险不需要预测能力就能规避。
加密资产:基本面是什么
这是一个更困难的问题,因为多数代币不产生现金流,传统估值方法无处着力。
可以考察的维度:
- 代币经济学(Tokenomics):总供应、流通供应、通胀率、销毁机制
- 解锁计划(Vesting):⚠️ 这是最容易被忽略、影响最直接的一项。 团队和早期投资者的代币在何时解锁、解锁多少。大额解锁带来持续的、可预期的卖压。而「可预期」意味着这是少数不需要预测能力就能观察到的因素
- 持币集中度:前若干地址持有多少比例。高度集中意味着少数地址的行为可以决定价格
- 真实收入:协议是否有实际的手续费收入,收入是否流向代币持有者
- 实际使用:活跃地址、交易笔数——注意这些指标可以被低成本地伪造(自己给自己转账)
关于 **TVL(总锁仓价值)**要特别注意:它是被引用最多、也最容易误导的指标。TVL 会因为币价上涨而自动上涨(同样数量的币,价值更高),可以通过循环借贷被重复计算,还可以靠短期高额补贴买来。TVL 上升不等于协议在变好。
一个诚实的说法是:加密资产的估值缺少公认的框架。多数所谓的估值模型是在为已有的价格寻找理由。
四、技术分析:按证据强度分层
技术分析假设价格走势中包含可利用的信息。这个领域的说法很多,但证据质量差异极大,值得分层来看。
⭐ 这一节给的是分层;完整的地图(十二类工具、按信息含量重排、以及为什么证据强度恰好按自由度排序)在第 34 篇。那一篇还给了一个框架来解释本节的分歧:测量 / 纪律 / 预测是三种用途,同一个工具在三格里的可靠性差一个数量级。
有相对较好研究支持的
动量效应、波动率聚集——这两项证据较强,放在下一节和市场异象一起详细展开。
成交量与流动性。前面几篇讲的订单簿深度、价差,是可观察且有直接因果机制的。这不是预测,是现状的测量。
证据混杂的
支撑与阻力。存在部分自我实现的机制:很多人在同一个整数关口或前高附近下单,这确实会造成订单簇集。但「哪条线是有效的支撑」在事后总能找到,在事前难以确定。
趋势跟随。作为一类策略,趋势跟随(尤其在期货和商品上)有较长的实盘业绩记录,也有学术研究支持。但它的典型特征是低胜率、高盈亏比、长期横盘中持续小亏——多数人心理上执行不了。这恰好呼应第二节:它的优势与其说来自信号,不如说来自能坚持执行信号的能力。
⭐ 这些特征不是巧合,而是「亏损截断 + 盈利放任」这条规则的必然推论——它产生的是一个凸的收益结构,横盘期的小亏就是权利金。完整拆解见第 30 篇,那里还有一个更硬的约束:单品种上你可能永远拿不到统计显著性。
基本没有稳健证据的
大部分振荡指标的固定参数用法。RSI 超过 70 就超买、跌破 30 就超卖,MACD 金叉买入死叉卖出——这类规则在样本外测试中很少表现出稳定的正期望值。它们的参数(14 日、12/26/9)是历史沿袭,没有理论依据。
需要说明的是:这不代表看这些指标的人都在亏钱。一个交易者可能用 RSI 作为构建纪律的工具,而他真正的优势来自仓位管理和情绪控制。但把指标本身当作预测来源,缺乏证据支持。
复杂形态与画线体系。头肩顶、各类波浪计数、斐波那契目标位等,共同的问题是事后可识别、事前不可证伪。如果一个方法在走势发生后总能解释、但在发生前给不出可验证的判断,它就不是一个可检验的方法。
一个中立的定位
技术分析最扎实的用途,是确定止损应该放在哪里——一个结构上有意义、被击穿就说明判断错了的位置。
这个用途不依赖预测能力,而且它直接服务于第六篇的仓位公式。
五、有较强证据的市场异象
「异象(anomaly)」指的是无法被标准资产定价模型解释的、系统性的超额收益模式。下面几个是学术界研究最充分、重复验证最多的。
读之前请先记住:这些全部是「组合层面的统计规律」,不是对单只标的的预测。 它们的实现方式是同时持有几百只股票的多空组合,持有数年,而不是「买一只动量股」。
动量(Momentum)
主张:过去 3–12 个月表现好的股票,在接下来的 3–12 个月倾向于继续跑赢。
证据:Jegadeesh 和 Titman 1993 年的论文首次系统记录。此后在多个国家、多个资产类别(股票、商品、外汇、债券)和多个时间段被重复验证,是最稳健的异象之一。
代价:动量崩溃。Daniel 和 Moskowitz 在 Momentum Crashes(2016)中记录了这个特性——在市场大跌后的反弹阶段,动量策略会遭遇极端的、快速的回撤。1932 年和 2009 年是两个典型例子。它的收益分布是左偏的:平时稳定小赚,偶尔巨亏。
实务问题:动量需要高换手率来维持,交易成本吃掉相当一部分学术收益。
价值(Value)
主张:估值低的股票长期跑赢估值高的股票。
证据:Fama 和 French 1992/1993 年的工作把它确立为一个定价因子(HML)。历史样本上的证据很强。
代价:价值因子经历了长达十余年的显著跑输(大致从 2007 年到 2020 年)。这段时间足以让任何机构的基金经理丢掉工作,也足以让任何个人放弃。关于原因的争论仍在继续,一个主要观点是:账面价值这个指标在无形资产(软件、品牌、研发)主导的经济中失去了原有的意义。
这是一个重要的教训:一个有几十年学术证据支持的因子,可以连续十几年不工作。「长期有效」和「你能等到那个长期」是两回事。
规模(Size)
主张:小市值股票跑赢大市值股票。
证据:Banz 1981 年提出。
代价:这是异象衰减的教科书案例。在原始论文发表后,规模溢价在美国市场大幅减弱甚至消失。后续研究表明原始效应中相当部分来自极微小市值的股票(流动性极差、实际不可交易)以及一月效应等季节性因素。
低波动(Low Volatility / Betting Against Beta)
主张:低波动、低 Beta 的股票,风险调整后收益反而更高——这与 CAPM 的预测相反。
证据:Ang、Hodrick、Xing、Zhang(2006)和 Frazzini、Pedersen 的 Betting Against Beta(2014)。
解释:多数投资者受杠杆约束,无法通过给低风险资产加杠杆来提高收益,于是转而直接买高 Beta 股票,把它们的价格推高、未来收益压低。
注意:这个策略的学术形式需要对低 Beta 组合加杠杆才能达到目标收益水平——而加杠杆把你带回第六篇的所有问题。
质量 / 盈利能力(Quality)
主张:高盈利能力(如高毛利资产比)的公司跑赢低盈利能力的公司。
证据:Novy-Marx(2013)。Fama-French 在 2015 年将盈利能力(RMW)和投资(CMA)纳入五因子模型。
注意:「质量」的定义在不同研究和不同产品中差异很大,缺少统一标准,这使得它比动量和价值更难比较。
波动率聚集
主张:「大波动之后往往跟着大波动」。
证据:这是时间序列上极其稳健的统计性质,GARCH 类模型的基础。
关键限制:它预测的是波动幅度,不是方向。它对风险管理有直接价值——高波动期应减小仓位——但不能用来判断涨跌。这可能是这一节里唯一一个可以直接、安全地用在个人交易上的规律,而且它服务的是第六篇而不是这一篇。
六、优势会衰减:复制危机
上一节的异象都有像样的证据。但下面这组研究,是这一整篇里最应该被记住的部分。
公开会杀死优势
McLean 和 Pontiff 在 Does Academic Research Destroy Stock Return Predictability?(Journal of Finance, 2016)中,重新测试了 97 个已发表的、有显著预测能力的因子。他们比较了三个时期的收益:
| 时期 | 相对原论文样本内收益 |
|---|---|
| 论文样本期内 | 100%(基准) |
| 样本期之后、论文发表之前 | 约 −26% |
| 论文发表之后 | 约 −58% |
两个数字各自说明一件事:
- −26% 部分来自原论文中的数据挖掘成分(样本内被高估了)
- −58% 中额外的那部分,来自发表本身——资本看到论文后涌入,把机会套利掉
结论直白:一个策略被写进论文(或博客、或推文)之后,它的收益大约减半。
更糟:很多异象根本不成立
Hou、Xue 和 Zhang 在 Replicating Anomalies(Review of Financial Studies, 2020)中,用统一的方法重新检验了 452 个已发表的异象。在恰当处理微小市值股票(用市值加权而非等权,避免结果被无法实际交易的微盘股主导)后:
约三分之二的异象无法在统计上重复出来。
也就是说,已发表的金融学文献中,很大一部分「发现」经不起严格复制。
显著性门槛本身就设错了
Harvey、Liu 和 Zhu 在 …and the Cross-Section of Expected Returns(Review of Financial Studies, 2016)中提出了一个更根本的批评:金融学界几十年来测试了数百个因子,但每一个都用 t > 2.0 的标准判断显著性。
在如此大规模的多重检验下,t > 2.0 会产生大量假阳性。他们论证合理的门槛应当提高到 t > 3.0 左右——按这个标准,大多数已发表的因子不再显著。
这三项研究合起来的含义
- 你在网上看到的任何策略,都已经过了它最好的时候。 免费的、公开的、被广泛讨论的,按定义是竞争最激烈的。
- 回测出来的漂亮曲线,先假设有一半是假的。 这不是悲观,是上面的实证结果。
- 真正的优势有保质期。 一个可持续的做法不是找到「圣杯」,而是接受你需要持续地重新验证和替换。
- 对个人而言,这再次指向第二节的结论:行为与结构优势不会被套利掉,因为它来自你的约束比机构少,而不是来自某个信号。
七、链上分析
这是加密市场独有的:区块链的所有交易公开可查。
有实际价值的观察:
- 交易所净流入/流出:大量代币转入交易所可能预示卖压(但也可能只是做市商调仓)
- 大额持有者地址变动
- 稳定币供应量变化
- 合约层面的资金费率、未平仓合约量、清算数据——这些是当前状态的直接测量,不是预测
局限也很明确:
- 地址不等于人。一个人可以有无数地址,交易所的冷热钱包会造成巨额的虚假信号
- 归因依赖第三方标注,而这些标注可能过时或错误
- 链下交易不可见。CEX 内部的交易不上链,而这部分成交量占比很大
- 可以被刻意制造。知道有人在看这些指标,就有人会去制造这些指标
链上数据的最佳用途和波动率类似:测量当前的市场状态(尤其是杠杆水平),而不是预测方向。
⭐ 这一节是清单,第 43 篇是分层:那里按「依赖多少假设」把链上指标排成五层,并给出一条关键区分——链上原始数据可复现,但链上指标不一定可复现,因为大多数指标依赖私有的地址标注。⚠️ 而流行度恰好和可信度相反。
八、还有一类:不依赖方向预测的策略
这一整篇讨论的都是「怎么判断涨跌」,但值得指出:方向性下注是一个选择,不是交易的定义。
做市、期现基差套利、资金费率套利这几类做法,收益不来自预测方向,而来自为别人承担某种他们不想承担的东西——做市承担库存风险和逆向选择,基差类策略为杠杆做多者提供对手方。
必须同时说清楚的是:它们不是免费的钱。 价格风险被对冲掉了,但它被换成了对手方风险和操作风险,而后者更容易被低估——因为它平时完全不波动,直到一次性归零。FTX 上有大量这类「市场中性」仓位,最终全部损失。中性的是价格敞口,不是对手方敞口。
还有一个更微妙的陷阱:这类策略的收益分布是左偏的(平时稳定小赚、偶尔巨亏),而夏普比率对左偏分布系统性高估。一个看起来完美的低波动策略,可能只是那次归零事件还没发生。
这一类内容展开较多,单独放在了第十篇,包括做市的逆向选择模型、基差的无套利定价与真实资本效率、以及为什么低波动是过度加杠杆的最大诱因。
对本篇而言,只需要记住一个可迁移的结论——面对任何号称「稳定年化 XX%」的东西,问三个问题:
这个收益是谁付的?它承担的是什么风险?最坏情况下会损失多少?
说不出对手方是谁的收益,就不要碰。
九、怎么判断一个想法值不值得实盘
这一节是这篇里最实用的部分。
⭐ 这一节和下一节给的是清单(该做什么、别踩什么)。第 38 篇把它们装成了一条有顺序的流水线,并补上了这里只点到为止的定量工具:分块 bootstrap 怎么给出夏普区间、试过 N 次之后纯运气能达到多高的夏普、以及成本吃掉一半毛收益为什么会让所需样本量变成四倍。
第一步:先算需要多少样本
这是最被忽略的一步。检验一个策略是否真的优于零,需要的样本量比直觉大得多。
对每笔交易的收益(以 R 计),t 统计量约为:
t = (平均每笔R ÷ 每笔R的标准差) × √N
要达到 t = 2(一个宽松的标准),需要的交易笔数:
| 平均每笔收益 | 标准差 1.0R | 标准差 1.5R |
|---|---|---|
| +0.05R | 1,600 笔 | 3,600 笔 |
| +0.10R | 400 笔 | 900 笔 |
| +0.20R | 100 笔 | 225 笔 |
| +0.30R | 44 笔 | 100 笔 |
换成年化的说法更直观。对年化夏普比率 SR,t ≈ SR × √年数:
| 年化夏普 | 达到 t=2 需要 |
|---|---|
| 0.3 | 约 44 年 |
| 0.5 | 约 16 年 |
| 1.0 | 4 年 |
| 1.5 | 约 1.8 年 |
含义:一个夏普 0.5 的策略(这已经是相当不错的水平),你需要十几年的数据才能在统计上把它和「运气」区分开。
这不是说不能交易,而是说:你手上那几十笔交易的记录,几乎不包含任何关于策略是否有效的信息。 而且按第六节,t=2 的门槛本身可能还太松。
第二步:分割数据,且只用一次
样本内(约 60%):用来开发和调参
样本外(约 20%):用来验证
封存期(约 20%):动都不要动,直到最后一次
关键纪律:如果你在样本外测试失败后,回去改参数再测一次,样本外就已经污染了——它变成了样本内的一部分。每一次「回去改一下再试」,都在消耗这份数据的可信度。
更严格的做法是前进式检验(Walk-Forward):用前 N 个月的数据优化参数,在接下来的 M 个月上测试,然后整体向前滚动,重复。这更接近实盘中「你只能用过去的数据」的真实处境。
第三步:检查稳健性
- 参数平原:参数在一片区域内都表现尚可,还是只在一个点上惊艳?后者是过拟合
- 跨市场:这个逻辑在其他标的、其他资产类别上也成立吗?
- 跨时期:在不同的宏观环境(加息/降息、牛市/熊市)里表现如何?
- 敏感性:把交易成本翻倍,还能赚钱吗?
- 有无因果解释:你能说出为什么这个规律存在、谁在另一端亏钱吗?说不出来的规律更可能是巧合
最后一条尤其重要。一个有经济学解释的异象(比如低波动异象源自杠杆约束)比一个纯粹从数据里挖出来的模式更可能持续。
第四步:预先写下失效条件
这一步几乎所有人都跳过,而它是唯一能防止你无限期地给一个失效策略找借口的东西。
在实盘之前写下来:
最大可接受回撤 :____%(触及则停止)
最长可接受不盈利期 :____ 个月
最少评估样本 :____ 笔(不到这个数不做任何判断)
实盘 vs 回测的偏离容忍:滑点超出预期 ___% 则暂停
明确的证伪条件 :出现什么现象说明逻辑已不成立
没有预先写下的失效条件,你在策略失效时会有无数个理由说「再等等」——而这些理由在事后总是显得很合理。
第五步:小规模实盘
回测和实盘之间永远有差距:滑点、部分成交、数据延迟、你自己的执行失误、以及你在真金白银下的心理反应。
用能承受完全损失的最小资金跑一段真实交易。这一步的主要目的不是赚钱,是测量回测与现实的差距,以及测量你自己。
十、回测里最容易骗到自己的六件事
任何用历史数据验证策略的人都必须知道这些。它们不是理论问题——它们是绝大多数「回测很好、实盘就亏」的原因。
1. 过拟合(曲线拟合)
参数调到在历史数据上完美,等于把噪声也学进去了。判断标准:参数稍微变动结果就大幅变差,说明你拟合的是噪声。
2. 多重比较
测试一百个策略,其中总会有几个纯靠运气「表现优异」。如果你只报告最好的那个,你报告的是运气。
这就是第六节 Harvey 等人批评的问题在个人层面的版本。有一个专门的修正指标叫紧缩夏普比率(Deflated Sharpe Ratio),用来根据你实际尝试过的策略数量惩罚观察到的夏普值。试得越多,同样的结果越不值钱。
3. 幸存者偏差
用「今天还在交易的股票」做回测,自动排除了退市和破产的公司,结果必然偏乐观。加密市场更严重——大量归零的代币直接从数据源上消失了,用现存代币做出的任何历史统计都是对幸存者的统计。
4. 前视偏差
在回测中使用了当时还不可得的信息。典型例子:用财报期末日期而不是实际公布日期;用后来被修正过的宏观数据;在收盘价确定后才「决定」以收盘价买入。
5. 忽略成本
不计佣金、价差、滑点、资金费、借券费和税的回测,在高频次策略上可以把一个亏损策略显示成盈利策略。交易越频繁,失真越大。 参考第八篇:单次 0.2% 成本、每日一次往返,年成本接近 50%。
6. 样本期太短
只在牛市中测试过的策略,你不知道它在熊市中的表现。加密市场的完整数据历史本身就不长,覆盖的宏观环境种类有限。
⚠️ 还有第七件:引擎本身可能是错的
上面六件都假设回测算出来的数是对的。这个前提经常不成立,而且失败是静默的——引擎不会报错,只会给你一个偏乐观的数字。
⭐ 第 38 篇第九节给了一个能抓住大部分引擎 bug 的自检:跑一个随机进出、频次相同的策略,结果必须约等于「−成本 × 次数」。 显示接近零或者赚钱,就说明引擎有问题——这是你唯一一个有已知答案的回测。
十一、什么不算证据
一份简短的清单,用来过滤你在网上看到的东西:
| ❌ 不算证据 | 为什么 |
|---|---|
| 盈利截图 | 可以伪造,也可以从一百个账户里挑一个 |
| 短期业绩 | 见第九节:几十笔交易不含信息 |
| 「我从 X 赚到了 Y」 | 幸存者偏差,你看不到亏损的那些人 |
| 平滑向上的回测曲线 | 见第十节的六种偏差 |
| 事后解释走势的能力 | 不可证伪 |
| 大量精确的技术术语 | 复杂度不等于有效性 |
| 「已经有 N 人跟单盈利」 | 无法验证,且与你无关 |
| ✅ 算某种程度的证据 | 附加条件 |
|---|---|
| 长期、连续、可审计的业绩记录 | 需覆盖多种市场环境 |
| 多个独立团队的重复验证 | 见第六节,即便如此也会衰减 |
| 有因果机制的解释 | 说得出谁在另一端亏钱 |
| 公开的、可复现的方法与数据 | 你能自己跑一遍 |
十二、这一篇的结论
- 优势只有四种来源。对个人而言,行为与结构优势是唯一可靠的那个——它来自你比机构少的约束,而且不会被套利掉。
- 说不清自己的优势来自哪一类,就假设没有。这时最优解是降低成本和换手,而不是更努力找信号。
- 动量、价值、低波动、质量有较强证据,但它们是组合层面的规律;价值因子曾连续十余年跑输,「长期有效」不保证你能等到。
- 公开会杀死优势:已发表因子的收益在发表后大约减半(McLean & Pontiff);约三分之二的已发表异象无法复制(Hou-Xue-Zhang);显著性门槛本身可能定得太松(Harvey-Liu-Zhu)。
- 加密的基差类做法不依赖方向预测,但把价格风险换成了对手方风险——FTX 上的中性仓位一样归零。
- 检验一个想法需要的样本量远超直觉:夏普 0.5 需要约 16 年才能与运气区分。你手上那几十笔交易不含结论。
- 实盘前写下失效条件,否则你会为失效的策略无限期地找理由。
- 波动率聚集可能是这一篇里唯一能安全直接使用的规律——而它服务的是仓位管理,不是方向判断。