先给结论
(correlation of fitness effects)
趋近 block-model 上界
极端时峰数从指数 → sub-exponential
本文将"适应度景观有多少局部最优峰"这个经典问题,从定性回答("需要 reciprocal sign epistasis")推进到定量预测。对于一大类非结构化景观(isotropic Gaussian random fields),峰数期望仅由一个局部上位性参数 γ 决定;当引入交互聚集或位点异质性时,相同总上位性可以产生差异巨大的 ruggedness。框架将上位性强度、模块性、位点异质性统一到一个可解析的三参数体系。
$$\mathbb{E}[N_{\mathrm{peaks}}] = 2^L \int_{-\infty}^\infty dx\,\varphi(x)\,\Phi\!\left(x\sqrt{\frac{1-\gamma}{1+\gamma}}\right)^L$$
其中 ϕ 和 Φ 分别为标准正态密度和累积分布函数。该公式对任意 power spectrum 成立——峰数仅依赖 γ,不依赖其余 L-2 个参数。
| 因素 | 参数 | 对峰数的影响 | 极端情形 |
|---|---|---|---|
| 上位性强度 | γ ↓ (1-γ ↑) | 单调增加峰数 | γ→0: 大量峰 |
| 聚集/模块性 | β ∈ [0,1] | 轻微增加 | βmax=1/k: λ → -log((A-1)(k+1)+1)/(k+1) |
| 位点异质性 | h ∈ [0,∞) | 强抑制(崩溃) | hmax≈√(L/k): λ → -log(A), 峰数 ∼ e√L |
研究动机
问题:峰数到底由什么决定?
适应度景观(fitness landscape)将基因型映射到适应度,其局部最优峰的数量决定了进化是直达全局最优还是被困在次优峰上。已有经典结论:
- 必要性条件:多峰景观必须包含 reciprocal sign epistasis (RSE) [Poelwijk 2007, 2011];K 个峰至少需要 K-1 个 RSE motif [Riehl 2022, Saona 2022]。
- 不充分性:仅有 RSE 的数量无法预测峰数——相同 RSE 量可产生差异巨大的 ruggedness [Crona 2013]。
- NK 模型的非普适性:不同交互结构(random vs block vs adjacent)在相同上位性强度下产生截然不同的峰数 [Hwang 2018]。
本文要回答的核心问题:对于"典型"景观,应该期望多少峰?这个范围如何依赖上位性及其空间分布?
为什么全局 roughness 不够?
峰的定义本质上是局部的——一个基因型比所有单突变邻居都适应度更高。因此峰数取决于局部突变效应的符号与相关性,而非全局偏离可加性的幅度。三张"roughness 近似相同但峰数天差地别"的景观直观说明了这一点:
实证景观也支持局部上位性
数学表示及建模
1. 基本设定
基因型空间:长度 L 的序列,每位点 A 个等位基因。基因型 g 的适应度 f(g)。局部最优 = 适应度高于所有单突变邻居。
突变 i 的适应度效应:
2. 局部上位性参数 γ
适应度效应相关性 [Ferretti 2016]:同一突变在相邻遗传背景上的效应之间的相关系数。
无上位性时 γ=1;上位性越强 γ 越小。γ 直接刻画景观的局部几何——突变效应在邻域中多稳定。
3. Reciprocal sign epistasis 与 γ 的关系
对于非结构化 Gaussian 景观,RSE 比例 φrs 可表示为 γ 的解析函数 [Ribeca 2026]:
在典型弱上位性区间(γ≥0),该关系近似线性:φrs ≈ (1-γ)/π,误差 <5%。
4. γ 与 power spectrum 的关系
Fourier 展开中阶数 k 的系数方差 Vk 决定上位性谱。γ 与谱的关系(双等位):
关键洞察:峰数期望仅通过 γ 依赖谱——其余 L-2 个谱参数不影响峰数。
5. 非结构化景观模型(Isotropic Gaussian Random Field)
两大简化假设:
- 各向同性:所有位点和等位基因可交换,交互不集中于特定子集
- Gaussian:大量小效应叠加 → 交互强度正态分布
适应度通过 Fourier 展开定义,系数取自方差为 Vk 的独立 Gaussian。该大类包含:mean-field NK 模型、Rough Mount Fuji(含 Gaussian 加性分量)、Sherrington-Kirkpatrick 模型等。
6. 结构化扩展:聚集 & 异质性
聚集(clustering/modularity):L 个位点分为 B 个 block,交互仅在同 block 内发生。
位点异质性(heterogeneity):仅 fe 比例的位点参与上位性交互,其余纯加性。
完整模型:fe 比例的位点有 B-block 聚集交互(block 内非结构化 Gaussian,γb≥0),其余加性。
整体局部上位性:
7. 长序列极限与指数标度
取 L→∞,固定有效交互数 k = L(1-γ),峰密度标度:
峰数:Npeaks ∼ AL eλL = e(log A + λ)L。λ 越接近 0 表示峰越多。
核心公式与方法
非结构化景观:峰数期望(双等位)
此前仅对 mean-field NK 模型获得 [Hwang 2018];本文证明对任意非结构化 Gaussian 景观均成立(见 Supplementary 推导)。
等价的 RSE 表达
多等位基因推广
大 L、k≫1 渐近(非结构化)
聚集交互的 λ
其中 H(y) 和 γb:
极端聚集(block model, βmax=1/k):
异质性的 λ
极端异质性(hmax ≈ √(L/k)):λ → -log(A),峰密度不再是 L 的指数,而是 √L 的指数:
完整模型(聚集 + 异质性)
其中 B = β(L/(1+h)-1)+1,γb = 1-(1-γ)(L-1)(1+h)(β+(1+h)/(L-1-h))/(1-β)。
实验设计
本文以理论分析 + 数值模拟 + 实证对比三层展开:
| 层面 | 方法 | 参数范围 | 目的 |
|---|---|---|---|
| 解析推导 | 从 Gaussian 随机场的协方差结构出发,积分计算峰数期望 | L 任意;双等位 A=2 及多等位 A=2,4,20 | 获得 γ ↔ 峰数的普适关系 |
| 数值验证 | Monte Carlo 模拟 Gaussian 景观,枚举峰数 | L=10, 100;k=L(1-γ) 固定 | 验证公式、画出 λ(k) 曲线 |
| 实证对比 | 已有的实验测定双等位景观及其完整子景观集合 | L=3–5 的子景观 | 检验非结构化预测是否拟合真实数据 |
| 结构化扩展 | 聚集(β 变化)、异质性(h 变化)、两者组合 | β∈[0,1/k], h∈[0,√(L/k)] | 量化结构对峰数的偏移 |
实验结果
结果一:非结构化景观峰数仅依赖 γ
峰数随 1-γ(或 φrs)单调递增:更强局部上位性 → 更 rugged。固定 γ 时,峰密度随 L 递减(但绝对峰数可增)。多等位时密度更低但绝对峰数可能更高 [Srivastava 2023]。
结果二:实证景观与非结构化预测一致
尽管个体景观噪声大(L 小、峰少),平均而言实证景观的峰数与非结构化 Gaussian 预测相当吻合——不仅 RSE 比例 [Ribeca 2026],峰数也符合。Block model 也能给出不错的总体拟合,但非结构化在某些统计上略优。
结果三:聚集交互轻微增加峰数
聚集增加峰数的原因:独立模块各自产生峰,模块级峰的组合成为全景观峰。但效应有限——对数标度上偏移较小,相对于峰数可能跨越的 O(1) 到 O(AL) 全范围。
结果四:位点异质性导致峰数崩溃
两种相反效应竞争:①加性位点缩减 rugged 部分维度(减峰);②参与交互的位点交互强度增强(增峰)。中等异质性+弱上位性时②占优——峰数反增;强异质性时①主导——峰数崩溃。极端异质性下,峰数从 L 的指数变为 √L 的指数——几乎只有加性景观的 O(1) 量级。
结果五:完整模型(聚集 + 异质性)
总结:峰密度的三段式 bracket
| 情形 | log πpeaks 标度 | 角色 |
|---|---|---|
| 上界:极端聚集 | ∼ -L · log((A-1)k)/k | 最多峰 |
| 典型:非结构化 | ∼ -L · 2log((A-1)k)/k | 基线预测 |
| 下界:极端异质 | ∼ -L · log A | 最少峰(接近加性) |
我的评论
亮点
- 统一框架:将 NK、RMF、House-of-Cards、SK 等模型纳入同一 Gaussian 随机场框架,用单一参数 γ 预测峰数——理论优雅度高。
- 因果分离:明确区分"全局 roughness"和"局部上位性",解释了为什么相同 epistasis 总量产生不同 ruggedness——这是对该领域长期困惑的直接回答。
- 结构化扩展有解析式:聚集和异质性都获得了 λ 的闭式或渐近表达式,不只是数值结果。
- 实证一致:非结构化预测与 L=3–5 实证景观吻合,提供了可检验的 null model。
局限与疑点
- Gaussian 假设:真实生物景观可能有重尾、非对称、强高阶交互。作者承认但未量化偏离。蛋白质折叠景观的 biophysical 约束可能产生非 Gaussian 谱。
- 实证检验功率不足:L=3–5 的子景观太小,噪声大,非结构化 vs block model 区分力弱。论文自己承认 block model 也能拟合。需要更大 L 的数据。
- γ<0 景观被排除:典型性论证基于"无已知生物机制产生纯高阶补偿交互"——这是一个经验论据而非数学约束。若未来发现此类机制,基线预测需要修正。
- 聚集效应"轻微"的定性判断:对数标度上偏移小,但实际峰数差异可能是数量级的。论文用"相对于全范围"来论证轻微,但进化动力学对绝对峰数也敏感。
- 缺少与 NK adjacent/standard 模型的直接比较:Hwang 2018 发现 adjacent NK 与 mean-field NK 峰数差异大,但本文未系统覆盖这种结构类型。
对进化预测的意义
如果实证景观大多接近非结构化基线(本文初步证据支持),则测量 γ 即可预测峰数——这是对进化可预测性问题的直接实用工具。偏离方向(偏多→聚集/模块;偏少→异质)则暗示了潜在的交互结构。
One More Thing
极端异质性下峰数标度从 $e^{\lambda L}$ 降为 $e^{\sqrt{L}\sqrt{k}\log A}$——这意味着存在一类景观,序列很长但峰数近乎有限。NK star model [Hwang 2018] 甚至给出 L→∞ 时峰数保持 O(1)。这提示:如果上位性交互在基因组中高度集中于少数热点位点(而非均匀分布),即使总上位性不弱,进化也可能几乎不受多峰困扰。这对耐药演化、肿瘤适应等场景有直接含义——关键不是上位性"多强",而是"分布在多少位点上"。
完整图谱 / Figure Gallery
以下汇集论文全部 11 张图(主文 Figures 1–11),便于快速浏览。
Reference / Evidence
- arXiv:2605.03046 — 论文摘要页
- arXiv PDF — 全文 PDF
- arXiv TeX Source — LaTeX 源码包
- DOI: 10.48550/arXiv.2605.03046
- NASA ADS 条目
- Google Scholar 引用
- Semantic Scholar 条目
关键参考文献(论文内引用):
- Ferretti et al. (2016) — γ 参数定义 Genetics
- Poelwijk et al. (2007, 2011) — RSE 与多峰的必要性关系
- Hwang et al. (2018) — NK 模型峰数普适性与非普适性 Genetics
- Kauffman & Weinberger (1989) — NK 模型与适应度景观
- Neidhart et al. (2014) — Rough Mount Fuji 模型
- Ribeca et al. (2026) — RSE 与 γ 的解析关系
- Saona et al. (2022) — K 峰至少需 K-1 RSE motif
- Szendro et al. (2013) — 实证双等位景观的 roughness/slope 分析