← 科研空间 首页
arXiv:2605.03046 q-bio.PE · 26 pages · 11 figures 原版 PDF

Epistatic strength, modularity, and locus heterogeneity shape the number of local optima in fitness landscapes

上位性强度、模块性和位点异质性如何决定适应度景观中局部最优峰的数量 — 深度精读 Cheat Sheet

阅读基础:arXiv:2605.03046 全文 + TeX 源码 + Supplementary Information(14页);检索日期 2026-07-16

先给结论

1单一参数 γ 决定非结构化景观的峰数期望
(correlation of fitness effects)
聚集(modularity)轻微增加峰数
趋近 block-model 上界
↓↓位点异质性(heterogeneity)严重压缩峰数
极端时峰数从指数 → sub-exponential

本文将"适应度景观有多少局部最优峰"这个经典问题,从定性回答("需要 reciprocal sign epistasis")推进到定量预测。对于一大类非结构化景观(isotropic Gaussian random fields),峰数期望仅由一个局部上位性参数 γ 决定;当引入交互聚集或位点异质性时,相同总上位性可以产生差异巨大的 ruggedness。框架将上位性强度、模块性、位点异质性统一到一个可解析的三参数体系。

核心公式(双等位,非结构化):
$$\mathbb{E}[N_{\mathrm{peaks}}] = 2^L \int_{-\infty}^\infty dx\,\varphi(x)\,\Phi\!\left(x\sqrt{\frac{1-\gamma}{1+\gamma}}\right)^L$$

其中 ϕ 和 Φ 分别为标准正态密度和累积分布函数。该公式对任意 power spectrum 成立——峰数仅依赖 γ,不依赖其余 L-2 个参数。

三因素框架:
因素 参数 对峰数的影响 极端情形
上位性强度 γ ↓ (1-γ ↑) 单调增加峰数 γ→0: 大量峰
聚集/模块性 β ∈ [0,1] 轻微增加 βmax=1/k: λ → -log((A-1)(k+1)+1)/(k+1)
位点异质性 h ∈ [0,∞) 强抑制(崩溃) hmax≈√(L/k): λ → -log(A), 峰数 ∼ e√L

研究动机

问题:峰数到底由什么决定?

适应度景观(fitness landscape)将基因型映射到适应度,其局部最优峰的数量决定了进化是直达全局最优还是被困在次优峰上。已有经典结论:

本文要回答的核心问题:对于"典型"景观,应该期望多少峰?这个范围如何依赖上位性及其空间分布?

为什么全局 roughness 不够?

峰的定义本质上是局部的——一个基因型比所有单突变邻居都适应度更高。因此峰数取决于局部突变效应的符号与相关性,而非全局偏离可加性的幅度。三张"roughness 近似相同但峰数天差地别"的景观直观说明了这一点:

三张roughness近似相同但峰数差异巨大的景观示意图
Figure 1. 三个景观具有近似相同的 roughness,但非线性谱不同(左:成对交互;中:随机 House-of-Cards;右:最大上位性),导致局部极大/极小数目截然不同,与局部上位性度量强相关。
关键区分:全局 roughness 衡量"非加性变异总量";峰数取决于"非加性变异如何改变局部突变效应的符号"。同样的非加性总量,若打乱了局部符号→多峰;若保留局部符号→平滑。

实证景观也支持局部上位性

实证景观中峰数与局部上位性 vs 全局roughness的相关性对比
Figure 2. 实验测定的双等位子景观(L=3,4)中,峰数/汇点数与局部上位性度量(γ, γ*, φrs)的相关性(Pearson r²=0.35–0.61)远高于与全局 roughness 的相关性(r²=0.18–0.38)。

数学表示及建模

1. 基本设定

基因型空间:长度 L 的序列,每位点 A 个等位基因。基因型 g 的适应度 f(g)。局部最优 = 适应度高于所有单突变邻居。

突变 i 的适应度效应:

$$\Delta_i f(g) = f(g_{[i]}) - f(g)$$

2. 局部上位性参数 γ

适应度效应相关性 [Ferretti 2016]:同一突变在相邻遗传背景上的效应之间的相关系数。

$$\gamma = \mathrm{Cor}\,[\Delta_i f(g),\, \Delta_i f(g_j)]$$

无上位性时 γ=1;上位性越强 γ 越小。γ 直接刻画景观的局部几何——突变效应在邻域中多稳定。

3. Reciprocal sign epistasis 与 γ 的关系

对于非结构化 Gaussian 景观,RSE 比例 φrs 可表示为 γ 的解析函数 [Ribeca 2026]:

$$\phi_{rs}=\frac{2}{\pi}\arcsin\!\left(\frac{1-\gamma}{2}\right)$$

在典型弱上位性区间(γ≥0),该关系近似线性:φrs ≈ (1-γ)/π,误差 <5%。

4. γ 与 power spectrum 的关系

Fourier 展开中阶数 k 的系数方差 Vk 决定上位性谱。γ 与谱的关系(双等位):

$$\gamma=1-2\frac{\sum_{k=1}^{L}k(k-1)\binom{L}{k} V_k}{\sum_{k=1}^{L}k(L-1)\binom{L}{k} V_k}$$

关键洞察:峰数期望仅通过 γ 依赖谱——其余 L-2 个谱参数不影响峰数。

5. 非结构化景观模型(Isotropic Gaussian Random Field)

两大简化假设:

适应度通过 Fourier 展开定义,系数取自方差为 Vk 的独立 Gaussian。该大类包含:mean-field NK 模型、Rough Mount Fuji(含 Gaussian 加性分量)、Sherrington-Kirkpatrick 模型等。

6. 结构化扩展:聚集 & 异质性

聚集(clustering/modularity):L 个位点分为 B 个 block,交互仅在同 block 内发生。

$$\beta=\frac{B-1}{L-1}\ \ \Rightarrow\ \ B=1+\beta(L-1)$$

位点异质性(heterogeneity):仅 fe 比例的位点参与上位性交互,其余纯加性。

$$h=\frac{1}{f_e}-1\ \ \Rightarrow\ \ f_e=\frac{1}{1+h}$$

完整模型:fe 比例的位点有 B-block 聚集交互(block 内非结构化 Gaussian,γb≥0),其余加性。

$$f(g)=\sum_{i=1}^{L(1-f_e)}f_{\text{linear}}(a_i)+\sum_{J=1}^B f_{\text{unstructured}}(a_{J,1}\ldots a_{J,Lf_e/B})$$

整体局部上位性:

$$1-\gamma=\frac{f_e(f_e/B-1/L)}{1-1/L}(1-\gamma_b)$$

7. 长序列极限与指数标度

取 L→∞,固定有效交互数 k = L(1-γ),峰密度标度:

$$\pi_{\text{peaks}}=\frac{N_{\text{peaks}}}{A^L}\sim e^{\lambda L}\ ,\qquad \lambda=\lim_{L\to\infty}\frac{\log(\pi_{\text{peaks}})}{L}$$

峰数:Npeaks ∼ AL eλL = e(log A + λ)L。λ 越接近 0 表示峰越多。

核心公式与方法

非结构化景观:峰数期望(双等位)

$$\mathbb{E}[N_{\mathrm{peaks}}] = 2^L \int_{-\infty}^\infty dx\,\varphi(x)\,\Phi\!\left(x\sqrt{\frac{1-\gamma}{1+\gamma}}\right)^L$$

此前仅对 mean-field NK 模型获得 [Hwang 2018];本文证明对任意非结构化 Gaussian 景观均成立(见 Supplementary 推导)。

等价的 RSE 表达

$$\mathbb{E}[N_{\mathrm{peaks}}] = 2^L \int_{-\infty}^\infty dx\,\varphi(x)\,\Phi\!\left(x\sqrt{\frac{\sin(\pi\phi_{rs}/2)}{1-\sin(\pi\phi_{rs}/2)}}\right)^L$$

多等位基因推广

$$\frac{\mathbb{E}[N_{\mathrm{peaks}}]}{A^L} = \int_{-\infty}^{\infty} dy\,\varphi(y)\left[\int_{-\infty}^{\infty} dz\,\varphi(z)\,\Phi\!\left(\sqrt{1-\gamma}\,y+\sqrt{\gamma}\,z\right)^{A-1}\right]^L$$

大 L、k≫1 渐近(非结构化)

$$\lambda \simeq -2\frac{\log((A-1)k)}{k}$$

聚集交互的 λ

$$\lambda=\beta\log\!\left[\int_{-\infty}^\infty dy\,\varphi(y)\,H(y)^{1/\beta}\right]$$

其中 H(y) 和 γb

$$H(y) = \int_{-\infty}^{\infty} dz\,\varphi(z)\,\Phi\!\left(y\sqrt{1-\gamma_b}+z\sqrt{\gamma_b}\right)^{A-1},\quad \gamma_b = 1-(1-\gamma)\frac{(L-1)(\beta+\frac{1}{L-1})}{1-\beta}$$

极端聚集(block model, βmax=1/k):

$$\lambda_{\text{block}}=-\frac{\log((A-1)(k+1)+1)}{k+1}$$

异质性的 λ

$$\lambda\simeq-\frac{h}{1+h}\log A-2\frac{\log((A-1)k/(1+h)^2)}{(1+h)^3 k}$$

极端异质性(hmax ≈ √(L/k)):λ → -log(A),峰密度不再是 L 的指数,而是 √L 的指数:

$$\pi_{\text{peaks}}\sim e^{\sqrt{L}\left[\sqrt{k}\log A\right]}$$

完整模型(聚集 + 异质性)

$$\mathbb{E}[N_{\text{peaks}}] = A^{\frac{L}{1+h}} \left[\int_{-\infty}^{\infty} dy\,\varphi(y)\,H(y)^{\frac{L}{B(1+h)}}\right]^{B}$$
$$\lambda=-\frac{h}{1+h}\log A+\frac{\beta}{1+h}\log\!\left[\int_{-\infty}^\infty dy\,\varphi(y)\,H(y)^{1/\beta}\right]$$

其中 B = β(L/(1+h)-1)+1,γb = 1-(1-γ)(L-1)(1+h)(β+(1+h)/(L-1-h))/(1-β)。

实验设计

本文以理论分析 + 数值模拟 + 实证对比三层展开:

层面 方法 参数范围 目的
解析推导 从 Gaussian 随机场的协方差结构出发,积分计算峰数期望 L 任意;双等位 A=2 及多等位 A=2,4,20 获得 γ ↔ 峰数的普适关系
数值验证 Monte Carlo 模拟 Gaussian 景观,枚举峰数 L=10, 100;k=L(1-γ) 固定 验证公式、画出 λ(k) 曲线
实证对比 已有的实验测定双等位景观及其完整子景观集合 L=3–5 的子景观 检验非结构化预测是否拟合真实数据
结构化扩展 聚集(β 变化)、异质性(h 变化)、两者组合 β∈[0,1/k], h∈[0,√(L/k)] 量化结构对峰数的偏移
关键设计选择:长序列极限取 k=L(1-γ) 固定(而非 γ 固定),这对应"每位点有效交互数有限"的生物现实,也是 NK 文献的标准做法 [Hwang 2018]。

实验结果

结果一:非结构化景观峰数仅依赖 γ

L=10非结构化景观峰数随k的变化
Figure 3. L=10 非结构化景观的期望峰数 vs 有效交互数 k=(1-γ)L。双等位(A=2)、核苷酸(A=4)、氨基酸(A=20)三种字母表对比。
L=100非结构化景观峰数随k的变化
Figure 4. L=100 同上。峰数随 k 单调增加;固定 γ 时峰密度随 L 下降但绝对峰数可能增加。

峰数随 1-γ(或 φrs)单调递增:更强局部上位性 → 更 rugged。固定 γ 时,峰密度随 L 递减(但绝对峰数可增)。多等位时密度更低但绝对峰数可能更高 [Srivastava 2023]。

非结构化景观的指数标度lambda随k的变化
Figure 5. 非结构化景观指数标度 λ vs k。λ<0,越接近 0 峰越多。渐近式 λ ≈ -2log((A-1)k)/k 在大 k 时拟合良好。

结果二:实证景观与非结构化预测一致

实证景观峰数与局部上位性度量的拟合
Figure 6. 实验测定的子景观中峰数 vs 局部上位性度量。虚线=数据平滑平均;实线=非结构化预测;点线=block model 预测。上方标注 MSE。非结构化模型对 L=4,5 的 γ* 拟合略优。

尽管个体景观噪声大(L 小、峰少),平均而言实证景观的峰数与非结构化 Gaussian 预测相当吻合——不仅 RSE 比例 [Ribeca 2026],峰数也符合。Block model 也能给出不错的总体拟合,但非结构化在某些统计上略优。

审稿视角:L=3–5 的子景观太小,区分非结构化 vs block model 的统计功效有限。论文坦承这一点。更大景观的实证数据将更有效检验模型。

结果三:聚集交互轻微增加峰数

L=100聚集交互景观的峰数
Figure 7. L=100 聚集交互景观峰数 vs k,不同聚集参数 β。
聚集交互的指数标度lambda
Figure 8. 聚集交互的 λ vs k。极端 block model(βmax)给出上界,比非结构化多 ~log((A-1)k)/k。

聚集增加峰数的原因:独立模块各自产生峰,模块级峰的组合成为全景观峰。但效应有限——对数标度上偏移较小,相对于峰数可能跨越的 O(1) 到 O(AL) 全范围。

结果四:位点异质性导致峰数崩溃

L=100异质性景观的峰数
Figure 9. L=100 异质性景观峰数 vs k,不同异质性参数 h。中等 h 可能先增后降;强 h 严重抑制。
异质性的指数标度lambda
Figure 10. 异质性的 λ vs k。极端 hmax 时 λ→-log(A),峰数标度从 eλL 降为 e√L

两种相反效应竞争:①加性位点缩减 rugged 部分维度(减峰);②参与交互的位点交互强度增强(增峰)。中等异质性+弱上位性时②占优——峰数反增;强异质性时①主导——峰数崩溃。极端异质性下,峰数从 L 的指数变为 √L 的指数——几乎只有加性景观的 O(1) 量级。

结果五:完整模型(聚集 + 异质性)

聚集与异质性组合的指数标度lambda
Figure 11. 同时含聚集和异质性的完整模型的 λ vs k,不同 h 和 β 组合。异质性主导下拉,聚集轻微上推。

总结:峰密度的三段式 bracket

情形 log πpeaks 标度 角色
上界:极端聚集 ∼ -L · log((A-1)k)/k 最多峰
典型:非结构化 ∼ -L · 2log((A-1)k)/k 基线预测
下界:极端异质 ∼ -L · log A 最少峰(接近加性)

我的评论

亮点

局限与疑点

对进化预测的意义

如果实证景观大多接近非结构化基线(本文初步证据支持),则测量 γ 即可预测峰数——这是对进化可预测性问题的直接实用工具。偏离方向(偏多→聚集/模块;偏少→异质)则暗示了潜在的交互结构。

One More Thing

极端异质性下峰数标度从 $e^{\lambda L}$ 降为 $e^{\sqrt{L}\sqrt{k}\log A}$——这意味着存在一类景观,序列很长但峰数近乎有限。NK star model [Hwang 2018] 甚至给出 L→∞ 时峰数保持 O(1)。这提示:如果上位性交互在基因组中高度集中于少数热点位点(而非均匀分布),即使总上位性不弱,进化也可能几乎不受多峰困扰。这对耐药演化、肿瘤适应等场景有直接含义——关键不是上位性"多强",而是"分布在多少位点上"。

Reference / Evidence

关键参考文献(论文内引用):