先给结论
强 LLM 优化器是"局部精炼器"(local refiner)。它们在语义空间中渐进地收缩搜索范围,围绕高适应度区域频繁产出小幅增量改进。弱优化器则在语义空间中大幅漂移,偶有突破后陷入停滞。
五句话总结
- Zero-shot 能力是强但不完全的预测器——零分能力相近的模型,进化后性能可以天差地别(Figure 3)。
- Novelty(新颖性)本身不预测最终性能——平均新颖性、初始新颖性的回归系数接近零,统计不显著(Figure 4, Table 13)。
- Breakthrough rate(突破率)强预测性能——单独解释的方差约为 zero-shot 的 2 倍,且部分中介了 zero-shot 的预测力(Figure 4, Table 14)。
- Novelty 只有条件性有用——混合效应模型显示 novelty × spatial entropy 交互项显著为负:novelty 仅在搜索保持局部化(低空间熵)时才提升突破概率(Figure 6, Table 15, Figure 12)。
- 干预实验验证因果方向——model mixing 扰动实验中注入弱精炼器后代会使性能单调下降,且与精炼率下降协同变化(Figure 7)。
本文不是说"exploration 是坏的"。精确表述是:"在本文的实验设置下,非局部化的探索(unlocalized exploration)通常是低效的。"在高质量区域内进行的局部化探索(localized novelty)恰恰是突破的驱动力。这是轨迹层面的观测证据 + 扰动证据,尚未构成可部署的因果调度器。
研究动机
LLM 被越来越多地用作进化/智能体优化系统中的搜索算子(search operator):反复提出候选解、接收适应度反馈、迭代改进。在 prompt 优化、科学发现、组合优化等领域都展示了显著的经验收益。然而,这些收益背后的机制仍然不清楚。
核心观察:在严格控制进化循环、选择规则和评估函数的条件下,不同 LLM 产生截然不同的优化轨迹和最终性能。这引出本文的中心问题:
是什么解释了模型间如此大的优化性能差异?这些差异主要反映基础模型能力,还是源于模型所诱导的 exploration–exploitation 动态的更微妙差异?
Figure 1 是一个直观的例子:两个 zero-shot 性能相近的模型,在相同初始种群和相同进化条件下,走出完全不同的轨迹。这恰恰是 zero-shot 能力无法完全解释的残差。
经典直觉 vs 本文发现
在经典进化算法中,mutation 是随机算子,exploration(探索/新颖性)被视为发现更优解的关键。由于 LLM 的 mutation 不再随机——而是由语义先验引导、以"生成更好解"为目标——搜索天然偏向 exploitation。自然假设是:增加 exploration(novelty)应该能改善性能。
本文结果否定了这一直觉。最成功的轨迹不是那些高新颖性的轨迹,而是那些频繁且持续地产出小幅突破的轨迹。这与传统元启发式中"大突破罕见,长 plateau 后小幅精炼"的模式不同。
数学表示及建模
进化搜索循环
遵循 Novikov et al. (2025) 的轻量级进化搜索框架,LLM 作为语义变异算子(semantic variation operator)。
Novelty(新颖性)计算
候选解 $a$ 相对于所有先前解集合 $A_{\text{prior}}$ 的任务特定语义距离:
在子任务级别归一化以保证可比性。
任务特定语义距离
| 任务 | 距离度量 | 公式 |
|---|---|---|
| TSP | Edge-set distance(旋转/起点不变) | $D_{\text{edge}}(\pi,\sigma) = 1 - \frac{|E(\pi) \cap E(\sigma)|}{|E(\pi)|}$ |
| Prompt Optimization | 嵌入空间余弦距离 | $D_{\cos} = 1 - \frac{E(p_1) \cdot E(p_2)}{\|E(p_1)\| \|E(p_2)\|}$ |
| Equation Discovery / Heuristic | 功能行为距离 | $D_{\text{sem}}(f,g) = 1 - \frac{1}{m}\sum_{j=1}^{m} \cos\big(f(x_j), g(x_j)\big)$ |
语义几何:核密度熵
将所有候选解嵌入任务特定的共享语义空间,用核密度估计量化每代候选解的空间分布。设 $x_i \in \mathbb{R}^d$ 为解 $i$ 的嵌入,$K(\cdot,\cdot)$ 为高斯核:
| 度量 | 权重设定 | 含义 |
|---|---|---|
| $H_{\text{spatial}}$ | $w_j = 1$ | 候选解在语义空间中分布的广度——全局扩散 vs 局部集中 |
| $H_{\text{fitness}}$ | $w_j = f_j$ | 高质量解是聚集还是分散——高适应度解的拓扑集中度 |
算子级指标
| 指标 | 定义 | 含义 |
|---|---|---|
| LRR (Local Refinement Rate) | 后代严格优于其 prompted parent 的频率(占有效后代比例) | 局部精炼能力 |
| PCD (Parent–Child Distance) | 后代与父代之间的平均语义距离 | 语义步长大小 |
| Breakthrough Rate | 达到 best-so-far 改进事件的代数比例 | 持续突破能力 |
混合效应回归模型
对生成级突破概率建模,含模型级随机截距:
同时拟合 concurrent(同代)和 lagged(预测下一代)两个规格。
算法流程 / 方法
进化循环五步
- Population Initialization:固定初始种群 $P^0$,跨所有模型共享同一任务。
- Fitness Evaluation:任务特定 $f^T(\cdot)$;无效/不可解析输出 → 零适应度。
- Selection (Top-q Weighted):精英子集 $E^t = \text{Top}_{\lceil qN \rceil}(P^t)$,$q=0.2$;父代按适应度比例采样。
- Mutation (LLM):选中父代基因组作为 prompt 上下文 → LLM 生成后代基因组 $C^t$。
- Population Pool Update:去重、合并、保留 top-N;更新 $f^{\star}_t$。
实验规模参数
| 参数 | TSP | Prompt Opt | Equation Discovery | Heuristic Design |
|---|---|---|---|---|
| $n_{\text{init}}$ | 40 | 10 | 7 | 7 |
| $q$ (elite) | 0.2 | 0.2 | 0.2 | 0.2 |
| $p_{\text{parent}}$ | 3 | 2 | 2 | 2 |
| $p_{\text{child}}$ | 10 | 5 | 10 | 10 |
| $N$ (pool cap) | 40 | 10 | 40 | 40 |
| $G$ (generations) | 30 | 30 | 30 | 30 |
| seed | 21 | — | 21 | 42 |
实验设计
15 个 LLM(6 个家族)
| 家族 | 模型 |
|---|---|
| OpenAI | GPT-4o, GPT-4o-mini, GPT-3.5-turbo |
| Google Gemini | Gemini-1.5-flash, Gemini-1.5-pro |
| Google Gemma | Gemma-3n-4b |
| Meta Llama | llama-3.1-70b-instruct, llama-3.1-8b-instruct, llama-3.2-1b-instruct, llama-3.2-3b-instruct |
| DeepSeek | Deepseek-V3 |
| Mistral | Mistral-7b-instruct, Mistral-24b-instruct, Mistral-large, Magistral-small |
8 个任务(4 个领域)
| 领域 | 任务 | 基因组 | 适应度 |
|---|---|---|---|
| Route Optimization | TSP-30, TSP-60 | 城市索引排列 | 路径总长度的倒数 |
| Prompt Optimization | SAMSum (摘要), ASSET (简化) | 自然语言指令 prompt | ROUGE-L / SARI(冻结 gpt-4o-mini 评估) |
| Equation Discovery | Oscillator-1 (3 变量), Oscillator-2 (4 变量) | Python 函数字符串 | $1 - \text{norm}(\text{MSE})$ |
| Heuristic Design | Bin Packing OR3, Weibull | Python 优先级函数 | 使用箱子数的倒数 |
Zero-shot 评估
每个模型-任务对,在 6 个温度($T \in \{0.0, 0.2, 0.4, 0.6, 0.8, 1.0\}$)下各采 2 个样本,取最优适应度作为 zero-shot 性能。
扰动实验设计(Model Mixing)
每代中,一部分后代由替代模型(弱精炼器)生成,其余由主模型(强精炼器)生成。构造 zero-shot 可比但精炼能力对比鲜明的模型对:
| 任务 | Good Refiner | Bad Refiner |
|---|---|---|
| TSP-60 | Mistral-24B | Mistral-7B |
| Summarization | DeepSeek-V3 | GPT-4o-mini |
| Oscillator-1 | GPT-3.5-Turbo | Gemma-3n-4B |
| Bin-Packing-OR3 | Mistral-24B | LLaMA-3.2-3B-Instruct |
实验结果
4.1 基础模型能力:强但不完全的预测器
Zero-shot 性能与进化后性能强正相关,但只解释部分方差。例如在 zero-shot ≈ 0.4 附近,多个模型紧密聚集却最终性能大幅分散。这表明存在一种区别于"解题能力"的"可优化能力"(optimizable ability)。
4.2.1 Novelty vs Breakthrough 动态
Novelty 不预测性能(Table 13)
| 模型 | 预测器 | β | p | R² |
|---|---|---|---|---|
| M1 | avg_novelty | −0.027 | 0.710 ns | 0.001 |
| M2 | initial_nov | −0.042 | 0.681 ns | 0.002 |
| M3 | zero_shot | 0.322* | 0.016 | 0.103 |
| M4 | ZS + AvgNov | ZS 0.322*, Nov 0.002 ns | — | 0.103 |
Breakthrough Rate 强预测性能(Table 14)
| 模型 | 预测器 | β | p | R² |
|---|---|---|---|---|
| M6 | breakthrough_rate | 0.445*** | <0.001 | 0.198 |
| M7 | zero_shot | 0.322* | 0.016 | 0.103 |
| M8 | ZS + BR | ZS 0.226 ns, BR 0.389*** | — | 0.246 |
当加入 breakthrough rate 后,zero-shot 的系数从 0.322* 降至 0.226(不再显著),而 BR 保持 0.389***。这意味着部分零分能力的预测力是通过"生成持续改进的能力"中介的。好的优化轨迹倾向于频繁产出小幅改进,而非罕见的大突破后长 plateau。
4.2.2 语义几何:局部化 vs 漂移
尽管 zero-shot 性能相近且初始种群相同,Gemini-1.5-Pro 渐进地将搜索收缩到更小的语义区域,而 Mistral-7B-Instruct 持续在远距离区域漂移。
4.2.3 生成级统计检验:Novelty 的条件性
| 固定效应 | Concurrent β | p | Lagged β | p |
|---|---|---|---|---|
| $H_{\text{fitness}}$ | −0.073 | 0.005 | −0.074 | 0.002 |
| $H_{\text{spatial}}$ | −0.015 ns | 0.532 | 0.012 ns | 0.593 |
| mean_novelty | 0.070** | 0.006 | 0.016 ns | 0.517 |
| max_novelty | 0.029 ns | 0.202 | 0.006 ns | 0.787 |
| novelty × $H_{\text{spatial}}$ | −0.090*** | <0.001 | −0.051*** | <0.001 |
| generation | −0.250*** | <0.001 | −0.193*** | <0.001 |
Novelty 仅在搜索保持局部化时才提升突破概率。交互项 novelty × $H_{\text{spatial}}$ 在 concurrent 和 lagged 中均显著为负——novelty 高但空间分散也高时,突破概率反而低。且 lagged 中 mean_novelty 主效应消失但交互项仍显著,说明 novelty 的生产力取决于种群的几何状态,而非仅是同时代相关。
4.3 算子级验证
4.3.1 模型级回归(Table 1)
| 预测器组合 | 关键系数 | 解读 |
|---|---|---|
| ZS + PCD | ZS 0.233*, PCD −0.329** | 大语义步长单独看有害 |
| ZS + LRR + PCD | LRR 0.528***, PCD −0.024 ns, ZS 0.144 ns | LRR 吸收了 PCD 的负面效应;大编辑通过降低精炼可靠性来伤害性能 |
好的 LLM 优化器是局部精炼器——性能由可靠增量改进的能力决定,而非语义变异的幅度。
4.3.2 扰动实验:Model Mixing(Figure 7)
注入低精炼算子会削弱系统产出持续改进的能力,导致更差的结果。这是对"局部精炼行为"因果角色的干预证据。
4.4 成本效率(Figure 8)
强 zero-shot 模型不总是带来每美元比例增益。部分中型模型以低成本实现大改进。这强化了核心主张:有效的进化优化更多取决于模型如何随时间精炼解,而非原始解题能力。
鲁棒性:温度敏感性(Table 11, Figure 9)
| 任务 | 模型 | Pearson r (LRR vs perf) | p |
|---|---|---|---|
| Oscillator | Mistral-7B | 0.49 | 0.209 ns |
| Oscillator | Mistral-24B | 0.32 | 0.433 ns |
| TSP | Mistral-7B | 0.76* | 0.027 |
| TSP | Mistral-24B | 0.92*** | 0.000 |
局部精炼能力与性能的正向关系在 $T \in \{0.0 \ldots 1.3\}$ 范围内保持稳定。精炼行为是"模型 + prompt + 解码配置"整个系统的稳定属性。
我的评论
亮点
- 大规模控制实验设计扎实:15 模型 × 8 任务 × 72K 候选解,固定初始种群和进化协议,使模型间比较干净。
- 多层证据链完整:轨迹级(OLS)→ 生成级(GLMM 混合效应)→ 算子级(LRR/PCD)→ 干预级(model mixing),从相关到因果逐步推进。
- 语义几何框架可复用:核密度熵 + MDS 可视化提供了一套通用的轨迹分析工具,适用于其他迭代搜索/智能体行为研究。
- 成本效率视角实用:为从业者提供了"选模型不等于选最强模型"的可操作建议。
局限与残留风险
- 扰动实验不能完全隔离局部精炼(论文自己承认):替换生成后代的模型可能同时改变推理模式、探索倾向等潜在特征,无法将性能差异仅归因于局部精炼。
- 固定进化协议:选择压力、后代大小、采样策略等设计选择可能影响 exploration–exploitation 平衡,未系统测试。
- Novelty 仅用最近邻距离:KNN/平均距离新颖性和替代多样性指数未测试鲁棒性。
- 方程发现任务例外:Figure 13 显示该任务 zero-shot 与最终性能关系弱——论文提及但未深入解释,可能是该领域语义距离度量或 fitness landscape 特殊性导致。
- 尚未提出运行时调度器:交互效应是稳健发现,但论文未设计自适应算法在搜索过程中动态调节 novelty/dispersion。这是明显的后续工作方向。
- 温度鲁棒性仅测 2 模型 × 2 任务族:虽然方向一致,但覆盖面有限。
对 exploration–exploitation 研究的直接启示
本文的证据支持的是:在 LLM 引导的进化搜索中,搜索天然偏向 exploitation(语义先验替代了随机变异),此时增加全局 exploration(高 novelty + 高 dispersion)通常不产生回报。但这不等同于"exploration 在所有设定下都是坏的"——在经典随机变异算子、不同搜索空间结构、或不同任务族中结论可能不同。本文的发现是设定特定的。
"Novelty 不预测性能"是在LLM 语义变异语境下——LLM 的 novelty 来自语义先验内的有结构变异,而非随机搜索。在经典进化算法或纯随机搜索中,novelty-diversity 关系可能完全不同。
后续工作方向
- 设计基于实时几何状态的自适应调度器:在搜索局部化时允许更多 novelty,在分散时增加 exploitation 压力。
- 训练/微调 LLM 作为专用搜索算子(如 EvoTune 方向),强调局部精炼和纠错而非通用能力。
- 扩展到更多进化协议变体(选择压力、后代大小、多种群)以检验结论的协议独立性。
- 研究语义空间结构对最优 exploration 策略的影响——不同任务的 fitness landscape 几何可能要求不同的 exploration 强度。
One More Thing
本文无意中揭示了一个更深层的概念:"可优化能力"(optimizable ability)与"解题能力"(problem-solving ability)是可分离的。一个模型可以擅长一次性解题但不擅长迭代精炼,反之亦然。这对 LLM 评估范式有根本含义——我们可能需要一套独立的"算子评估"体系,而非仅用 zero-shot/chain-of-thought benchmarks 来选择用于进化/智能体系统的模型。Mistral-24B 的 Pareto 表现就是这一分离的最佳证据:它不是最强的解题器,但却是最可靠的精炼器。
完整图谱 / Figure Gallery
附录及补充可视化图表全集。以下图片均来自论文 PDF 的 Marker 布局解析,未在主叙事中展开的在此完整收录。
注:Figure 12(novelty × spatial entropy 交互热力图)已在主叙事"实验结果"中展示。
Reference / Evidence
xinhao-zhang.github.io/traj_evo_search
Šurina et al. (2025), "Algorithm Discovery with LLMs: Evolutionary Search Meets Reinforcement Learning", OpenReview
训练 LLM 作为专用搜索算子的方向
Shojaee et al. (2025a), "LLM-SR: Scientific Equation Discovery via Programming with LLMs", arXiv:2404.18400
Novikov et al. (2025), "AlphaEvolve: A Coding Agent for Scientific and Algorithmic Discovery", arXiv:2506.13131
Romera-Paredes et al. (2023), "Mathematical Discoveries from Program Search with LLMs", Nature
Fei Liu et al. (2024), "Evolution of Heuristics", arXiv:2401.02051
Peyrard et al. (2025), "Agentic AI: The Era of Semantic Decoding", arXiv:2403.14562