← 科研空间 首页
ACL 2026 Findings Trajectory Analysis Exploration vs Exploitation

什么让 LLM 成为好的优化器?

What Makes an LLM a Good Optimizer? A Trajectory Analysis of LLM-Guided Evolutionary Search — 15 个 LLM × 8 个任务 × 72K 候选解的大规模轨迹分析

📄 ACL Anthology 官方页面 ⬇️ 原版 PDF 🌐 项目网站 📊 轨迹数据集

阅读依据:ACL Anthology 2026.findings-acl.1252 官方 PDF + Marker 布局解析,检索日期 2026-07-15。本页为深度阅读 Cheat-Sheet,非论文原文翻译。

先给结论

核心发现

强 LLM 优化器是"局部精炼器"(local refiner)。它们在语义空间中渐进地收缩搜索范围,围绕高适应度区域频繁产出小幅增量改进。弱优化器则在语义空间中大幅漂移,偶有突破后陷入停滞。

五句话总结

  1. Zero-shot 能力是强但不完全的预测器——零分能力相近的模型,进化后性能可以天差地别(Figure 3)。
  2. Novelty(新颖性)本身不预测最终性能——平均新颖性、初始新颖性的回归系数接近零,统计不显著(Figure 4, Table 13)。
  3. Breakthrough rate(突破率)强预测性能——单独解释的方差约为 zero-shot 的 2 倍,且部分中介了 zero-shot 的预测力(Figure 4, Table 14)。
  4. Novelty 只有条件性有用——混合效应模型显示 novelty × spatial entropy 交互项显著为负:novelty 仅在搜索保持局部化(低空间熵)时才提升突破概率(Figure 6, Table 15, Figure 12)。
  5. 干预实验验证因果方向——model mixing 扰动实验中注入弱精炼器后代会使性能单调下降,且与精炼率下降协同变化(Figure 7)。
关键区分 · 不可过度解读

本文不是说"exploration 是坏的"。精确表述是:"在本文的实验设置下,非局部化的探索(unlocalized exploration)通常是低效的。"在高质量区域内进行的局部化探索(localized novelty)恰恰是突破的驱动力。这是轨迹层面的观测证据 + 扰动证据,尚未构成可部署的因果调度器。

15 LLMs6 个模型家族:OpenAI / Gemini / Gemma / Llama / DeepSeek / Mistral
8 Tasks4 个领域:路径优化 / 提示优化 / 方程发现 / 启发式设计
72K+ API calls30 代 × 10 后代 × 2 种子 × 15 模型 × 8 任务
~$500 总成本基于 OpenRouter 定价估算
Temperature 0.7默认;鲁棒性检验 T∈{0.0…1.3}
Pareto 模型Mistral-24B-Instruct:低成本大改进

研究动机

LLM 被越来越多地用作进化/智能体优化系统中的搜索算子(search operator):反复提出候选解、接收适应度反馈、迭代改进。在 prompt 优化、科学发现、组合优化等领域都展示了显著的经验收益。然而,这些收益背后的机制仍然不清楚

核心观察:在严格控制进化循环、选择规则和评估函数的条件下,不同 LLM 产生截然不同的优化轨迹和最终性能。这引出本文的中心问题:

研究问题

是什么解释了模型间如此大的优化性能差异?这些差异主要反映基础模型能力,还是源于模型所诱导的 exploration–exploitation 动态的更微妙差异?

Figure 1: Two optimization trajectories on TSP-60
Figure 1 · TSP-60 上两个 LLM 的不同优化轨迹。每个点代表一个候选解,按代数着色。Gemini-1.5-Pro(左)展示持续的适应度提升和渐进局部化;Mistral-7B-Instruct(右)维持高新颖性但未能转化为适应度增益。(图片本身仅展示这两个模型在该任务上的轨迹散点)

Figure 1 是一个直观的例子:两个 zero-shot 性能相近的模型,在相同初始种群和相同进化条件下,走出完全不同的轨迹。这恰恰是 zero-shot 能力无法完全解释的残差。

经典直觉 vs 本文发现

在经典进化算法中,mutation 是随机算子,exploration(探索/新颖性)被视为发现更优解的关键。由于 LLM 的 mutation 不再随机——而是由语义先验引导、以"生成更好解"为目标——搜索天然偏向 exploitation。自然假设是:增加 exploration(novelty)应该能改善性能

反直觉发现

本文结果否定了这一直觉。最成功的轨迹不是那些高新颖性的轨迹,而是那些频繁且持续地产出小幅突破的轨迹。这与传统元启发式中"大突破罕见,长 plateau 后小幅精炼"的模式不同。

数学表示及建模

进化搜索循环

遵循 Novikov et al. (2025) 的轻量级进化搜索框架,LLM 作为语义变异算子(semantic variation operator)。

$$E^t = \text{Top}_{\lceil qN \rceil}(P^t), \quad q = 0.2$$ $$\Pr(x \mid E^t) \propto f^T(x) \quad \text{(fitness-proportional parent sampling)}$$ $$f^{\star}_t = \max_{x \in P^t} f^T(x) \quad \text{(best-so-far fitness)}$$

Novelty(新颖性)计算

候选解 $a$ 相对于所有先前解集合 $A_{\text{prior}}$ 的任务特定语义距离:

$$\text{nov}(a, A_{\text{prior}}) = \min_{b \in A_{\text{prior}}} D^T(a, b)$$

在子任务级别归一化以保证可比性。

任务特定语义距离

任务 距离度量 公式
TSP Edge-set distance(旋转/起点不变) $D_{\text{edge}}(\pi,\sigma) = 1 - \frac{|E(\pi) \cap E(\sigma)|}{|E(\pi)|}$
Prompt Optimization 嵌入空间余弦距离 $D_{\cos} = 1 - \frac{E(p_1) \cdot E(p_2)}{\|E(p_1)\| \|E(p_2)\|}$
Equation Discovery / Heuristic 功能行为距离 $D_{\text{sem}}(f,g) = 1 - \frac{1}{m}\sum_{j=1}^{m} \cos\big(f(x_j), g(x_j)\big)$

语义几何:核密度熵

将所有候选解嵌入任务特定的共享语义空间,用核密度估计量化每代候选解的空间分布。设 $x_i \in \mathbb{R}^d$ 为解 $i$ 的嵌入,$K(\cdot,\cdot)$ 为高斯核:

$$g_i = \sum_j w_j K(x_i, x_j), \quad q_i = \frac{g_i}{\sum_k g_k}$$ $$H = -\sum_i q_i \log q_i$$
度量 权重设定 含义
$H_{\text{spatial}}$ $w_j = 1$ 候选解在语义空间中分布的广度——全局扩散 vs 局部集中
$H_{\text{fitness}}$ $w_j = f_j$ 高质量解是聚集还是分散——高适应度解的拓扑集中度

算子级指标

指标 定义 含义
LRR (Local Refinement Rate) 后代严格优于其 prompted parent 的频率(占有效后代比例) 局部精炼能力
PCD (Parent–Child Distance) 后代与父代之间的平均语义距离 语义步长大小
Breakthrough Rate 达到 best-so-far 改进事件的代数比例 持续突破能力

混合效应回归模型

对生成级突破概率建模,含模型级随机截距:

$$\text{prob\_breakthrough}_{g,m,t,z} = \beta_0 + \beta_1 H_{\text{fitness},z} + \beta_2 H_{\text{spatial},z} + \beta_3 \overline{\text{nov}}_z + \beta_4 \text{max\_nov}_z + \beta_5 (\overline{\text{nov}}_z \times H_{\text{spatial},z}) + \gamma_t \mathbf{1}_t + \beta_6 \text{gen}_z + u_m + \epsilon$$

同时拟合 concurrent(同代)和 lagged(预测下一代)两个规格。

算法流程 / 方法

Figure 2: Framework overview
Figure 2 · LLM 驱动进化搜索框架概览。左:跨代进化过程;右:代内循环——种群初始化、LLM 引导变异、适应度评估、选择;底部:四个任务及其对应的基因组表示。

进化循环五步

  1. Population Initialization:固定初始种群 $P^0$,跨所有模型共享同一任务。
  2. Fitness Evaluation:任务特定 $f^T(\cdot)$;无效/不可解析输出 → 零适应度。
  3. Selection (Top-q Weighted):精英子集 $E^t = \text{Top}_{\lceil qN \rceil}(P^t)$,$q=0.2$;父代按适应度比例采样。
  4. Mutation (LLM):选中父代基因组作为 prompt 上下文 → LLM 生成后代基因组 $C^t$。
  5. Population Pool Update:去重、合并、保留 top-N;更新 $f^{\star}_t$。

实验规模参数

参数 TSP Prompt Opt Equation Discovery Heuristic Design
$n_{\text{init}}$ 40 10 7 7
$q$ (elite) 0.2 0.2 0.2 0.2
$p_{\text{parent}}$ 3 2 2 2
$p_{\text{child}}$ 10 5 10 10
$N$ (pool cap) 40 10 40 40
$G$ (generations) 30 30 30 30
seed 21 21 42

实验设计

15 个 LLM(6 个家族)

家族 模型
OpenAI GPT-4o, GPT-4o-mini, GPT-3.5-turbo
Google Gemini Gemini-1.5-flash, Gemini-1.5-pro
Google Gemma Gemma-3n-4b
Meta Llama llama-3.1-70b-instruct, llama-3.1-8b-instruct, llama-3.2-1b-instruct, llama-3.2-3b-instruct
DeepSeek Deepseek-V3
Mistral Mistral-7b-instruct, Mistral-24b-instruct, Mistral-large, Magistral-small

8 个任务(4 个领域)

领域 任务 基因组 适应度
Route Optimization TSP-30, TSP-60 城市索引排列 路径总长度的倒数
Prompt Optimization SAMSum (摘要), ASSET (简化) 自然语言指令 prompt ROUGE-L / SARI(冻结 gpt-4o-mini 评估)
Equation Discovery Oscillator-1 (3 变量), Oscillator-2 (4 变量) Python 函数字符串 $1 - \text{norm}(\text{MSE})$
Heuristic Design Bin Packing OR3, Weibull Python 优先级函数 使用箱子数的倒数

Zero-shot 评估

每个模型-任务对,在 6 个温度($T \in \{0.0, 0.2, 0.4, 0.6, 0.8, 1.0\}$)下各采 2 个样本,取最优适应度作为 zero-shot 性能。

扰动实验设计(Model Mixing)

每代中,一部分后代由替代模型(弱精炼器)生成,其余由主模型(强精炼器)生成。构造 zero-shot 可比但精炼能力对比鲜明的模型对:

任务 Good Refiner Bad Refiner
TSP-60 Mistral-24B Mistral-7B
Summarization DeepSeek-V3 GPT-4o-mini
Oscillator-1 GPT-3.5-Turbo Gemma-3n-4B
Bin-Packing-OR3 Mistral-24B LLaMA-3.2-3B-Instruct

实验结果

4.1 基础模型能力:强但不完全的预测器

Figure 3: Zero-shot vs final performance scatter
Figure 3 · Zero-shot 性能与最终优化性能散点图(跨模型,跨任务聚合)。正相关但存在显著残差分散——zero-shot 分数相近的模型最终性能差异很大。(图片本身仅展示散点关系)

Zero-shot 性能与进化后性能强正相关,但只解释部分方差。例如在 zero-shot ≈ 0.4 附近,多个模型紧密聚集却最终性能大幅分散。这表明存在一种区别于"解题能力"的"可优化能力"(optimizable ability)

4.2.1 Novelty vs Breakthrough 动态

Figure 4: OLS regression results
Figure 4 · OLS 回归结果。(左) 标准化系数;(右) 解释力 (R²)。Breakthrough rate 系数最大且高度显著;novelty 类预测器系数接近零且不显著。(图片本身仅展示统计系数和 R² 对比)

Novelty 不预测性能(Table 13)

模型 预测器 β p
M1 avg_novelty −0.027 0.710 ns 0.001
M2 initial_nov −0.042 0.681 ns 0.002
M3 zero_shot 0.322* 0.016 0.103
M4 ZS + AvgNov ZS 0.322*, Nov 0.002 ns 0.103

Breakthrough Rate 强预测性能(Table 14)

模型 预测器 β p
M6 breakthrough_rate 0.445*** <0.001 0.198
M7 zero_shot 0.322* 0.016 0.103
M8 ZS + BR ZS 0.226 ns, BR 0.389*** 0.246
关键解读

当加入 breakthrough rate 后,zero-shot 的系数从 0.322* 降至 0.226(不再显著),而 BR 保持 0.389***。这意味着部分零分能力的预测力是通过"生成持续改进的能力"中介的。好的优化轨迹倾向于频繁产出小幅改进,而非罕见的大突破后长 plateau。

4.2.2 语义几何:局部化 vs 漂移

Figure 5: Search geometry contrast
Figure 5 · 搜索几何对比。(a) MDS 可视化:Gemini-1.5-Pro 形成收敛解簇(黄色),Mistral-7B 持续漂移;(b) 平均最优适应度曲线;(c) 空间熵量化候选解组织;(d) 适应度-空间熵显示 Gemini 的解高质量且拓扑集中。

尽管 zero-shot 性能相近且初始种群相同,Gemini-1.5-Pro 渐进地将搜索收缩到更小的语义区域,而 Mistral-7B-Instruct 持续在远距离区域漂移。

4.2.3 生成级统计检验:Novelty 的条件性

Figure 6: Mixed-effects regression
Figure 6 · 生成级混合效应回归系数:concurrent(左)和 lagged(右)。novelty × spatial entropy 交互项在两个规格中均显著为负 (***p<0.001)。(图片本身仅展示系数和显著性)
固定效应 Concurrent β p Lagged β p
$H_{\text{fitness}}$ −0.073 0.005 −0.074 0.002
$H_{\text{spatial}}$ −0.015 ns 0.532 0.012 ns 0.593
mean_novelty 0.070** 0.006 0.016 ns 0.517
max_novelty 0.029 ns 0.202 0.006 ns 0.787
novelty × $H_{\text{spatial}}$ −0.090*** <0.001 −0.051*** <0.001
generation −0.250*** <0.001 −0.193*** <0.001
核心交互效应

Novelty 仅在搜索保持局部化时才提升突破概率。交互项 novelty × $H_{\text{spatial}}$ 在 concurrent 和 lagged 中均显著为负——novelty 高但空间分散也高时,突破概率反而低。且 lagged 中 mean_novelty 主效应消失但交互项仍显著,说明 novelty 的生产力取决于种群的几何状态,而非仅是同时代相关。

Figure 12: Novelty × spatial entropy heatmap
Figure 12 · Novelty 与空间熵的交互热力图。每格报告按平均新颖性和空间熵分箱后的经验突破概率(z-scored)。颜色越深 = 突破概率越高。突破事件集中在高 novelty + 低空间熵区域。

4.3 算子级验证

4.3.1 模型级回归(Table 1)

预测器组合 关键系数 解读
ZS + PCD ZS 0.233*, PCD −0.329** 大语义步长单独看有害
ZS + LRR + PCD LRR 0.528***, PCD −0.024 ns, ZS 0.144 ns LRR 吸收了 PCD 的负面效应;大编辑通过降低精炼可靠性来伤害性能

好的 LLM 优化器是局部精炼器——性能由可靠增量改进的能力决定,而非语义变异的幅度。

4.3.2 扰动实验:Model Mixing(Figure 7)

Figure 7: Model mixing effect
Figure 7 · Model mixing 对优化性能(实线)和精炼率(虚线)的影响。弱精炼器后代比例增加时,TSP-60 和 bin packing 性能急剧单调下降,精炼率协同下降。Prompt 优化中效应较弱且不一致。(图片本身仅展示趋势曲线)

注入低精炼算子会削弱系统产出持续改进的能力,导致更差的结果。这是对"局部精炼行为"因果角色的干预证据

4.4 成本效率(Figure 8)

Figure 8: Cost vs improvement
Figure 8 · 各 LLM 的优化增益与估算成本(跨任务聚合)。Mistral-24B-Instruct 位于 Pareto 前沿——大改进 + 中等成本。(图片本身仅展示散点关系)

强 zero-shot 模型不总是带来每美元比例增益。部分中型模型以低成本实现大改进。这强化了核心主张:有效的进化优化更多取决于模型如何随时间精炼解,而非原始解题能力

鲁棒性:温度敏感性(Table 11, Figure 9)

任务 模型 Pearson r (LRR vs perf) p
Oscillator Mistral-7B 0.49 0.209 ns
Oscillator Mistral-24B 0.32 0.433 ns
TSP Mistral-7B 0.76* 0.027
TSP Mistral-24B 0.92*** 0.000

局部精炼能力与性能的正向关系在 $T \in \{0.0 \ldots 1.3\}$ 范围内保持稳定。精炼行为是"模型 + prompt + 解码配置"整个系统的稳定属性。

我的评论

亮点

局限与残留风险

对 exploration–exploitation 研究的直接启示

精确边界

本文的证据支持的是:在 LLM 引导的进化搜索中,搜索天然偏向 exploitation(语义先验替代了随机变异),此时增加全局 exploration(高 novelty + 高 dispersion)通常不产生回报。但这不等同于"exploration 在所有设定下都是坏的"——在经典随机变异算子、不同搜索空间结构、或不同任务族中结论可能不同。本文的发现是设定特定的

不可过度外推

"Novelty 不预测性能"是在LLM 语义变异语境下——LLM 的 novelty 来自语义先验内的有结构变异,而非随机搜索。在经典进化算法或纯随机搜索中,novelty-diversity 关系可能完全不同。

后续工作方向

One More Thing

研究洞察

本文无意中揭示了一个更深层的概念:"可优化能力"(optimizable ability)与"解题能力"(problem-solving ability)是可分离的。一个模型可以擅长一次性解题但不擅长迭代精炼,反之亦然。这对 LLM 评估范式有根本含义——我们可能需要一套独立的"算子评估"体系,而非仅用 zero-shot/chain-of-thought benchmarks 来选择用于进化/智能体系统的模型。Mistral-24B 的 Pareto 表现就是这一分离的最佳证据:它不是最强的解题器,但却是最可靠的精炼器。

Reference / Evidence

项目网站(含交互式 MDS 可视化)
xinhao-zhang.github.io/traj_evo_search
轨迹数据集
HuggingFace: LivevreXH/evo_llm_trajectories
15 LLMs × 8 tasks 的完整优化轨迹数据
API 定价参考
OpenRouter
成本估算基于此平台定价
MDS 加速工具
PyGlimmerMDS
GPU 加速多层 MDS 变体,用于大规模嵌入降维
关键引用 · EvoTune
Šurina et al. (2025), "Algorithm Discovery with LLMs: Evolutionary Search Meets Reinforcement Learning", OpenReview
训练 LLM 作为专用搜索算子的方向
关键引用 · LLM-SR
Shojaee et al. (2025a), "LLM-SR: Scientific Equation Discovery via Programming with LLMs", arXiv:2404.18400
关键引用 · AlphaEvolve
Novikov et al. (2025), "AlphaEvolve: A Coding Agent for Scientific and Algorithmic Discovery", arXiv:2506.13131
关键引用 · FunSearch / EoH
Romera-Paredes et al. (2023), "Mathematical Discoveries from Program Search with LLMs", Nature
Fei Liu et al. (2024), "Evolution of Heuristics", arXiv:2401.02051
关键引用 · Agentic AI
Peyrard et al. (2025), "Agentic AI: The Era of Semantic Decoding", arXiv:2403.14562