ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

腾讯:评估大模型全局最优决策能力

腾讯:评估大模型全局最优决策能力 标题AlgoWorlds: Benchmarking Tool Use for Global Optimization in Algorithmic Worlds来源arXiv, 2608.29397v1️文章简介研究问题大语言模型代理能否将通过工具获取的信息转化为全局最优决策而不仅仅是可行解主要贡献论文提出AlgoWorlds基准将组合优化问题转化为部分可观测环境严格评估LLM在信息受限下的全局优化能力。重点思路构建算法世界定义包含隐藏优化实例、文本查询和特定信息工具的环境。代理需通过多轮工具调用收集信息并在预算限制下提交结构化决策。生成验证实例涵盖路由、覆盖、调度等10类组合优化家族。使用确定性程序生成隐藏实例并通过独立精确算法认证全局最优解及唯一性确保基准的可控性与可审计性。设计双重接口为每个实例提供直接和中介两种结构不同的多工具接口暴露相同底层决策信息但呈现方式不同以测试模型对信息呈现的敏感性。多维评估体系设立精确最优性、可行性和参考效用三个最终决策指标以及信息充分性和发现覆盖率两个轨迹诊断指标区分信息获取与推理整合能力。分析总结最优性差距显著即使是最先进的模型如Claude Opus 4.8精确最优率仅为38.61%远低于其可行性得分约96%。多数失败案例为可行但非最优解。信息整合是瓶颈超过89%的轨迹收集了足以重构实例并确定最优解的信息但其中仅约41%实现了全局最优。这表明挑战不在于信息获取而在于全局约束推理和信息整合。任务家族差异大模型在不同优化家族上表现悬殊如在篮子组装任务上可达100%最优而在交通路由等任务上接近0%。这种差异不能仅由经典渐近复杂度解释。负载影响性能随着基于原始操作数定义的工作负载等级增加所有模型的决策性能均呈下降趋势证明该工作量度量有效捕捉了任务难度。个人观点论文将评估重点转向“全局最优性”通过引入隐藏实例和精确验证机制它揭示了当前LLM在复杂约束下进行联合推理的根本弱点。
返回列表