LoHoSearch – 美团发布的高难度搜索智能体评测基准

LoHoSearch是美团LongCat团队发布的高难度搜索智能体评测基准,旨在突破传统人工构建评测的难度上限,通过基于762万实体维基百科知识图谱的自动化题目生成,系统性控制”搜索空间”与”结构复杂度”双维度难度,精准暴露当前大模型在长链条、多步骤复杂搜索任务中的能力瓶颈将搜索智能体评测从”人工经验驱动”转向”数据指标驱动”,使顶尖模型准确率从BrowseComp等传统基准的90%以上骤降至34.74%,重新建立具有区分度的行业评估标尺。

LoHoSearch - 美团发布的高难度搜索智能体评测基准

LoHoSearch核心特点

1. 知识图谱驱动的自动化构建

  • 基于762万维基百科实体和2.65亿条有向边构建全局知识图谱,避免人工出题的认知局限,确保题目难度源于真实知识网络拓扑特性。
  • 通过量化指标控制难度
    • 搜索空间:满足单一条件的候选实体数量(如”评分4.5以上且人均200元的餐厅”)。
    • 结构复杂度:锁定答案需同时满足的条件数量及逻辑依赖关系(如环形约束、交叉条件)。

2. 双结构题目设计

  • 树状结构:侧重扩大搜索空间(例如单条件筛选出大量候选实体),考验模型在宽泛结果中的精准过滤能力。
  • 图状结构:引入环形依赖与交叉约束(如”A在B附近且B在C附近,但C不在A附近”),叠加结构复杂度,显著提升推理难度

3. 高可靠性题目生成流程

  • 采用”子图采样→关系混淆→搜索验证→人工审核“四层自动化流程,75.5%题目直接通过人工复核,仅2.2%因严重问题被丢弃。
  • 最终收录544道人工核验题目,覆盖音乐、地理、影视、体育等11个领域,确保问题真实性和逻辑严谨性

LoHoSearch技术原理

1. 知识图谱难度量化机制

  • 实体热度筛选:优先选择低流行度实体(入度低的维基页面),避免简单推断。
  • 关系搜索空间控制:基于图谱全局统计,筛选大搜索空间关系(如”同属一个导演的电影”比”同属一个演员”更易产生海量候选)。
  • 答案唯一性保障:通过图谱路径验证,确保每道题在知识层面存在唯一正确答案

2. 自动化题目生成流程

  • 子图采样:从知识图谱中提取满足预设难度参数的树状/图状子图。
  • 自然语言转化:将结构化子图转化为符合人类表达习惯的问题,保留关键约束条件(如”距离地铁站500米内、营业至22点后的川菜馆”)。
  • 多轮验证机制
    • 工具调用验证:模拟智能体搜索路径,确认答案可达性。
    • 人工复核:标注员微调歧义表述,剔除逻辑漏洞

3. 双重评估机制

  • 裁判模型协同评分:结合GPT-4.1与Qwen2.5-32B的判断取平均分,减少单一模型偏好导致的评估偏差
  • 置信度校准分析:同步测量模型对答案的自信程度与实际准确率的匹配度,暴露”过度自信”问题(如GPT-5.5校准误差达48%)。

LoHoSearch功能表现

1. 显著拉低模型准确率

  • 顶尖模型表现:GPT-5.5准确率仅34.74%,远低于其在BrowseComp上的90%+表现,断层式领先第二名(15.99%)
  • 模型能力断层:头部模型(GPT-5.5)与其余模型差距近20个百分点,有效区分真实能力差异

2. 暴露核心能力瓶颈

  • 工具调用成本激增:解题平均需61次工具调用,比BrowseComp多74%,反映长链条推理的效率缺陷
  • 结构复杂度敏感:图状结构题目准确率仅8.01%,远低于树状结构的11.89%,证明复杂逻辑依赖是独立难点
  • 上下文管理失效:最优策略(Discard-all + Verify)仅提升6.8%准确率,远低于BrowseComp的14%增益,说明长程信息丢失问题难以通过简单压缩解决

3. 置信度校准能力不足

  • 多数模型高估自身答案可靠性(如Gemini-3.1-Pro校准误差72%),在不确定时仍输出错误答案。
  • 并行采样16次后,DeepSeek-V4-Flash的pass@16升至38.3%,但最优答案聚合策略(best-of-N)仅24.6%,显示置信度评估机制不完善

LoHoSearch项目地址

  • HuggingFace模型库:https://huggingface.co/datasets/meituan-longcat/LoHoSearch

LoHoSearch应用场景

1. 搜索智能体能力诊断

  • 精准定位技术短板:区分模型在”宽泛结果过滤”与”复杂逻辑推理”中的具体缺陷,指导针对性优化。
  • 避免基准饱和陷阱:当传统评测(如BrowseComp)因难度不足失去区分度时,提供持续有效的评估工具

2. 长链条推理技术研发

  • 验证上下文管理策略:测试摘要、丢弃重置等方法在超长推理链中的有效性,推动记忆机制创新
  • 驱动工具调用优化:针对平均61次工具调用的高成本,促进高效搜索路径规划算法发展

3. 行业标准与落地指导

  • 设定合理能力预期:揭示当前搜索智能体在复杂任务中准确率不足35%的现实,避免过度承诺。
  • 聚焦关键场景落地:优先应用于结构简单、约束明确的任务(如单条件商户查询),暂缓部署高复杂度需求。

LoHoSearch同类产品对比

表格
对比维度LoHoSearchBrowseComp
研发团队美团 LongCat(国产)OpenAI(海外)
核心亮点依托知识图谱自动生成难题,侧重长链路多约束复杂搜索任务人工编撰试题,适合常规多轮网页检索评测
难度特点搜索空间更大、图结构推理,区分难度更高线性检索任务居多,现有模型容易刷高分数
题目来源维基百科知识图谱自动生成,附带人工核验专家人工编写构建测试集
数据集规模544 道核验试题,覆盖 11 大领域1266 道人工设计问题
适用方向测试搜索智能体长程线索关联、多条件筛选能力通用网页浏览智能体基础能力测评

LoHoSearch将评测基准从”人类可设计难度”推进到”知识图谱全局难度”。传统人工出题受限于标注者认知盲区,难以构造真正高难度问题(如需同时满足5个交叉条件且候选实体超千个),而LoHoSearch通过量化控制搜索空间与结构复杂度,首次系统性暴露了当前大模型在多步关联推理中的根本局限——即使顶尖模型也仅能解决三分之一的复杂搜索任务。这一基准不仅为技术迭代提供靶向标尺,更警示行业:搜索智能体需从”单点信息检索”向”长链条决策支持”跨越,否则难以满足真实场景中”在珠江新城附近找评分4.8以上、人均300元、包厢需提前3天预约且有停车位的粤菜馆”这类复合需求。当前技术瓶颈集中于长程信息保持置信度校准,未来突破需结合更精细的上下文压缩机制与动态不确定性评估。

© 版权声明
为这篇文章评分
10.0/ 10
1 人评价
点击⭐️进行评分

相关文章

暂无评论

none
暂无评论...