从BrowseComp到LoHoSearch:美团LongCat如何重塑搜索推理边界?
近日,美团旗下LongCat团队在搜索推理领域投下一枚重磅炸弹:其最新提出的LoHoSearch方法,在BrowseComp这一高难度基准测试中一举拿下90%的准确率,而同期测试的多个前沿模型(包括GPT-4、Claude等)的得分却骤降至30%左右。这一悬殊的对比,不仅揭示了当前大模型在复杂搜索任务中的根本性短板,更指向了一种全新的范式——**将搜索推理从“记忆依赖”转向“逻辑构建”**。
基准背后的“结构性陷阱”
BrowseComp并非传统的信息检索基准。它要求模型在多个网页碎片中自主发现、关联并推理出隐藏的因果关系,本质上是**多跳推理(multi-hop reasoning)与上下文融合**的极限测试。此前多数模型依赖内部知识或简单的检索增强生成(RAG)架构,但面对需要跨文档、跨事实的间接推理时,往往出现“幻觉堆叠”或“信息丢失”。LoHoSearch的突破在于,它并未简单堆砌更大模型,而是重构了搜索路径的生成逻辑——通过“局部-全局-层次化”的搜索策略,将碎片信息转化为可追溯的推理链。
LoHoSearch的核心机制:从“搜索”到“搜索结构”
据LongCat团队公开的技术细节,LoHoSearch(Low-High Order Search)采用双阶段框架:第一阶段通过**局部聚焦**提取每个文档中的关键实体与关系,第二阶段利用**全局拓扑**将这些局部信息编织成有向图,并依据图结构进行层次化剪枝。关键在于,它引入了一种**序贯不确定性度量**,当一条推理路径的置信度低于阈值时,自动回溯并重新规划搜索分支。
相比之下,传统模型在BrowseComp上之所以“集体跳水”,正是因为它们无法处理长程依赖中的信息矛盾——例如,当网页A提到“事件X导致Y”,网页B却暗示“Y被Z修正”,模型往往要么忽略矛盾,要么产生逻辑断层。LoHoSearch通过显式建模冲突与证据强度,实现了类似人类“交叉验证”的推理能力。
对行业的影响与启示
这一结果并非否定大模型的能力,而是提示我们:**当前模型的“智能”仍然高度依赖于训练语料的统计分布**。当任务需要主动构建推理结构而非匹配知识时,纯粹的黑盒生成便力不从心。LongCat的实践表明,在搜索、问答、科学研究等需要精准推理的领域,混合架构(搜索算法+推理引擎+大模型)可能比单纯扩大参数更具性价比。
未来,随着LoHoSearch的开源与推广,预计将引发新一轮针对“搜索推理对齐”的研究热潮——如何让模型学会“如何搜索”,而非仅仅“搜索什么”,或许才是通往通用智能的关键一步。