arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

T-Search:面向困难多步检索的开放智能体检索器与实验平台

T-Search: An Open Agentic Retriever and Playground for Hard Multi-Step Search

Olga Tsymboi, Ramil Latypov, Aleksandr Medvedev, Danil Taranets, Dmitrii Stoianov, Nikita Gulyakov, Gleb Alektorov, Anatolii Potapov

arXiv 2610.06782首次发表:更新:

发表机构

T-Tech(T-Tech)

机构由 AI 辅助整理,请以论文原文为准。

AI 中文总结

T-Search是一个开放权重的智能体检索器,通过有界多轮搜索和对抗性过滤训练,在七个英俄基准上显著提升Recall@10,并发布了首个原生俄语困难搜索基准TRuST。

AI 中文摘要

我们提出了T-Search,一个用于困难多步检索的开放权重智能体检索器。给定一个问题以及一个在固定语料库上的搜索工具,它执行有界的多轮搜索,并返回带有简短理由的排序证据块列表,将答案生成留给下游模型,因此后端和生成器可以在无需重新训练的情况下互换。T-Search基于Qwen3.6-35B-A3B构建,并在对抗性过滤的合成搜索任务上进行训练,采用轮次切分的监督微调,随后在召回奖励上进行GSPO。在七个带有黄金证据标注的英语和俄语基准上取平均,它在一次展开时达到56.0的Recall@10,比其基础模型高出14.4个百分点,在三次融合展开时达到61.3,优于更大的开放模型。我们发布了模型、工具框架、实时演示以及三个基准,包括TRuST,这是第一个原生俄语的困难搜索基准。

英文摘要

We present T-Search, an open-weight agentic retriever for hard multi-step search. Given a question and a search tool over a fixed corpus, it runs a bounded multi-round search and returns a ranked list of evidence chunks with short justifications, leaving answer generation to a downstream model, so backend and generator can be swapped without retraining. T-Search is built on Qwen3.6-35B-A3B and trained on adversarially filtered synthetic search tasks with round-sliced supervised fine-tuning followed by GSPO on a recall reward. Averaged over seven English and Russian benchmarks with gold evidence annotations, it reaches 56.0 Recall@10 with one rollout, 14.4 points above its base, and 61.3 with three fused rollouts, outperforming larger open models. We release the model, harness, live demo, and three benchmarks, including TRuST, the first native-Russian hard-search benchmark.

论文原文

arXiv 摘要页 · PDF 原文 · HTML 原文

↑