arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-10 至 2026-02-10 共收录 192 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 48 篇

2509.21549 2026-02-10 cs.AI 88%

Correct Reasoning Paths Visit Shared Decision Pivots

正确推理路径访问共享决策枢纽

Dongkyu Cho, Amy B. Z. Zhang, Bilel Fehri, Sheng Wang, Rumi Chunara, Hengrui Cai, Rui Song

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);verifier(abstract)

AI总结 本文提出了一种基于决策枢纽的自训练方法,通过挖掘共享决策点提升大语言模型的推理能力。

Comments 18 pages, 10 figures

Journal ref NeurIPS 2025 Workshop on Foundations of Reasoning in Language Models (FoRLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03994 2026-02-10 cs.LG cs.AI 86%

Bypassing the Rationale: Causal Auditing of Implicit Reasoning in Language Models

绕过理由:语言模型中隐式推理的因果审计

Anish Sathyanarayanan, Aditya Nagarsekar, Aarush Rathore

机构 * Birla Institute of Technology and Science, Pilani, K. K. Birla Goa Campus(比拉理工学院和科学学院,比里拉班加尔学院)

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI、cs.LG

AI总结 本文通过因果审计揭示语言模型中隐式推理的可信度差异,发现CoT的因果影响在模型和任务间存在显著变化,需通过逐层审计来验证。

Comments Under Review at ICLR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 85%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08100 2026-02-10 cs.CL cs.AI 84%

Emergent Search and Backtracking in Latent Reasoning Models

潜在推理模型中的涌现搜索与回溯

Jasmine Cui, Charles Ye

专题命中 规划推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究发现潜在推理模型在无词推理中自发学习结构化搜索过程,通过回溯提升准确率并适应性地调整探索路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04039 2026-02-10 cs.CL cs.AI cs.CR 84%

Large Reasoning Models Are Autonomous Jailbreak Agents

大推理模型是自主的越狱代理

Thilo Hagendorff, Erik Derner, Nuria Oliver

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 大推理模型能自主执行越狱攻击,研究揭示其对安全机制的威胁,强调需加强模型对齐以防止被利用

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08603 2026-02-10 cs.AI 83%

OSCAR: Optimization-Steered Agentic Planning for Composed Image Retrieval

OSCAR:基于优化的代理规划用于组合图像检索

Teng Wang, Rong Shan, Jianghao Lin, Junjie Wu, Tianyi Xu, Jianping Zhang, Wenteng Chen, Changwang Zhang, Zhaoxiang Wang, Weinan Zhang, Jun Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 OSCAR通过优化引导的代理规划框架,提升组合图像检索的性能,仅用10%训练数据即超越现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08367 2026-02-10 cs.CL 83%

WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints

WorldTravel: 一个具有紧密耦合约束的现实多模态旅行规划基准

Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen, Wenhao Huang

机构 * ByteDance Seed(字节跳动种子)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 WorldTravel提出一个现实多模态旅行规划基准,揭示了智能体在紧密耦合约束下的感知-行动差距和规划时间阈值问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07773 2026-02-10 cs.CL cs.IR 83%

SRR-Judge: Step-Level Rating and Refinement for Enhancing Search-Integrated Reasoning in Search Agents

SRR-Judge: 逐步评分与细化以增强搜索集成推理在搜索代理中的能力

Chen Zhang, Kuicai Dong, Dexun Li, Wenjun Li, Qu Yang, Wei Han, Yong Liu

机构 * Huawei Technologies(华为技术)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 SRR-Judge通过逐步评分与细化提升搜索代理的搜索集成推理能力,通过迭代拒绝采样微调实现更可靠的评估和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05818 2026-02-10 cs.AI cs.DB 83%

TKG-Thinker: Towards Dynamic Reasoning over Temporal Knowledge Graphs via Agentic Reinforcement Learning

TKG-Thinker: 向通过代理强化学习实现动态推理的时序知识图谱迈进

Zihao Jiang, Miao Peng, Zhenyan Shan, Wenjie Xu, Ben Liu, Gong Chen, Ziqi Gao, Min Peng

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 TKG-Thinker通过代理强化学习实现动态推理,提升时序知识图谱问答的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08537 2026-02-10 cs.RO 82%

UniPlan: Vision-Language Task Planning for Mobile Manipulation with Unified PDDL Formulation

UniPlan: 为移动操作统一PDDL形式的视觉-语言任务规划

Haoming Ye, Yunxiao Xiao, Cewu Lu, Panpan Cai

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 UniPlan通过统一PDDL形式实现视觉-语言任务规划,提升大规模室内移动操作的规划效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16909 2026-02-10 cs.CV cs.RO 82%

MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning

MomaGraph: 体感任务规划中的状态感知统一场景图

Yuanchen Ju, Yongyuan Liang, Yen-Jen Wang, Nandiraju Gireesh, Yuanliang Ju, Seungjae Lee, Qiao Gu, Elvis Hsieh, Furong Huang, Koushil Sreenath

机构 * University of California, Berkeley(加州大学伯克利分校) University of Maryland, College Park(马里兰大学学院公园分校) University of Toronto(多伦多大学)

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 MomaGraph通过统一场景图与强化学习模型,实现家庭环境中体感任务规划的高效任务规划与场景理解。

Comments 25 pages, 10 figures. Project page:https://hybridrobotics.github.io/MomaGraph/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07839 2026-02-10 cs.CL cs.AI cs.LG 82%

TodoEvolve: Learning to Architect Agent Planning Systems

TodoEvolve: 学习架构智能体规划系统

Jiaxi Liu, Yanzuo Jiang, Guibin Zhang, Zihan Zhang, Heng Chang, Zhenfei Yin, Qibing Ren, Junchi Yan

专题命中 规划推理 :planning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TodoEvolve通过元规划范式自主合成和修订任务特定的规划架构,在多个智能体基准测试中优于人工设计的规划模块,同时保持低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07125 2026-02-10 cs.IR cs.AI cs.CV cs.LG 81%

Reasoning-Augmented Representations for Multimodal Retrieval

增强推理的表示用于多模态检索

Jianrui Zhang, Anirudh Sundara Rajan, Brandon Han, Soochahn Lee, Sukanta Ganguly, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(韩国高丽大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一种增强推理的多模态检索方法,通过外部化推理和语义密集表示提升检索性能,尤其在知识密集型查询和组合修改请求中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01476 2026-02-10 cs.AI cs.CL cs.LG 80%

Tree Search for Language Model Agents

语言模型代理的树搜索

Jing Yu Koh, Stephen McAleer, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种树搜索算法,用于提升语言模型代理在现实网页任务中的表现,实验显示其在成功率上显著优于基线方法。

Comments 13 pages. Models and code available at https://jykoh.com/search-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15305 2026-02-10 cs.AI 79%

Coarse-to-Fine Grounded Memory for LLM Agent Planning

粗到细的 grounded memory 用于 LLM agent 计划

Wei Yang, Jinwei Xiao, Hongming Zhang, Qingyang Zhang, Yanna Wang, Bo Xu

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统国家重点实验室,自动化研究所,中国科学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.AI

AI总结 本文提出 Coarse-to-Fine Grounded Memory,通过 LLM 实现粗到细的记忆 grounding,以提升代理在复杂规划任务中的灵活性和适应性。

Comments Accepted to EMNLP 2025 Main Conference;27 pages,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15782 2026-02-10 cs.LG 79%

Solving General-Utility Markov Decision Processes in the Single-Trial Regime with Online Planning

在单次试验范式中求解一般效用马尔可夫决策过程的在线规划方法

Pedro P. Santos, Alberto Sardinha, Francisco S. Melo

机构 * INESC-ID & Instituto Superior Técnico(INESC-ID与理工学院)

专题命中 规划推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出了一种在单次试验范式中求解一般效用马尔可夫决策过程的方法,通过在线规划技术提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07499 2026-02-10 cs.CL 77%

Let's Simplify Step by Step: Guiding LLM Towards Multilingual Unsupervised Proficiency-Controlled Sentence Simplification

逐步简化:引导LLM实现多语言无监督能力控制的句子简化

Jingshen Zhang, Xin Ying Qiu, Lifang Lu, Zhuhua Huang, Yutao Hu, Yuechang Wu, JunYu Lu

机构 * Department of Computer Science, School of Information Science and Technology, Guangdong University of Foreign Studies(计算机科学系,信息科学与技术学院,广东外语外贸大学) College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Lionrock AI Lab, China Merchants Research Institute of Advanced Technology(Lionrock AI实验室,中国远洋科技研究院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL

AI总结 本文提出一种多语言无监督句子简化框架,通过分步骤简化提升控制能力,但发现保持语义忠实仍具挑战性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07434 2026-02-10 cs.RO cs.AI 77%

Bridging Speech, Emotion, and Motion: a VLM-based Multimodal Edge-deployable Framework for Humanoid Robots

弥合语音、情感与运动:一种基于视觉语言模型的多模态边缘可部署框架用于人形机器人

Songhua Yang, Xuetao Li, Xuanye Fei, Mengde Li, Miao Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出SeM$^2$框架,通过多模态感知、思维链推理和语义序列对齐机制,实现情感一致的多模态交互,提升人形机器人在现实环境中的社交表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06967 2026-02-10 cs.RO cs.AI cs.CL 73%

Leveraging Adaptive Group Negotiation for Heterogeneous Multi-Robot Collaboration with Large Language Models

利用自适应群体谈判实现异构多机器人协作的大型语言模型

Siqi Song, Xuanbing Xie, Zonglin Li, Yuqiang Li, Shijie Wang, Biqing Qi

机构 * Tsinghua University(清华大学) Central South University(中南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 CLiMRS通过自适应群体谈判框架提升异构多机器人协作效率,实验显示在复杂任务中效率提升超40%。

Comments 20 pages, 12 figures, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08559 2026-02-10 cs.IR 71%

QARM V2: Quantitative Alignment Multi-Modal Recommendation for Reasoning User Sequence Modeling

QARM V2:量化对齐多模态推荐用于推理用户序列建模

Tian Xia, Jiaqi Zhang, Yueyang Liu, Hongjian Dou, Tingya Yin, Jiangxia Cao, Xulei Liang, Tianlu Xie, Lihao Liu, Xiang Chen, Shen Wang, Changxin Lao, Haixiang Gan, Jinkai Yu, Keting Cen, Lu Hao, Xu Zhang, Qiqiang Zhong, Zhongbo Sun, Yiyu Wang, Shuang Yang, Mingxin Wen, Xiangyu Wu, Shaoguo Liu, Tingting Gao, Zhaojie Liu, Han Li, Kun Gai

专题命中 规划推理 :reasoning(title)

AI总结 QARM V2通过量化对齐多模态推荐方法,解决推荐系统中用户序列建模的语义理解与业务需求不匹配问题。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08808 2026-02-10 cs.LG 70%

How2Everything: Mining the Web for How-To Procedures to Evaluate and Improve LLMs

How2Everything: 从网络挖掘如何操作指南以评估和改进大语言模型

Yapei Chang, Kyle Lo, Mohit Iyyer, Luca Soldaini

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Maryland(马里兰大学) University of Washington(华盛顿大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 How2Everything通过从网络挖掘操作指南,构建评估集并利用强化学习提升模型性能,实现大规模的能力评估与改进闭环。

Comments 53 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14893 2026-02-10 cs.CV cs.CL cs.RO 70%

Virtual Community: An Open World for Humans, Robots, and Society

虚拟社区:人类、机器人与社会的开放世界

Qinhong Zhou, Hongxin Zhang, Xiangye Lin, Zheyuan Zhang, Yutian Chen, Wenjun Liu, Zunzhe Zhang, Sunli Chen, Lixing Fang, Qiushi Lyu, Xinyu Sun, Jincheng Yang, Zeyuan Wang, Bao Chi Dang, Zhehuan Chen, Daksha Ladia, Quang Vinh Dang, Jiageng Liu, Chuang Gan

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) Johns Hopkins University(约翰霍普金斯大学) CMU(卡内基梅隆大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 虚拟社区是一个开放世界平台,旨在研究人类与机器人共存的社会智能,通过多智能体模拟和大规模社区生成,提出两个新挑战以探索开放世界中的协作与规划能力。

Comments website https://virtual-community-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07918 2026-02-10 cs.CR cs.LG stat.ME 70%

CausalArmor: Efficient Indirect Prompt Injection Guardrails via Causal Attribution

CausalArmor: 通过因果归因实现高效的间接提示注入防护

Minbeom Kim, Mihir Parmar, Phillip Wallis, Lesly Miculicich, Kyomin Jung, Krishnamurthy Dj Dvijotham, Long T. Le, Tomas Pfister

机构 * Google Cloud AI Research(谷歌云人工智能研究) Google(谷歌) Google Deepmind(谷歌DeepMind) Seoul National University(首尔国立大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 CausalArmor通过因果归因实现高效间接提示注入防护,提升AI代理的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07553 2026-02-10 cs.AI 70%

VirtualEnv: A Platform for Embodied AI Research

VirtualEnv: 一个用于具身AI研究的平台

Kabir Swain, Sijie Han, Ayush Raina, Jin Zhang, Shuang Li, Michael Stopa, Antonio Torralba

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 VirtualEnv是一个基于Unreal Engine 5的开源平台,用于评估LLM在具身和交互场景中的能力,支持多智能体协作和程序生成任务,旨在推动AI与游戏的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07215 2026-02-10 eess.SY cs.AI cs.DC cs.SY 70%

Multi-Agentic AI for Fairness-Aware and Accelerated Multi-modal Large Model Inference in Real-world Mobile Edge Networks

多智能体AI用于现实世界移动边缘网络中公平性感知和加速的多模态大模型推理

Haiyuan Li, Hari Madhukumar, Shuangyi Yan, Yulei Wu, Dimitra Simeonidou

机构 * Smart Internet Lab, Department of Electrical and Electronic Engineering, University of Bristol(布里斯托大学电子与电气工程系智能互联网实验室)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,通过优化提示路由和模型部署,实现移动边缘网络中多模态大模型推理的低延迟与高公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05239 2026-02-10 cs.RO 67%

Lan-grasp: Using Large Language Models for Semantic Object Grasping and Placement

Lan-grasp:利用大语言模型进行语义物体抓取与放置

Reihaneh Mirjalili, Michael Krawez, Yannik Blei, Simone Silenzi, Florian Walter, Wolfram Burgard

机构 * Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(计算机科学与人工智能系,图恩技术大学) Department of Engineering ``Enzo Ferrari'' (DIEF), University of Modena and Reggio Emilia(恩佐·费尔拉蒂工程系(DIEF),摩德纳和雷吉奥艾米利亚大学) Technical University of Munich(慕尼黑技术大学)

专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 Lan-grasp利用大语言模型实现更精确的语义抓取与放置,通过结合多种模型提升抓取效果和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03802 2026-02-10 cs.LG cs.AI cs.MA 62%

RiskAgent: Synergizing Language Models with Validated Tools for Evidence-Based Risk Prediction

RiskAgent: 语言模型与验证工具协同以基于证据的风险预测

Fenglin Liu, Jinge Wu, Hongjian Zhou, Xiao Gu, Jiayuan Zhu, Jiazhen Pan, Junde Wu, Soheila Molaei, Anshul Thakur, Lei Clifton, Honghan Wu, David A. Clifton

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Technical University of Munich(慕尼黑技术大学) University of Glasgow(格拉斯哥大学) Oxford-Suzhou Centre for Advanced Research(牛津-苏浙高级研究中心)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RiskAgent通过整合语言模型与验证的临床决策工具,实现基于证据的风险预测,展现优越的性能和泛化能力。

Comments Code and Data are available at https://github.com/AI-in-Health/RiskAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18012 2026-02-10 cs.CL cs.AI 62%

Evaluating Semantic and Syntactic Understanding in Large Language Models for Payroll Systems

评估大型语言模型在薪酬系统中的语义和句法理解能力

Hendrika Maclean, Mert Can Cakmak, Muzakkiruddin Ahmed Mohammed, Shames Al Mandalawi, John Talburt

机构 * Center for Entity Resolution(实体解析中心) Information Quality (ERIQ) - University of Arkansas - Little Rock, Arkansas, Little Rock, USA(信息质量(ERIQ)- 阿拉巴马大学-利特尔岩石分校,阿肯色州,利特尔岩石,美国)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估大型语言模型在薪酬系统中理解语义和句法的能力,通过实验发现不同提示策略对模型准确性的不同影响,并提出可复现的部署框架。

Comments ITNG 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14313 2026-02-10 cs.LG cs.AI 62%

Your Reward Function for RL is Your Best PRM for Search: Unifying RL and Search-Based TTS

你的强化学习奖励函数是你的最佳搜索PRM:统一强化学习与基于搜索的文本生成

Can Jin, Yang Zhou, Qixin Zhang, Hongwu Peng, Di Zhang, Zihan Dong, Marco Pavone, Ligong Han, Zhang-Wei Hong, Tong Che, Dimitris N. Metaxas

机构 * Rutgers University(新泽西州立大学) Nanyang Technological University(南洋理工大学) University of Connecticut(康涅狄格大学) Fudan University(复旦大学) NVIDIA Research(NVIDIA研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIRL-S,通过强化学习与搜索技术的统一,利用奖励函数直接学习动态PRM,提升推理链扩展和跨任务泛化能力,实验显示性能提升9%并优于基线PRM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07035 2026-02-10 cs.AI cs.LG 62%

DLLM-Searcher: Adapting Diffusion Large Language Model for Search Agents

DLLM-Searcher: 为搜索代理适应扩散大语言模型

Jiahao Zhao, Shaoxuan Xu, Zhongxiang Sun, Fengqi Zhu, Jingyang Ou, Yuling Shi, Chongxuan Li, Xiao Zhang, Jun Xu

机构 * Renmin University of China(中国人民大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 DLLM-Searcher通过优化基于dLLM的搜索代理,解决代理能力不足和延迟挑战,提升推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏