arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 11120 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 11120 篇

2605.09314 2026-05-12 cs.AI 57%

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26805 2026-05-12 cs.AI cs.MA 57%

Bian Que: An Agentic Framework with Flexible Skill Arrangement for Online System Operations

Bian Que: 一个具有灵活技能安排的代理框架,用于在线系统运维

Bochao Liu, Zhipeng Qian, Yang Zhao, Xinyuan Jiang, Zihan Liang, Yufei Ma, Junpeng Zhuang, Ben Chen, Shuo Yang, Hongen Wan, Yao Wu, Chenyi Lei, Xiao Liang

机构 * Kuaishou Technology(快手科技)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Bian Que通过统一运维范式和灵活技能安排,提高了在线系统运维效率,减少了警报量,提高了根因分析准确率,缩短了故障解决时间。

Comments HomePage: https://benchen4395.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15529 2026-05-12 cs.AI 57%

LACE: Lattice Attention for Cross-thread Exploration

LACE:用于跨线探索的晶格注意力

Yang Li, Zirui Zhang, Yang Liu, Chengzhi Mao

机构 * Amazon AGI Labs(亚马逊人工通用智能实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 LACE通过引入跨线注意力机制,使大语言模型在推理过程中实现协同合作,提升推理准确性达7个百分点。

Comments 22 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23273 2026-05-12 cs.CL 57%

UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection

UPA:基于树状搜索与选择的无监督提示代理

Siran Peng, Weisong Zhao, Tianyu Fu, Chenxu Zhao, Tianshuo Zhang, Haoyuan Zhang, Xiangyu Zhu, Minghui Wu, Zhen Lei

机构 * MAIS, CASIA(中国科学院自动化研究所) SAI, UCAS(中国科学技术大学人工智能学院) Mininglamp Technology(Mininglamp技术公司) IIE, CAS(中国科学院信息研究所) SCSE, FIE, M.U.S.T(慕斯科技大学信息工程系)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出UPA,一种无需真实奖励信号的无监督提示代理,通过树状结构搜索和基于Bradley-Terry-Luce模型的两阶段框架实现高效提示优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19585 2026-05-12 cs.IR cs.AI 57%

LLM-Enhanced Reinforcement Learning for Long-Term User Satisfaction in Interactive Recommendation

基于大语言模型的强化学习用于交互推荐中的长期用户满意度

Chongjun Xia, Yanchun Peng, Xianzhi Wang

机构 * University of Technology Sydney, Sydney, Australia(新南威尔士大学悉尼分校) University of Shanghai for Science and Technology(上海科学技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出LLM-Enhanced Reinforcement Learning框架,通过结合大语言模型的语义规划能力与强化学习的细粒度适应性,解决推荐系统中内容同质化和过滤气泡问题,提升长期用户满意度。

Journal ref In: Jung, H., Wang, T., Toyoda, M., Kwon, HY., Lee, Jw. (eds) Database Systems for Advanced Applications. DASFAA 2026. Lecture Notes in Computer Science, vol 16535. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05383 2026-05-12 cs.AI cs.MA 57%

AVA: Attentive VLM Agent for Mastering StarCraft II

AVA:面向星际2的注意力视觉语言代理

Weiyu Ma, Yuqian Fu, Zecheng Zhang, Bernard Ghanem, Guohao Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 AVA提出一个支持多智能体强化学习和视觉语言模型的星际2基准,通过RGB图像、自然语言观察和结构化状态信息,比较训练和零样本方法在21种场景中的表现,揭示训练效率、性能上限、可解释性和部署成本的权衡。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09150 2026-05-12 cs.LG 57%

AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play

AlphaExploitem:超越纳什均衡的扑克博弈

Vlad Murgoci, Matthijs Spaan, Yaniv Oren

机构 * Delft University of Technology(代尔夫特理工大学) Department of Intelligent Systems(智能系统系)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 AlphaExploitem通过引入层次变压器编码器和多样化对手池,提升了扑克博弈中对非最优策略的利用能力,同时保持对纳什均衡对手的性能稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08904 2026-05-12 cs.AI 57%

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

OPT-BENCH:评估大搜索空间中LLM代理的迭代自我优化

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OPT-BENCH通过结合20个机器学习任务和10个经典NP难问题,评估LLM代理在大规模搜索空间中通过内在自我反思而非机械工具应用进行适应的能力,揭示更强模型在反馈利用上的优势及基础能力的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08769 2026-05-12 cs.AI 57%

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS:学习执行时间的多智能体系统工作流

Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Zhejiang University(浙江大学) ShanghaiTech University(上海理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 EvoMAS通过动态构建执行时间工作流,改进多智能体系统的协作策略,实验证明其在复杂任务中优于单智能体基线和现有自动化方法。

Comments 22 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08686 2026-05-12 cs.AI 57%

Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs

迭代批评与路由控制器用于异构大语言模型的多智能体系统

Wenzhi Fang, Liangqi Yuan, Guangchen Lan, Dong-Jun Han, Christopher G. Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种迭代批评与路由控制器,通过将多智能体协调视为序列决策问题,改进多智能体系统的协调效率,实验表明其在多个异构系统和七个推理基准中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08518 2026-05-12 cs.AI 57%

Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge

2025年CODS资产操作挑战赛的结果与回顾分析

Dhaval Patel, Chathurangi Shyalika, Suryanarayana Reddy Yarrabothula, Ling Yue, Shuxin Lin, Nianjun Zhou, James Rayfield

机构 * IBM Artificial Intelligence Institute at University of South Carolina(南卡罗来纳大学人工智能学院) Steel Authority of India Limited(印度钢铁公司) Indian Institute of Technology, Bhilai(比哈尔理工学院) Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文回顾2025年CODS资产操作挑战赛,分析了评估指标、隐藏评估对结果的影响以及团队表现,揭示了评估奖励的行为及改进方向。

Comments 43 pages, 32 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08516 2026-05-12 cs.AI 57%

OracleTSC: Oracle-Informed Reward Hurdle and Uncertainty Regularization for Traffic Signal Control

OracleTSC: 通过Oracle信息的奖励障碍和不确定性正则化用于交通信号控制

Darryl Jacob, Xinyu Liu, Muchao Ye, Xiaoyong Yuan, Pan He

机构 * Department of Computer Science and Software Engineering(计算机科学与软件工程系) Auburn University(亚伯拉罕大学) Department of Computer Science(计算机科学系) University of Iowa(爱荷华大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Clemson University(克莱姆森大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 OracleTSC通过奖励障碍和不确定性正则化机制提升交通信号控制的稳定性与效果,实验表明其在交通效率提升和跨路口泛化能力方面表现突出。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01401 2026-05-12 cs.HC cs.AI 57%

AI Expert Twin: Capturing Expert Cognition for Human-Centred, Practice-Based Learning

AI专家双胞胎:捕捉专家认知以实现以人为本的基于实践的学习

Annie Yuan, Xiaohua Chen, Kalina Yacef, Judy Kay

机构 * The University of Sydney(悉尼大学) Beijing Institute of Fashion Technology(北京服装技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AI专家双胞胎框架,通过结构化表示专家实践中的动作、概念和决策过程,为AI教育系统提供可计算的知识模型,并在文化遗产工作坊中验证其可行性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08315 2026-05-12 cs.LG 57%

Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias

反思引导的策略优化:轨迹 grounded 的修订与显著性偏差

Rahaf Abu Hara, Vaibbhav Murarri, Claudio Zito

机构 * Laboratory of AI and Robotics Research (LAIRR)(人工智能与机器人研究实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出R2PO框架,通过轨迹级证据改进策略搜索,解决传统方法仅依赖标量奖励的不足,通过分离全局搜索与行为修订,提升策略优化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08211 2026-05-12 eess.SP cs.IT cs.LG math.IT 57%

Learning the Channel Gain from Anywhere to Anywhere via Cross-environment Transformer Estimators

通过跨环境变压器估计器学习任意地点到任意地点的信道增益

Prasenjit Dhara, Daniel Romero

机构 * Dept. of Information and Communication Technology, University of Agder(信息与通信技术系,阿格德大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出基于Transformer的估计器,利用跨环境的空间模式学习信道增益地图,减少测量次数,提升学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00886 2026-05-11 cs.AI 57%

Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary

位置:智能体应仅在知识上必要时调用外部工具

Hongru Wang, Cheng Qian, Manling Li, Jiahao Qiu, Boyang Xue, Mengdi Wang, Heng Ji, Amos Storkey, Kam-Fai Wong

机构 * University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学) Princeton University(普林斯顿大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨智能体在何种情况下应调用外部工具,提出应仅在内部推理无法可靠完成任务时才调用。引入了理论框架,强调决策中的不确定性管理,指出不必要的委托会降低效率并阻碍内部推理能力的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13724 2026-05-11 cs.AI 57%

Heterogeneous Graph Neural Networks with Post-hoc Explanations for Multi-modal and Explainable Land Use Inference

异构图神经网络与事后解释方法用于多模态和可解释的土地利用推断

Xuehao Zhai, Junqi Jiang, Adam Dejl, Antonio Rago, Fangce Guo, Francesca Toni, Aruna Sivakumar

机构 * Imperial College London, Department of Civil and Environmental Engineering(帝国理工学院伦敦校区土木与环境工程系) Imperial College London, Department of Computing(帝国理工学院伦敦校区计算机系)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种结合异构图神经网络与可解释AI的方法,用于多模态土地利用推断,提升了准确性和可解释性,尤其在办公和生活用地方面表现突出。

Journal ref Information Fusion, Volume 120, 103057. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07301 2026-05-11 cs.AI 57%

SOM: Structured Opponent Modeling for LLM-based Agents via Structural Causal Model

基于结构因果模型的对手建模:通过结构因果模型实现基于大语言模型的智能体

Shiyue Cao, Pei Xu, Likun Yang, Lei Cui, Xiaotang Chen, Kaiqi Huang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Beijing China National Key Laboratory of Cognition Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences Beijing China Institute of Automation, Chinese Academy of Sciences Beijing China School of Artificial Intelligence, University of Chinese Academy of Sciences \& Institute of Automation, Chinese Academy of Sciences Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences Institute of Automation, Chinese Academy of Sciences

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SOM框架,通过结构因果模型明确分离对手建模与预测,提升多智能体环境中的预测准确性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07164 2026-05-11 cs.CL 57%

Rethinking Experience Utilization in Self-Evolving Language Model Agents

重新思考自演化语言模型代理中的经验利用

Weixiang Zhao, Yingshuo Wang, Yichen Zhang, Yanyan Zhao, Yu Zhang, Yang Wu, Dandan Tu, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文研究自演化代理中经验利用的关键设计维度,提出ExpWeaver方法,通过在决策过程中交织经验使用,使代理在需要额外指导时才调用经验,提升性能。

Comments 30 pages, 20 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07110 2026-05-11 cs.CL cs.SE 57%

Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability

保障计算机使用代理:一种面向部署的架构-生命周期框架用于可靠性

Zejian Chen, Zhanyuan Liu, Chaozhuo Li, Mengxiang Han, Songyang Liu, Litian Zhang, Feng Gao, Yiming Hei, Xi Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology, Artificial Intelligence Institute(信息与通信技术研究院,人工智能研究所)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出一种面向部署的架构-生命周期框架,用于提升计算机使用代理的可靠性,通过分析感知、决策和执行层,以及创建、部署、操作和维护阶段,解决能力形成、授权暴露、故障表现和控制放置之间的联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07073 2026-05-11 cs.AI 57%

TeamBench: Evaluating Agent Coordination under Enforced Role Separation

TeamBench: 在强制角色分离下评估代理协调

Yubin Kim, Chanwoo Park, Taehan Kim, Eugene Park, Samuel Schmidgall, Salman Rahman, Chunjong Park, Cynthia Breazeal, Xin Liu, Hamid Palangi, Hae Won Park, Daniel McDuff

机构 * MIT(麻省理工学院) Google Research(谷歌研究院) Google DeepMind(谷歌DeepMind) Independent Researcher(独立研究者)

专题命中 规划推理 :verifier(abstract);分类 cs.AI

AI总结 TeamBench通过851个任务模板和931个预设实例,评估在操作系统强制角色分离下代理协调的能力,发现提示仅和沙盒强制团队的通过率无显著差异,但提示仅团队更易出现验证者篡改执行者代码的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08256 2026-05-11 cs.CL 57%

NCL-UoR at SemEval-2026 Task 5: Embedding-Based Methods, Fine-Tuning, and LLMs for Word Sense Plausibility Rating

NCL-UoR在SemEval-2026任务5中的表现:基于嵌入的方法、微调与大语言模型用于词义可plausibility评分

Tong Wu, Thanet Markchom, Huizhi Liang

机构 * Independent Researcher(独立研究者) Department of Computer Science, University of Reading(阅读大学计算机科学系) School of Computing, Newcastle University(新castle大学计算学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文比较了三种方法:基于嵌入的方法、Transformer微调和大语言模型提示,发现结构化提示优于微调和嵌入方法,提示设计比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12852 2026-05-11 cs.AI 57%

WebClipper: Efficient Evolution of Web Agents with Graph-based Trajectory Pruning

WebClipper: 基于图的轨迹修剪高效进化网络代理

Junjie Wang, Zequn Xie, Dan Yang, Jie Feng, Yue Shen, Duolin Sun, Meixiu Long, Yihan Jiao, Zhehao Tan, Jian Wang, Peng Wei, Jinjie Gu

机构 * Ant Group(蚂蚁集团)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WebClipper框架,通过图基修剪压缩网络代理轨迹,减少20%的工具调用次数并提升准确性,引入F-AE Score指标平衡精度与效率。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11162 2026-05-11 cs.CL 57%

Retrieval Heads are Dynamic

检索头是动态的

Yuping Lin, Zitao Li, Yue Xing, Pengfei He, Yingqian Cui, Yaliang Li, Bolin Ding, Jingren Zhou, Jiliang Tang

机构 * Michigan State University(密歇根州立大学) Zoom Communications(Zoom公司) Tongyi Lab, Alibaba Group(阿里云实验室)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文从动态视角研究LLM中的检索头,揭示其时间动态性、不可替代性及与隐藏状态的关联,通过实验验证动态检索头在生成任务中的优势。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17942 2026-05-11 cs.AI cs.DB 57%

LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting

基于大型语言模型的SQL生成:提示、自我完善与自适应加权多数投票

Yu-Jie Yang, Hung-Fu Chang, Po-An Chen

机构 * Institute of Information Management(信息管理研究所) National Yang Ming Chiao Tung University(阳明交通大学) R. B. Annis School of Engineering(R. B. Annis工程学院) University of Indianapolis(印第安纳大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出SSEV管道,通过自我完善与加权多数投票提升SQL生成准确性,在多个基准测试中取得良好成绩,并进一步提出ReCAPAgent-SQL框架以应对企业数据库复杂性,提升实际应用效果。

Comments 29 pages, 22 figures

Journal ref 2026 International Conference on Information Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05702 2026-05-08 cs.AI 57%

Knowledge-Graph Paths as Intermediate Supervision for Self-Evolving Search Agents

知识图谱路径作为自演化搜索代理的中间监督

Huyu Wu, Jun Liu, Xiaochi Wei, Yan Gao, Yi Wu, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过利用知识图谱路径作为中间监督,改进自演化搜索代理的提问生成和奖励塑造,解决传统方法中提问孤立和奖励信息不足的问题,提升多跳问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05643 2026-05-08 cs.AI cs.IR 57%

Text-Graph Synergy: A Bidirectional Verification and Completion Framework for RAG

文本-图协同:一种双向验证与完成框架用于RAG

Jiarui Zhong, Hong Cai Chen

机构 * School of Automation, Southeast University(自动化学院,东南大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TGS-RAG框架,通过双向机制融合文本与图结构,解决传统RAG中信息孤岛问题,提升多跳推理性能。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO 57%

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05538 2026-05-08 cs.AI cs.IR 57%

AgenticRAG: Agentic Retrieval for Enterprise Knowledge Bases

AgenticRAG:企业知识库中的代理检索

Susheel Suresh, Hazel Mak, Shangpo Chou, Fred Kroon, Sahil Bhatnagar

机构 * Microsoft Corporation(微软公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AgenticRAG通过在现有企业检索基础设施上叠加轻量级代理框架,使语言模型能够自主迭代检索信息、导航文档并分析证据,提升了检索准确率和事实性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏