Search-P1: Path-Centric Reward Shaping for Stable and Efficient Agentic RAG Training
Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练
机构 * Tencent(腾讯)
专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
Search-P1: 基于路径的奖励塑造用于稳定且高效的代理RAG训练
机构 * Tencent(腾讯)
专题命中 工具调用 :agentic(title,abstract);分类 cs.CL、cs.LG
AI总结 Search-P1通过路径中心奖励塑造提升代理RAG训练的稳定性和效率,实现7.7个百分点的准确率提升。
CiteLLM:一个用于可信科学引文发现的代理平台
机构 * Hong Kong Polytechnic University(香港理工大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Swiss Federal Technology Institute of Lausanne (EPFL)(洛桑联邦理工学院) ; Hong Kong University of Science and Technology (HKUST)(香港科学大学)
专题命中 工具调用 :agentic(title,abstract);分类 cs.CL
AI总结 CiteLLM通过在LaTeX编辑器中嵌入LLM工具,实现可信的科学引文发现,确保引文的准确性和可靠性。
Comments Accepted by TheWebConf 2026 Demo Track
静默逃逸:当隐式提示注入使LLM代理无痕泄露
机构 * eBay
专题命中 工具调用 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.AI
AI总结 研究揭示了代理式LLM系统中隐式提示注入导致的静默逃逸风险,通过实验展示恶意网页诱导代理泄露敏感信息的机制,并提出分片逃逸策略及网络层防御改进方向。
TherapyProbe: 通过对抗性模拟生成关系安全设计知识以改进心理健康聊天机器人
机构 * BNRIST, Dept. of CST, Tsinghua University(北京理工大学(Tsinghua大学)) ; Independent Researcher(独立研究者)
专题命中 工具调用 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL
AI总结 TherapyProbe通过对抗性模拟生成关系安全设计知识,帮助改进心理健康聊天机器人的交互模式质量。
大规模在线去匿名化与LLMs
机构 * MATS ; ETH Zurich(苏黎世联邦理工学院) ; Anthropic
专题命中 工具调用 :agent(abstract);分类 cs.AI、cs.LG
AI总结 利用LLMs实现大规模在线去匿名化,通过提取身份特征、语义嵌入搜索和推理验证,显著提升召回率和精度,挑战现有隐私保护机制。
Comments 24 pages, 10 figures
K-Search: 通过共进化内在世界模型生成LLM内核
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 工具调用 :planning(abstract);分类 cs.AI
AI总结 K-Search通过共进化内在世界模型生成LLM内核,显著优于现有进化搜索方法,实现高效内核优化。
增强检索生成的解剖病理实验室助手
机构 * Nova Information Management School (NOVA IMS), Universidade Nova de Lisboa, Campus de Campolide(诺瓦信息管理学院(NOVA IMS),里斯本新大学,坎波利德校区)
专题命中 工具调用 :workflow(abstract);分类 cs.AI
AI总结 本研究提出一种专为解剖病理实验室设计的检索增强生成助手,通过领域专用嵌入模型提升答案相关性和准确性,优化实验室规程查询效率。
分层基于大语言模型的多智能体框架与提示优化用于多机器人任务规划
机构 * Data Science Laboratories, NEC Corporation(日本电气株式会社数据科学实验室)
专题命中 规划决策 :agent(title,abstract);planning(title,abstract);multi-agent(title,abstract);分类 cs.AI
AI总结 本文提出一种分层多智能体框架,结合提示优化提升多机器人任务规划的准确性和效率。
Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026. 8 pages, 2 figures
基于大语言模型的自主代理的事件溯源:ESAA
专题命中 规划决策 :autonomous agent(title,abstract);agent(abstract);planning(abstract);multi-agent(abstract)
AI总结 ESAA架构通过事件溯源技术提升自主代理在软件工程中的状态管理和任务执行能力,支持多代理并发调度和异构LLM的协同工作。
Comments 13 pages, 1 figure, 4 tables. Includes 5 technical appendices
长周期代理任务的分层组策略优化
机构 * Nanyang Technological University(南洋理工大学) ; Southeast University(东南大学)
专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.LG
AI总结 HGPO通过分层组策略优化解决长周期代理任务中分步优势估计的上下文不一致问题,提升策略优化效果。
Comments Accepted at ICLR 2026
通过风格学辅助LLM代理评估去匿名化风险
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)
专题命中 规划决策 :agent(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出SLA方法,通过风格学与LLM推理结合,评估和缓解文本去匿名化风险,实验表明其在各类场景中具有高推断准确性,并提出引导重组成策略以降低作者身份可识别性。
FactGuard:通过强化学习进行代理视频虚假信息检测
机构 * Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院计算技术研究所) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) ; University of Science and Technology Beijing(北京科技大学) ; The University of Queensland, Brisbane, Australia(昆士兰大学)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 FactGuard通过强化学习和代理框架,提升视频虚假信息检测的鲁棒性和泛化能力。
稀疏想象用于高效的视觉世界模型规划
机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 本文提出稀疏想象方法,通过减少标记处理数量提升视觉世界模型规划效率,同时保持高控制保真度。
Comments Accepted to ICLR 2026; Project Page: https://nikriz1.github.io/sparse_imagination/
基于指令的图像编辑与规划、推理和生成
机构 * HKUST(香港科技大学)
专题命中 规划决策 :planning(title,abstract);分类 cs.AI
AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。
Comments 10 pages, 7 figures
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515
ArchAgent: 由人工智能驱动的计算机架构发现
机构 * University of California, Berkeley(加州大学伯克利分校) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 规划决策 :agentic(title,abstract);分类 cs.AI
AI总结 ArchAgent利用人工智能驱动的自动化方法,快速发现并优化计算机架构中的缓存替换策略,显著提升性能并展示出在模拟器中的新发现。
Comments 13 pages, 5 figures, 2 tables
考虑自动驾驶伦理的视角:车辆运动规划中的集体风险
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; CARISSMA Institute of Safety in Future Mobility(未来移动安全研究所) ; Technische Hochschule Ingolstadt(因戈尔施塔特技术大学) ; TNO(荷兰代尔夫特理工大学)
专题命中 规划决策 :planning(title,abstract)
AI总结 本文提出了一种考虑多视角风险的自动驾驶运动规划策略,通过平衡所有道路使用者的风险来提高整体交通安全性和效率,同时体现人类驾驶行为的伦理考量。
Comments 17 pages, 6 figures, 2 tables
SmartChunk检索:具有规划的查询感知分块压缩以实现高效的文档RAG
机构 * University of Michigan(密歇根大学) ; Adobe Research(Adobe研究)
专题命中 规划决策 :planning(title);分类 cs.AI、cs.CL、cs.LG
AI总结 SmartChunk通过查询自适应框架和强化学习方案提升长文档问答效率与准确性。
Comments 26 pages, 10 figures
人机协作界面框架在智能用户界面生态系统中的应用
专题命中 规划决策 :agent(abstract);AI agent(abstract);workflow(abstract)
AI总结 本文提出基于工作流程复杂性、AI自主性和推理的框架,用于设计可扩展的AI接口,平衡AI自主性与人类监督。
Comments 22 pages, 8 figures
VolleyBots: 多无人机乒乓球竞技测试平台,结合运动控制与战略博弈
机构 * Tsinghua University(清华大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 VolleyBots通过结合运动控制与战略博弈,测试多无人机乒乓球竞技,展示了强化学习在复杂任务中的应用与潜力。
Comments Accepted by NeurIPS 2025
CourtGuard:一种用于大语言模型安全的模型无关框架,用于零样本策略适应
机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) ; School of IT(信息技术学院) ; Engineering, ADA University(工程学院,ADA大学) ; School of Law, ADA University(法学院,ADA大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG
AI总结 CourtGuard通过证据辩论框架实现大语言模型的安全零样本适应,超越传统方法在多个安全基准测试中的表现,并具备跨领域泛化和自动数据审计能力。
Comments Under Review
通过分层共自博弈强化学习掌握多无人机 volleyball
机构 * Tsinghua University(清华大学)
专题命中 规划决策 :agent(abstract);multi-agent(abstract);分类 cs.AI
AI总结 本文提出分层共自博弈强化学习框架,通过三阶段训练流水线实现多无人机volleyball任务的高水平战略协调与低水平敏捷控制,实验显示其在胜率和团队行为涌现方面的优越性能。
Comments Accepted by CoRL 2025
SEGB: 自适应生成性竞价与局部自回归扩散
机构 * Beijing China(中国北京)
专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.LG
AI总结 SEGB通过自适应生成性竞价与局部自回归扩散,实现动态市场中的高效竞价策略,显著提升广告效果与商业价值。
WaterVideoQA: 以ASV为中心的感知与符合规则的推理 via 多模态智能体
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究所) ; Hubei Key Laboratory of Inland Shipping Technology (Wuhan University of Technology)(湖北内河航运技术重点实验室(武汉理工大学)) ; School of Navigation, Wuhan University of Technology(武汉理工大学航海学院) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; School of Information Engineering, Yancheng Institute of Technology(盐城职业技术学院信息工程学院) ; School of Engineering, Stanford University(斯坦福大学工程学院) ; Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院)
专题命中 规划决策 :agent(abstract);multi-agent(abstract)
AI总结 WaterVideoQA通过多模态智能体系统,实现ASV在复杂水域环境中的感知与规则合规推理,提升自主航行的安全性和精确性。
Comments 11 pages,8 figures
工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.CL
AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。
Comments ICLR 2026, Website: https://toolathlon.xyz/
RAIN-Merging: 一种无梯度方法,用于在保持推理格式的前提下提升大推理模型的指令遵循能力
机构 * Institute of Image Processing and Pattern Recoginition, School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(图像处理与模式识别研究所,自动化与智能感知学院,上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; MoE Key Laboratory of System Control and Information Processing (Shanghai)(系统控制与信息处理国家重点实验室(上海))
专题命中 规划决策 :agent(abstract);分类 cs.CL、cs.LG
AI总结 RAIN-Merging通过无梯度方法提升大推理模型的指令遵循能力,同时保持推理格式和性能。
Comments 41 pages, ICLR 2026 Oral
学习奖励,而非标签:面向机械故障检测的对抗性逆强化学习
机构 * Deakin University(德肯大学)
专题命中 规划决策 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出对抗性逆强化学习方法,用于机械故障检测,通过学习奖励动态实现无需标签的故障识别。
Comments This article is accepted to be published in AAMAS2026. The doi is listed below but the production is on the way as of now (26/02/2026)
基于大语言模型的知识追踪:通过超几何空间中的LLM-学生层次行为对齐
专题命中 规划决策 :agent(abstract);分类 cs.AI
AI总结 本文提出L-HAKT框架,通过超几何空间中的层次行为对齐,提升知识追踪对认知状态层次演化和个性化问题难度感知的建模能力。
Comments 9 pages, 6 figures, Accepted to AAAI 2026
用于医学图像分割任务的潜在空间扩散模型
机构 * Ngoc Huynh Trinh1(Ngoc Huynh Trinh) ; Hai Toan Nguyen ; Son Ba Luong ; Quoc Long Tran2(Quoc Long Tran)
专题命中 规划决策 :planning(abstract);分类 cs.AI
AI总结 MedSegLatDiff结合VAE和潜在扩散模型,通过加权交叉熵损失提升医学图像分割的精度与可靠性,适用于临床部署。
PARL:基于提示的强化学习智能体
机构 * Fundamentals of Natural Language Processing, University of Bamberg, Germany(自然语言处理基础,巴姆伯格大学,德国)
专题命中 规划决策 :agent(abstract);分类 cs.CL
AI总结 PARL是一种基于提示的强化学习智能体,利用预训练语言模型在无需微调的情况下完成RL任务,适用于简单环境但受限于复杂数学运算任务。
LinGuinE:纵向引导估计用于体积肿瘤分割
机构 * AstraZeneca(阿斯利康)
专题命中 规划决策 :planning(abstract);分类 cs.LG
AI总结 LinGuinE通过结合图像配准和引导分割,实现单个放射科医生提示下的纵向肿瘤分割与跟踪,适用于多扫描的体积掩码生成。
Comments 10 pages, 2 figures