arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-15 至 2026-01-15 共收录 28 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 规划决策 28 篇

2601.09032 2026-01-15 cs.AI 87%

The Hierarchy of Agentic Capabilities: Evaluating Frontier Models on Realistic RL Environments

代理能力的层级:在现实强化学习环境中评估前沿模型

Logan Ritchie, Sushant Mehta, Nick Heiner, Mason Yu, Edwin Chen

机构 * Surge AI

专题命中 规划决策 :agentic(title,abstract);agent(abstract);tool use(abstract);planning(abstract)

AI总结 本文评估了前沿AI模型在现实强化学习环境中的代理能力层级,揭示了模型在工具使用、规划、适应性等任务上的能力差异及改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15676 2026-01-15 cs.AI cs.CL 84%

AutoToM: Scaling Model-based Mental Inference via Automated Agent Modeling

AutoToM: 通过自动化代理建模实现基于模型的心理推理扩展

Zhining Zhang, Chuanyang Jin, Mung Yao Jia, Shunchi Zhang, Tianmin Shu

机构 * Peking University(北京大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 规划决策 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 AutoToM通过自动化代理建模实现可扩展、稳健且可解释的心理推理,优于现有方法并支持在线心理推理。

Comments NeurIPS 2025 (Spotlight). 42 pages, 11 figures, 15 tables. Website at https://chuanyangjin.com/AutoToM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08747 2026-01-15 cs.CL cs.AI 84%

To Retrieve or To Think? An Agentic Approach for Context Evolution

是检索还是思考?一种情境演化的代理方法

Rubing Chen, Jian Wang, Wenjie Li, Xiao-Yong Wei, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 规划决策 :agentic(title,abstract);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Agentic Context Evolution (ACE)方法,通过代理动态决策在检索与推理间切换,提升知识密集型任务的生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09609 2026-01-15 cs.CL cs.AI 81%

DPWriter: Reinforcement Learning with Diverse Planning Branching for Creative Writing

DPWriter: 基于多样化规划分支的强化学习用于创造性写作

Qian Cao, Yahui Liu, Wei Bi, Yi Zhao, Ruihua Song, Xiting Wang, Ruiming Tang, Guorui Zhou, Han Li

机构 * Renmin University of China(中国人民大学) Kuaishou Technology(快手科技)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.CL

AI总结 DPWriter通过多样化规划分支方法提升创造性写作的输出多样性,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02955 2026-01-15 cs.RO cs.AI cs.LG 81%

UniConFlow: A Unified Constrained Flow-Matching Framework for Certified Motion Planning

UniConFlow: 一种统一的约束流匹配框架用于认证运动规划

Zewen Yang, Xiaobing Dai, Dian Yu, Zhijun Li, Majid Khadiv, Sandra Hirche, Sami Haddadin

机构 * Technical University of Munich (TUM)(技术大学慕尼黑) School of Mechanical Engineering, Translational Research Center, Tongji University(机械工程学院、转化研究中心,同济大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 规划决策 :planning(title,abstract);分类 cs.AI、cs.LG

AI总结 UniConFlow提出一种统一约束流匹配框架,通过整合等式和不等式约束,提升轨迹生成在安全性和动态一致性上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06457 2026-01-15 cs.CR cs.AI cs.CL cs.MA 81%

ScamAgents: How AI Agents Can Simulate Human-Level Scam Calls

ScamAgents: 人工智能代理如何模拟人类水平的诈骗电话

Sanket Badhe

机构 * Rutgers University(罗格斯大学)

专题命中 规划决策 :AI agent(title);agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出ScamAgent,一种基于LLM的多轮代理,能生成逼真诈骗电话脚本并模拟欺诈场景,揭示现有安全机制对代理威胁的不足,呼吁加强多轮安全审计和检测生成AI驱动的对话欺骗。

Comments Accepted at CAMLIS 25: Conference on Applied Machine Learning for Information Security. 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08988 2026-01-15 cs.AI 79%

ART: Action-based Reasoning Task Benchmarking for Medical AI Agents

ART:面向医疗AI代理的基于动作的推理任务基准测试

Ananya Mantravadi, Shivali Dalmia, Abhishek Mukherji

专题命中 规划决策 :AI agent(title,abstract);分类 cs.AI

AI总结 ART通过挖掘真实EHR数据创建挑战性任务,评估医疗AI代理在阈值评估、时间聚合和条件逻辑方面的表现,揭示其推理弱点,推动更可靠的临床决策支持系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03547 2026-01-15 cs.RO 78%

Shape-Space Graphs: Fast and Collision-Free Path Planning for Soft Robots

形状空间图:用于软机器人快速且无碰撞路径规划

Carina Veil, Moritz Flaschel, Ellen Kuhl

机构 * Department of Mechanical Engineering, Stanford University(机械工程系,斯坦福大学) Institute of Applied Mechanics, Friedrich-Alexander-Universität Erlangen–Nürnberg(应用力学研究所,弗赖堡-埃尔兰根-纽伦堡大学)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于形状空间图的路径规划方法,用于软机器人在复杂环境中的快速且无碰撞导航,通过预计算形状库和多目标边成本实现高效路径生成。

Comments revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09129 2026-01-15 cs.CR 78%

KryptoPilot: An Open-World Knowledge-Augmented LLM Agent for Automated Cryptographic Exploitation

KryptoPilot: 一种面向开放世界的知识增强型大语言模型代理用于自动化密码学利用

Xiaonan Liu, Zhihao Li, Xiao Lan, Hao Ren, Haizhou Wang, Xingshu Chen

专题命中 规划决策 :agent(title,abstract)

AI总结 KryptoPilot通过开放世界知识增强和受控推理,提升LLM在密码学CTF挑战中的自动化解决能力。

Comments 14 Pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19610 2026-01-15 cs.RO 78%

Look as You Leap: Planning Simultaneous Motion and Perception for High-DOF Robots

跳跃时观察:为高自由度机器人同时规划运动与感知

Qingxi Meng, Emiliano Flores, Carlos Quintero-Peña, Peizhu Qian, Zachary Kingston, Shannan K. Hamlin, Vaibhav Unhelkar, Lydia E. Kavraki

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Ken Kennedy Institute, Rice University(肯尼迪研究所,里士大学) Houston Methodist Academic Institute(休斯顿 Methodist 学术研究院)

专题命中 规划决策 :planning(title,abstract)

AI总结 本文提出了一种基于GPU并行的感知评分引导的概率道路图规划器,用于高自由度机器人在动态和静态环境中的运动与感知同时规划。

Comments 20 pages, 13 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.08832 2026-01-15 eess.SY cs.AI cs.CY cs.SY 77%

A Taxonomy and Review of Algorithms for Modeling and Predicting Human Driver Behavior

自动驾驶中人类驾驶行为建模与预测算法的分类与综述

Raunak P. Bhattacharyya, Kyle Brown, Juanran Wang, Katherine Driggs-Campbell, Mykel J. Kochenderfer

专题命中 规划决策 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文对自动驾驶中人类驾驶行为建模与预测算法进行了分类和综述,统一了意图估计、特质估计和运动预测方法,并指出了该领域未来的研究方向。

Comments This revision has been accepted for publication in the Proceedings of the IEEE. The final version is available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09459 2026-01-15 cs.IR cs.CL 70%

Dissecting Judicial Reasoning in U.S. Copyright Damage Awards

解析美国版权损害赔偿判决中的司法推理

Pei-Chi Lo, Thomas Y. Lu

机构 * National Sun Yat-sen University(国立中山大学)

专题命中 规划决策 :workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本研究提出基于修辞结构理论的LLM方法,用于解析版权损害赔偿判决中的司法推理,揭示各巡回法院因素权重差异,为法律分析提供新方法和实证洞察。

Comments Presented in SIGKDD'25 SciSoc LLM Workshop: Large Language Models for Scientific and Societal Advances

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09278 2026-01-15 cs.AI 70%

M$^3$Searcher: Modular Multimodal Information Seeking Agency with Retrieval-Oriented Reasoning

M$^3$Searcher: 模块化多模态信息检索代理与检索导向推理

Xiaohan Yu, Chao Feng, Lang Mei, Chong Chen

机构 * Huawei Cloud BU(华为云业务单元)

专题命中 规划决策 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 M$^3$Searcher是一种模块化多模态信息检索代理,通过检索导向的多目标奖励机制,提升多模态任务中的事实准确性、推理合理性和检索忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09259 2026-01-15 cs.AI 70%

MAXS: Meta-Adaptive Exploration with LLM Agents

MAXS: 基于LLM代理的元适应性探索

Jian Zhang, Zhiyuan Wang, Zhangqi Wang, Yu He, Haoran Luo, li yuan, Lingling Zhang, Rui Mao, Qika Lin, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) National University of Singapore(国立新加坡大学) South China University of Technology(华南理工大学)

专题命中 规划决策 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 MAXS通过元适应性探索框架提升LLM代理在多工具推理中的全局有效性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09474 2026-01-15 cs.LG math.OC 57%

Terminally constrained flow-based generative models from an optimal control perspective

从最优控制视角出发的终端约束流基生成模型

Weiguo Gao, Ming Li, Qianxiao Li

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory of Contemporary Applied Mathematics(上海当代应用数学重点实验室) Department of Mathematics and Institute for Functional Intelligent Materials(数学系和功能智能材料研究所) National University of Singapore(新加坡国立大学)

专题命中 规划决策 :planning(abstract);分类 cs.LG

AI总结 TOCFlow从最优控制视角提出一种几何感知的采样方法,通过终端共动框架实现二阶曲率效应捕捉,提升约束满足性能。

Comments 59 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09416 2026-01-15 cs.CV cs.AI 57%

Radiomics-Integrated Deep Learning with Hierarchical Loss for Osteosarcoma Histology Classification

融合放射组学的深度学习与分层损失用于骨肉瘤组织学分类

Yaxi Chen, Zi Ye, Shaheer U. Saeed, Oliver Yu, Simin Ni, Jie Huang, Yipeng Hu

机构 * University College London(伦敦大学) UCL Hawkes Institute(UCL霍克斯研究所) Queen Mary University of London(伦敦女王学院) Royal National Orthopaedic Hospital(国家骨科医院)

专题命中 规划决策 :planning(abstract);分类 cs.AI

AI总结 本文提出融合放射组学的深度学习与分层损失方法,用于提高骨肉瘤组织学分类的准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20612 2026-01-15 cs.LG 57%

Policy Compatible Skill Incremental Learning via Lazy Learning Interface

通过懒惰学习接口实现策略兼容的技能增量学习

Daehee Lee, Dongsu Lee, TaeYoon Kwack, Wonje Choi, Honguk Woo

机构 * Sungkyunkwan University(成均馆大学) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 规划决策 :agent(abstract);分类 cs.LG

AI总结 本文提出SIL-C框架,通过懒惰学习接口实现技能与策略的兼容性,提升下游任务性能无需重新训练策略。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09293 2026-01-15 cs.AI 57%

Policy-Based Reinforcement Learning with Action Masking for Dynamic Job Shop Scheduling under Uncertainty: Handling Random Arrivals and Machine Failures

基于行动掩码的策略优化强化学习在不确定动态作业车间调度中的应用:处理随机到达和机器故障

Sofiene Lassoued, Stefan Lier, Andreas Schwung

机构 * South Westphalia University of Applied Sciences(西南弗劳恩霍夫应用科学大学)

专题命中 规划决策 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种结合可解释Petri网模型与自适应强化学习策略的动态作业车间调度方法,通过行动掩码策略有效应对随机到达和机器故障问题,提升调度的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09215 2026-01-15 cs.CL 57%

UserLM-R1: Modeling Human Reasoning in User Language Models with Multi-Reward Reinforcement Learning

UserLM-R1: 通过多奖励强化学习建模人类推理在用户语言模型中的应用

Feng Zhang, Shijia Li, Chunmao Zhang, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Jingwen Xu, Han Liu

机构 * Meituan(美团) Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学)

专题命中 规划决策 :agent(abstract);分类 cs.CL

AI总结 UserLM-R1通过多奖励强化学习和动态目标驱动策略,提升用户语言模型在跨领域和对抗性场景中的推理与策略能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09171 2026-01-15 cs.SE 57%

SafePlanner: Testing Safety of the Automated Driving System Plan Model

SafePlanner: 自动驾驶系统计划模型安全性的测试

Dohyun Kim, Sanggu Han, Sangmin Woo, Joonha Jang, Jaehoon Kim, Changhun Song, Yongdae Kim

专题命中 规划决策 :planning(abstract);分类 cs.SE

AI总结 SafePlanner通过结构化分析和引导模糊测试,有效检测自动驾驶系统计划模型中的安全隐患,提升了测试覆盖率和缺陷发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09523 2026-01-15 cs.IR 50%

TEMPO: A Realistic Multi-Domain Benchmark for Temporal Reasoning-Intensive Retrieval

TEMPO:一个用于时间推理密集检索的多领域基准

Abdelrahman Abdallah, Mohammed Ali, Muhammad Abdul-Mageed, Adam Jatowt

专题命中 规划决策 :planning(abstract)

AI总结 TEMPO是一个结合时间推理与多领域检索的基准,通过复杂查询和多步骤检索规划,评估检索系统在时间信息处理上的挑战和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09463 2026-01-15 eess.SP cs.SY eess.SY 50%

Two-Scale Spatial Deployment for Cost-Effective Wireless Networks via Cooperative IRSs and Movable Antennas

双尺度空间部署:通过协作智能反射面和可移动天线实现高效无线网络

Ying Gao, Qingqing Wu, Ziyuan Zheng, Yanze Zhu, Wen Chen, Xin Lin, Shanpu Shen

专题命中 规划决策 :planning(abstract)

AI总结 本文提出双尺度空间部署策略,利用协作智能反射面和可移动天线优化无线网络部署,通过混合整数非凸优化解决成本最小化问题,仿真显示其在成本效率和SNR最大化方面优于传统方法。

Comments 13 pages, 7 figures, submitted to an IEEE journal for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09430 2026-01-15 cs.CV 50%

Video-MSR: Benchmarking Multi-hop Spatial Reasoning Capabilities of MLLMs

Video-MSR: 多跳空间推理能力的MLLMs基准测试

Rui Zhu, Xin Shen, Shuchen Wu, Chenxi Miao, Xin Yu, Yang Li, Weikang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) Nanjing University(南京大学) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 规划决策 :planning(abstract)

AI总结 Video-MSR通过四个任务评估MLLMs的多跳空间推理能力,发现模型在复杂推理中存在显著不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17539 2026-01-15 cs.CE 50%

Volumetric Non-Invasive Cardiac Mapping for Accessible Global Arrhythmia Characterization

体积非侵入性心脏成像用于全球性心律失常表征

Jorge Vicente-Puig, Judit Chamorro-Servent, Ernesto Zacur, Inés Llorente-Lipe, Marta Martínez, Jorge Sanchez, Jana Reventós, Ivo Roca-Luque, Lluis Mont, Felipe Atienza, Andreu M. Climent, Maria S. Guillem, Ismael Hernández-Romero

专题命中 规划决策 :planning(abstract)

AI总结 本文提出了一种无影像体积ECGI方法,实现三维心脏激活映射,显著提高心律失常起源定位精度,用于术前规划和治疗优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22308 2026-01-15 cs.RO 50%

Environment as Policy: Learning to Race in Unseen Tracks

环境作为策略:在未见过的赛道上学习赛车

Hongze Wang, Jiaxu Xing, Nico Messikommer, Davide Scaramuzza

机构 * Robotics and Perception Group, Department of Informatics, University of Zurich(机器人感知组,信息学院,苏黎世大学) Department of Neuroinformatics, University of Zurich and ETH Zurich(神经信息学院,苏黎世大学和苏黎世联邦理工学院)

专题命中 规划决策 :agent(abstract)

AI总结 本文提出了一种自适应环境塑造框架,使无人机能够在未见过的赛道上高效学习赛车,通过动态调整训练环境提升泛化能力。

Comments Accepted at IEEE International Conference on Robotics and Automation (ICRA), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06699 2026-01-15 quant-ph cs.ET 50%

Solving Distributed Flexible Job Shop Scheduling Problems in the Wool Textile Industry with Quantum Annealing

利用量子退火解决羊毛纺织行业中分布式柔性作业车间调度问题

Lilia Toma, Markus Zajac, Uta Störl

专题命中 规划决策 :planning(abstract)

AI总结 本文利用量子退火解决羊毛纺织行业中的分布式柔性作业车间调度问题,通过优化模型参数提升解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08956 2026-01-15 cs.CV 50%

Variance-Penalized MC-Dropout as a Learned Smoothing Prior for Brain Tumour Segmentation

方差惩罚的MC-Dropout作为脑肿瘤分割的学得平滑先验

Satyaki Roy Chowdhury, Golrokh Mirzaei

机构 * Department of Computer Science(计算机科学系) Engineering, The Ohio State University(工程系,俄亥俄州立大学)

专题命中 规划决策 :planning(abstract)

AI总结 UAMSA-UNet通过结合多尺度注意机制和学习的平滑先验,提升脑肿瘤分割的精度和效率,同时减少计算量。

Comments Accepted by ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24952 2026-01-15 cs.CV 50%

Beyond the Last Frame: Process-aware Evaluation for Generative Video Reasoning

超越最后一帧:面向生成视频推理的过程感知评估

Yifan Li, Yukai Gu, Yingqian Min, Zikang Liu, Yifan Du, Kun Zhou, Min Yang, Wayne Xin Zhao, Minghui Qiu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) School of Information, Renmin University of China(中国人民大学信息学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) ByteDance(字节跳动)

专题命中 规划决策 :planning(abstract)

AI总结 本文提出VIPER基准和POC@r指标,用于评估生成视频推理中过程与结果的一致性,揭示现有模型在推理能力上的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏