arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-16 至 2026-01-16 共收录 86 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 4 篇

2601.09952 2026-01-16 cs.CV cs.RO 50%

OT-Drive: Out-of-Distribution Off-Road Traversable Area Segmentation via Optimal Transport

OT-Drive: 基于最优传输的离群分布越野可通行区域分割

Zhihua Zhao, Guoqiang Li, Chen Min, Kangping Lu

机构 * School of Mechanical Engineering, Beijing Institute of Technology(北京理工大学机械工程学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Shandong Pengxiang Automobile Co., Ltd(山东鹏翔汽车有限公司)

专题命中 软件智能体 :planning(abstract)

AI总结 OT-Drive通过最优传输方法实现离群分布越野可通行区域分割,提升自动驾驶在复杂环境下的鲁棒性和泛化能力。

Comments 9 pages, 8 figures, 6 tables. This work has been submitted to the IEEE for possible publication. Code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏

2. GUI与网页智能体 3 篇

2504.11788 2026-01-16 cs.CL cs.AI 73%

WebRollback: Enhancing Web Agents with Explicit Rollback Mechanisms

WebRollback: 通过显式回滚机制增强网络代理

Zhisong Zhang, Tianqing Fang, Kaixin Ma, Wenhao Yu, Hongming Zhang, Haitao Mi, Dong Yu

机构 * City University of Hong Kong(香港城市大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 GUI与网页智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 通过显式回滚机制提升网络代理的导航效率与灵活性

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09770 2026-01-16 cs.AI 57%

GUI-Eyes: Tool-Augmented Perception for Visual Grounding in GUI Agents

GUI-Eyes: 用于GUI代理视觉接地的工具增强感知

Chen Chen, Jiawei Shao, Dakuan Lu, Haoyi Hu, Xiangcheng Liu, Hantao Yao, Wu Liu

专题命中 GUI与网页智能体 :agent(abstract);分类 cs.AI

AI总结 GUI-Eyes通过分阶段策略推理和细粒度奖励反馈实现工具感知主动感知,显著提升GUI代理的接地准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09607 2026-01-16 cs.RO cs.CV 50%

UrbanNav: Learning Language-Guided Urban Navigation from Web-Scale Human Trajectories

UrbanNav: 从网络级人类轨迹学习语言引导的城市导航

Yanghong Mei, Yirong Yang, Longteng Guo, Qunbo Wang, Ming-Ming Yu, Xingjian He, Wenjun Wu, Jing Liu

专题命中 GUI与网页智能体 :autonomous agent(abstract)

AI总结 UrbanNav通过大规模网络视频数据训练具身智能体,实现基于语言指令的复杂城市导航,展示了在多样城市场景中的高效导航能力。

Comments 9 pages, 5 figures, accepted to AAAI 2026. Project page:https://github.com/CASIA-IVA-Lab/UrbanNav

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 记忆与上下文管理 6 篇

2509.23870 2026-01-16 cs.AI 83%

Gradient Coupling: The Hidden Barrier to Generalization in Agentic Reinforcement Learning

梯度耦合:代理强化学习中泛化能力的隐藏障碍

Jingyu Liu, Xiaopeng Wu, Jingquan Peng, Kehan Chen, Chuan Yu, Lizhong Ding, Yong Liu

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Beijing Institute of Technology(北京理工大学) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心)

专题命中 记忆与上下文管理 :agentic(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文提出了一种通过训练演员同时作为分类器来分离好坏动作,从而缓解代理强化学习中梯度耦合问题并提升泛化能力的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12991 2026-01-16 cs.CE q-fin.TR 78%

Controllable Financial Market Generation with Diffusion Guided Meta Agent

受扩散引导的元代理可控金融市场生成

Yu-Hao Huang, Chang Xu, Yang Liu, Weiqing Liu, Wu-Jun Li, Jiang Bian

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本文提出DigMA模型,通过扩散引导元代理生成可控且保真度高的金融市场,适用于高频交易任务。

Comments To appear in The Fortieth AAAI Conference on Artificial Intelligence (AAAI-26 Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09905 2026-01-16 cs.SE cs.CL 62%

Self-reflection in Automated Qualitative Coding: Improving Text Annotation through Secondary LLM Critique

在自动化定性编码中的自我反思:通过二次LLM批评提升文本标注

Zackary Okun Dunivin, Mobina Noori, Seth Frey, Curtis Atkinson

专题命中 记忆与上下文管理 :workflow(abstract);分类 cs.CL、cs.SE

AI总结 通过二次LLM批评提升文本标注精度,减少错误率并提高分类器性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10088 2026-01-16 cs.AI 57%

State of AI: An Empirical 100 Trillion Token Study with OpenRouter

AI 状态:一项具有 OpenRouter 的 100 万亿 token 实证研究

Malika Aubakirova, Alex Atallah, Chris Clark, Justin Summerville, Anjney Midha

机构 * OpenRouter

专题命中 记忆与上下文管理 :agentic(abstract);分类 cs.AI

AI总结 本研究通过分析 100 万亿 token 的真实世界 LLM 交互,揭示了 LLM 在实际应用中的复杂使用模式,包括开放式权重模型的普及、创意角色扮演的流行以及代理推理的兴起。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10025 2026-01-16 cs.AI 57%

Structured Personality Control and Adaptation for LLM Agents

结构化人格控制与适应用于大语言模型代理

Jinpeng Wang, Xinyu Jia, Wei Wei Heng, Yuquan Li, Binbin Shi, Qianlei Chen, Guannan Chen, Junxia Zhang, Yuyu Yin

机构 * Key Laboratory of Complex Systems Modeling and Simulation of Ministry of Education(教育部复杂系统建模与仿真重点实验室) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.AI

AI总结 本文提出基于荣格心理学类型模型的结构化人格控制框架,通过协调、强化补偿和反思机制实现LLM人格的细腻表达与动态适应,提升人机交互中的自然代理设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10535 2026-01-16 cs.CV 50%

SVII-3D: Advancing Roadside Infrastructure Inventory with Decimeter-level 3D Localization and Comprehension from Sparse Street Imagery

SVII-3D:利用厘米级3D定位与稀疏街道影像的综合理解,推进道路基础设施库存建设

Chong Liu, Luxuan Fu, Yang Jia, Zhen Dong, Bisheng Yang

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University, Wuhan 430079, China(信息工程测绘遥感国家重点实验室(LIESMARS),武汉大学) Research Institute Ltd, Chengdu 610000, China(四川省公路规划设计研究有限公司)

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 SVII-3D通过厘米级3D定位与稀疏影像综合理解,提升道路基础设施库存的自动化创建与细粒度状态诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. Agent评测 14 篇

2601.10440 2026-01-16 cs.CR cs.AI cs.LG 88%

AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior

AgentGuardian: 学习访问控制策略以管理AI代理行为

Nadya Abaev, Denis Klimov, Gerard Levinov, David Mimran, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben Gurion University of the Negev, Israel(内盖夫本· Gurion大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 AgentGuardian通过学习访问控制策略来管理AI代理行为,有效检测恶意输入并减少幻觉驱动的错误。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15143 2026-01-16 cs.AI cs.MA 79%

An intelligent agent-based simulation of human mobility in extreme urban morphologies

基于智能代理的极端城市形态中人类移动性模拟

Abderaouf Bahi, Amel Ourici

机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09813 2026-01-16 q-bio.PE 78%

An agent-based modelling approach to investigate the impact of gender on tuberculosis transmission in Uganda

基于代理建模的方法研究乌干达性别对肺结核传播的影响

James W. G. Doran, Dennis Mujuni, Kit Gallagher, Christian A. Yates, Ruth Bowness

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究通过开发基于代理的模型,探讨性别因素对乌干达肺结核传播的影响,发现性别均等的疾病进展参数可降低病例比率和总病例数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 75%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 73%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21817 2026-01-16 cs.CR cs.SE 70%

Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?

分布外,运气不足:LLMs在训练于漏洞数据集上的检测Top 25 CWE弱点的能力如何?

Yikun Li, Ngoc Tan Bui, Ting Zhang, Chengran Yang, Xin Zhou, Martin Weyssow, Jinfeng Jiang, Junkai Chen, Huihui Huang, Huu Hung Nguyen, Chiok Yew Ho, Jie Tan, Ruiyin Li, Yide Yin, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本研究提出BenchVul和TitanVul数据集及RVG流程,评估LLMs在检测Top 25 CWE弱点时的ID与OOD性能差异。

Comments Accepted for publication at ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10299 2026-01-16 cs.MA 67%

Multipath Routing for Multi-Hop UAV Networks

多路径路由用于多跳无人机网络

Zhenyu Zhao, Tiankui Zhang, Xiaoxia Xu, Junjie Li, Yuanwei Liu, Wenjuan Xing

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出IPPO-DM算法,通过多智能体深度强化学习实现多跳无人机网络中动态流量拆分与转发,提升交付延迟保障和包丢失性能。

Comments This paper has been submitted to IEEE Transactions on Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09723 2026-01-16 cs.CL cs.AI 62%

SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels

SagaScale: 一种真实、可扩展且高质量的长上下文基准,基于完整小说构建

Guancheng Du, Yong Hu, Wenqing Wang, Yaming Yang, Jiaheng Gao

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 SagaScale基于完整小说构建,提供长上下文基准,通过自动化数据收集管道,评估12个LLMs和三种方法,揭示LLM在长上下文处理中的表现差异及Agentic RAG的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03055 2026-01-16 cs.LG cs.AI 62%

Permissive Information-Flow Analysis for Large Language Models

宽松的信息流分析用于大型语言模型

Shoaib Ahmed Siddiqui, Radhika Gaonkar, Boris Köpf, David Krueger, Andrew Paverd, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Menglin Xia, Santiago Zanella-Béguelin

机构 * University of Cambridge(剑桥大学) Microsoft(微软公司) Mila

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种更宽松的信息流分析方法,通过传播对模型输出有影响的样本标签来提高大型语言模型的安全性和隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00010 2026-01-16 cs.CL 57%

PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization

PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限

Jiajun Zhang, Jianke Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Binyuan Hui, Qiang Liu, Zilei Wang, Liang Wang, Junyang Lin

机构 * USTC(University of Science and Technology of China) THU(Tsinghua University) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(State Key Laboratory of Information Security)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10103 2026-01-16 cs.CV cs.AI 57%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09961 2026-01-16 cs.GT 50%

A Control Theoretic Approach to Decentralized AI Economy Stabilization via Dynamic Buyback-and-Burn Mechanisms

通过动态买回-烧毁机制实现去中心化人工智能经济稳定性的控制论方法

Zehua Cheng, Wei Dai, Zhipeng Wang, Rui Sun, Nick Wen, Jiahao Sun

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出动态控制买回机制,通过控制论框架降低去中心化人工智能经济的波动性与操作员流失率,提升系统稳定性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09891 2026-01-16 econ.TH math.ST stat.TH 50%

Learning and Equilibrium under Model Misspecification

在模型不准确情况下的学习与均衡

Ignacio Esponda, Demian Pouzo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种统一框架,用于分析在模型不准确情况下代理的学习与均衡问题,结合了统计基础和内生行动依赖数据的扩展分析。

Journal ref Conference Volume for 2025 World Congress of the Econometric Society, Chapter 6

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 其他Agent 2 篇

2601.09027 2026-01-16 cond-mat.mtrl-sci 82%

Agentic AI and Machine Learning for Accelerated Materials Discovery and Applications

代理AI与机器学习在加速材料发现与应用中的作用

Jihua Chen, Panagiotis Christakopoulos, Karuna D. Chen, Ilia N. Ivanov, Rigoberto Advincula

专题命中 其他Agent :agentic(title,abstract);AI agent(abstract)

AI总结 本文探讨了代理AI和机器学习在加速材料发现中的应用,重点介绍了高效发现方法、核心概念及大型语言模型,并展示了其在流化学、生物传感器和电池等领域的应用。

Comments 36 pages, 4 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03884 2026-01-16 cs.HC 50%

Teaching with AI: A Systematic Review of Chatbots, Generative Tools, and Tutoring Systems in Programming Education

用AI教学:编程教育中聊天机器人、生成工具和辅导系统系统综述

Said Elnaffar, Farzad Rashidi, Abedallah Zaid Abualkishik

专题命中 其他Agent :AI agent(abstract)

AI总结 本文综述了AI在编程教育中的应用,分析了聊天机器人、生成工具和辅导系统的效果,指出需加强提示工程与人类监督以应对挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏