arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-16 至 2026-01-16 共收录 14 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 14 篇

2601.10440 2026-01-16 cs.CR cs.AI cs.LG 88%

AgentGuardian: Learning Access Control Policies to Govern AI Agent Behavior

AgentGuardian: 学习访问控制策略以管理AI代理行为

Nadya Abaev, Denis Klimov, Gerard Levinov, David Mimran, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben Gurion University of the Negev, Israel(内盖夫本· Gurion大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.LG

AI总结 AgentGuardian通过学习访问控制策略来管理AI代理行为,有效检测恶意输入并减少幻觉驱动的错误。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15143 2026-01-16 cs.AI cs.MA 79%

An intelligent agent-based simulation of human mobility in extreme urban morphologies

基于智能代理的极端城市形态中人类移动性模拟

Abderaouf Bahi, Amel Ourici

机构 * Computer Science and Applied Mathematics Laboratory (LIMA) Faculty of Science and Technology(计算机科学与应用数学实验室(LIMA)理学院) Faculty of Science and Technology, Chadli Bendjedid University(科学与技术学院,Chadli Bendjedid大学) Mathematical Modeling and Numerical Simulation Laboratory (LAM2SIN) Faculty of Technology(数学建模与数值模拟实验室(LAM2SIN)技术学院) Faculty of Technology, Badji Mokhtar University(技术学院,Badji Mokhtar大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 本文提出了一种混合模拟框架,通过整合强化学习和图神经网络,实现了在极端城市形态中高效且可持续的移动性解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09813 2026-01-16 q-bio.PE 78%

An agent-based modelling approach to investigate the impact of gender on tuberculosis transmission in Uganda

基于代理建模的方法研究乌干达性别对肺结核传播的影响

James W. G. Doran, Dennis Mujuni, Kit Gallagher, Christian A. Yates, Ruth Bowness

专题命中 Agent评测 :agent(title,abstract)

AI总结 本研究通过开发基于代理的模型,探讨性别因素对乌干达肺结核传播的影响,发现性别均等的疾病进展参数可降低病例比率和总病例数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 75%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 Agent评测 :agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10122 2026-01-16 cs.CL cs.AI cs.HC 73%

Role-Playing Agents Driven by Large Language Models: Current Status, Challenges, and Future Trends

由大型语言模型驱动的角色扮演代理:现状、挑战与未来趋势

Ye Wang, Jiaxing Chen, Hongjiang Xiao

机构 * Communication University of China(中国传媒大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文系统回顾了由大型语言模型驱动的角色扮演代理的现状、挑战及未来趋势,探讨了关键技术路径与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21817 2026-01-16 cs.CR cs.SE 70%

Out of Distribution, Out of Luck: How Well Can LLMs Trained on Vulnerability Datasets Detect Top 25 CWE Weaknesses?

分布外,运气不足:LLMs在训练于漏洞数据集上的检测Top 25 CWE弱点的能力如何?

Yikun Li, Ngoc Tan Bui, Ting Zhang, Chengran Yang, Xin Zhou, Martin Weyssow, Jinfeng Jiang, Junkai Chen, Huihui Huang, Huu Hung Nguyen, Chiok Yew Ho, Jie Tan, Ruiyin Li, Yide Yin, Han Wei Ang, Frank Liauw, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本研究提出BenchVul和TitanVul数据集及RVG流程,评估LLMs在检测Top 25 CWE弱点时的ID与OOD性能差异。

Comments Accepted for publication at ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10299 2026-01-16 cs.MA 67%

Multipath Routing for Multi-Hop UAV Networks

多路径路由用于多跳无人机网络

Zhenyu Zhao, Tiankui Zhang, Xiaoxia Xu, Junjie Li, Yuanwei Liu, Wenjuan Xing

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出IPPO-DM算法,通过多智能体深度强化学习实现多跳无人机网络中动态流量拆分与转发,提升交付延迟保障和包丢失性能。

Comments This paper has been submitted to IEEE Transactions on Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09723 2026-01-16 cs.CL cs.AI 62%

SagaScale: A Realistic, Scalable, and High-Quality Long-Context Benchmark Built from Full-Length Novels

SagaScale: 一种真实、可扩展且高质量的长上下文基准,基于完整小说构建

Guancheng Du, Yong Hu, Wenqing Wang, Yaming Yang, Jiaheng Gao

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 SagaScale基于完整小说构建,提供长上下文基准,通过自动化数据收集管道,评估12个LLMs和三种方法,揭示LLM在长上下文处理中的表现差异及Agentic RAG的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.03055 2026-01-16 cs.LG cs.AI 62%

Permissive Information-Flow Analysis for Large Language Models

宽松的信息流分析用于大型语言模型

Shoaib Ahmed Siddiqui, Radhika Gaonkar, Boris Köpf, David Krueger, Andrew Paverd, Ahmed Salem, Shruti Tople, Lukas Wutschitz, Menglin Xia, Santiago Zanella-Béguelin

机构 * University of Cambridge(剑桥大学) Microsoft(微软公司) Mila

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种更宽松的信息流分析方法,通过传播对模型输出有影响的样本标签来提高大型语言模型的安全性和隐私保护效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00010 2026-01-16 cs.CL 57%

PlotCraft: Pushing the Limits of LLMs for Complex and Interactive Data Visualization

PlotCraft: 推动大语言模型在复杂和交互式数据可视化中的极限

Jiajun Zhang, Jianke Zhang, Zeyu Cui, Jiaxi Yang, Lei Zhang, Binyuan Hui, Qiang Liu, Zilei Wang, Liang Wang, Junyang Lin

机构 * USTC(University of Science and Technology of China) THU(Tsinghua University) Alibaba Group(阿里巴巴集团) CASIA(Chinese Academy of Sciences Institute of Automation) SIAT(State Key Laboratory of Information Security)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 PlotCraft 提出了一种新的基准和数据集,用于评估大语言模型在复杂和交互式数据可视化任务中的性能,展示了 PlotCraftor 在复杂任务中的显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10156 2026-01-16 cs.CL 57%

ToolSafe: Enhancing Tool Invocation Safety of LLM-based agents via Proactive Step-level Guardrail and Feedback

ToolSafe: 通过主动的步骤级防护和反馈提升基于LLM的代理的工具调用安全性

Yutao Mou, Zhangchi Xue, Lijun Li, Peiyang Liu, Shikun Zhang, Wei Ye, Jing Shao

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 ToolSafe通过构建TS-Bench和TS-Guard模型,结合TS-Flow框架,有效减少LLM代理的有害工具调用并提升任务完成率。

Comments Work in Progress. Code available: https://github.com/MurrayTom/ToolSafe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10103 2026-01-16 cs.CV cs.AI 57%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09961 2026-01-16 cs.GT 50%

A Control Theoretic Approach to Decentralized AI Economy Stabilization via Dynamic Buyback-and-Burn Mechanisms

通过动态买回-烧毁机制实现去中心化人工智能经济稳定性的控制论方法

Zehua Cheng, Wei Dai, Zhipeng Wang, Rui Sun, Nick Wen, Jiahao Sun

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出动态控制买回机制,通过控制论框架降低去中心化人工智能经济的波动性与操作员流失率,提升系统稳定性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09891 2026-01-16 econ.TH math.ST stat.TH 50%

Learning and Equilibrium under Model Misspecification

在模型不准确情况下的学习与均衡

Ignacio Esponda, Demian Pouzo

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种统一框架,用于分析在模型不准确情况下代理的学习与均衡问题,结合了统计基础和内生行动依赖数据的扩展分析。

Journal ref Conference Volume for 2025 World Congress of the Econometric Society, Chapter 6

详情

展开后加载摘要…

URL PDF HTML 收藏