arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-24 至 2025-12-24 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 11 篇

2512.20186 2025-12-24 cs.NI 78%

Edge-Served Congestion Control for Wireless Multipath Transmission with a Transformer Agent

边缘服务器的无线多路径传输拥塞控制与变压器代理

Liang Wang

专题命中 Agent评测 :agent(title,abstract)

AI总结 Jazz通过基于Transformer的代理和解耦架构,提升无线多路径传输的拥塞控制效率,实现更高的带宽利用率和稳定的网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20206 2025-12-24 cs.AI 70%

TongSIM: A General Platform for Simulating Intelligent Machines

TongSIM: 一个用于模拟智能机器的通用平台

Zhe Sun, Kunlun Wu, Chuanjian Fu, Zeming Song, Langyong Shi, Zihe Xue, Bohan Jing, Ying Yang, Xiaomeng Gao, Aijia Li, Tianyu Guo, Huiying Li, Xueyuan Yang, Rongkai Liu, Xinyi He, Yuxi Wang, Yue Li, Mingyuan Liu, Yujie Lu, Hongzhao Xie, Shiyun Zhao, Bo Dai, Wei Wang, Tao Yuan, Song-Chun Zhu, Yujia Peng, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI Beijing, China(中国北京)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 TongSIM是一个通用平台,用于训练和评估具身智能代理,提供多样化的场景和交互丰富的环境,支持从低级导航到高级复合活动的广泛研究需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20083 2025-12-24 cs.SE cs.RO 70%

Detecting Non-Optimal Decisions of Embodied Agents via Diversity-Guided Metamorphic Testing

通过多样性引导的元形态测试检测具身代理的非最优决策

Wenzhao Wu, Yahui Tang, Mingfei Cheng, Wenbing Tang, Yuan Zhou, Yang Liu

机构 * National Supercomputing Center(国家超算中心) School of Computer(计算机学院) Singapore Management University(新加坡国立大学) College of Information Engineering(信息工程学院) School of Computer Science and Technology(计算机科学与技术学院) College of Computing and Data Science(计算与数据科学学院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.SE

AI总结 通过多样性引导的元形态测试检测具身代理的非最优决策,提出NoD-DGMT框架,有效识别规划中的效率低下问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20292 2025-12-24 cs.CL cs.AI cs.MM 62%

SlideTailor: Personalized Presentation Slide Generation for Scientific Papers

SlideTailor: 科学论文个性化演示文稿生成

Wenzheng Zeng, Mingyu Ouyang, Langyuan Cui, Hwee Tou Ng

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 SlideTailor通过用户指定的偏好生成个性化科学论文演示文稿,结合人类行为启发的代理框架和语音链机制,提升生成质量与应用效果。

Comments AAAI 2026 (with appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19696 2025-12-24 cs.NI cs.AI cs.LG 62%

QoS-Aware Dynamic CU Selection in O-RAN with Graph-Based Reinforcement Learning

基于图的强化学习的O-RAN中服务质量感知的动态CU选择

Sebastian Racedo, Brigitte Jaumard, Oscar Delgado, Meysam Masoudi

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的强化学习方法,实现O-RAN中动态CU选择以降低能耗并满足服务质量约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 57%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19682 2025-12-24 cs.CL 57%

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

GenEnv:LLM代理与环境模拟器之间的难度对齐共进化

Jiacheng Guo, Ling Yang, Peter Chen, Qixin Xiao, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GenEnv通过动态生成任务与代理能力对齐的共进化机制,在减少数据使用量的同时显著提升代理性能。

Comments Our codes are available at https://github.com/Gen-Verse/GenEnv

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05495 2025-12-24 cs.AI 57%

Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents

深度研究比较器:一种用于深度研究代理细粒度人工标注的平台

Prahaladh Chandrahasan, Jiahe Jin, Zhihan Zhang, Tevin Wang, Andy Tang, Lucy Mo, Morteza Ziyadi, Leonardo F. R. Ribeiro, Zimeng Qiu, Markus Dreyer, Akari Asai, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 深度研究比较器平台通过细粒度人工标注和端到端代理框架,提升深度研究代理的评估与开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20600 2025-12-24 eess.SY cs.SY econ.GN q-fin.EC 50%

Modeling Economic Systems as Multiport Networks

将经济系统建模为多端口网络

Coen Hutters, Max B. Mendel

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用多端口网络理论建模经济系统,通过配对商品流动与激励,分析宏观经济行为的微观基础。

Comments 29 pages, 16 figures, to be submitted to Journal of the Franklin Institute

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20261 2025-12-24 cs.GT 50%

Maximizing the Egalitarian Welfare in Friends and Enemies Games

在朋友与敌人游戏中最大化平等福利

Edith Elkind, Michele Flammini, Giovanna Varricchio

专题命中 Agent评测 :agent(abstract)

AI总结 研究在朋友与敌人游戏中最大化平等福利的复杂性,提出两种经典场景的近似算法及特殊情况下的多项式时间解决方案。

Comments Accepted paper at AAMAS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20221 2025-12-24 cs.HC 50%

The Effect of Empathic Expression Levels in Virtual Human Interaction: A Controlled Experiment

共情表达水平对虚拟人类交互的影响:一项受控实验

Sung Park, Daeho Yoon, Jungmin Lee

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过实验发现,基于视频的共情表达在情感共情方面效果更佳,表明共情表达应作为渐进变量而非二元能力。

详情

展开后加载摘要…

URL PDF HTML 收藏