arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-19 至 2025-12-19 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2512.16108 2025-12-19 cs.AI 88%

WeMusic-Agent: Efficient Conversational Music Recommendation via Knowledge Internalization and Agentic Boundary Learning

WeMusic-Agent: 通过知识内化和代理边界学习实现高效的对话音乐推荐

Wendong Bi, Yirong Mao, Xianglong Liu, Kai Tian, Jian Zhang, Hanjie Wang, Wenhui Que

专题命中 Agent评测 :agent(title,abstract);agentic(title,abstract);分类 cs.AI

AI总结 WeMusic-Agent通过知识内化和代理边界学习,实现高效对话音乐推荐,提升个性化和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 83%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16381 2025-12-19 cs.NI 82%

A Network Arena for Benchmarking AI Agents on Network Troubleshooting

一个用于AI代理在网络故障排除中基准测试的网络竞技场

Zhihao Wang, Alessandro Cornacchia, Alessio Sacco, Franco Galante, Marco Canini, Dingde Jiang

专题命中 Agent评测 :AI agent(title);agent(abstract);agentic(abstract)

AI总结 NIKA是一个开源的网络故障排除基准,用于评估AI代理在动态网络环境中的性能,包含数百个精心挑选的网络事件和54个代表性问题,旨在帮助研究人员和网络专家改进网络故障诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16408 2025-12-19 cs.LG cs.MA 79%

NDRL: Cotton Irrigation and Nitrogen Application with Nested Dual-Agent Reinforcement Learning

NDRL:基于嵌套双智能体强化学习的棉花灌溉与氮肥施用

Ruifeng Xu, Liang He

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Xinjiang Multimodal Information Technology Engineering Research Center(新疆多模态信息处理工程技术研究中心) Xinjiang Key Laboratory of Signal Detection and Processing(新疆信号检测与处理重点实验室) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 NDRL通过嵌套双智能体强化学习优化棉花灌溉与氮肥施用,提升产量和资源利用效率。

Comments Accepted by ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15361 2025-12-19 cs.CE 78%

A Data-Enhanced Agent-Based Model for Simulating 3D Cancer Spheroid Growth: Integrating Metabolism and Mechanics

一种数据增强的基于代理的模型用于模拟3D肿瘤球体生长:整合代谢与力学

Pedro Garcia-Gomez, Paula Guerrero-Lopez, Silvia Hervas-Raluy, Jose Manuel Garcia-Aznar

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种整合代谢与力学的基于代理的模型,用于模拟3D肿瘤球体生长,通过参数校准和实验验证,揭示了肿瘤生长的动态机制和细胞行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16530 2025-12-19 cs.CL cs.AI 73%

Plain language adaptations of biomedical text using LLMs: Comparision of evaluation metrics

利用大语言模型对生物医学文本进行plain language改编:评估指标的比较

Primoz Kocbek, Leon Kopitar, Gregor Stiglic

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究比较了利用大语言模型对生物医学文本进行plain language改编的不同方法,发现gpt-4o-mini在评估指标上表现优异,而微调方法效果欠佳。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16553 2025-12-19 cs.AI cs.CL 62%

Needle in the Web: A Benchmark for Retrieving Targeted Web Pages in the Wild

网络中的针:评估在真实世界中检索和推理网页的基准测试

Yumeng Wang, Tianyu Fan, Lingrui Xu, Chao Huang

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Needle in the Web 是一个评估现代搜索代理和LLM在模糊探索性查询中检索和推理真实网页能力的基准测试,揭示了当前搜索系统在处理模糊性和复杂性时的挑战。

Comments Data and code are available at https://github.com/Tango-Whiskyman/Needle_in_the_Web

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15784 2025-12-19 cs.AI cs.LG 62%

Beyond Training: Enabling Self-Evolution of Agents with MOBIMEM

超越训练:通过MOBIMEM实现智能体的自我进化

Zibin Liu, Cheng Zhang, Xi Zhao, Yunfei Feng, Bingyu Bai, Dahu Feng, Erhu Feng, Yubin Xia, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MOBIMEM通过引入内存原语和操作系统启发的服务,实现了无需模型重训练的智能体自我进化,显著提升了任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16022 2025-12-19 cs.AI 57%

Conversational Time Series Foundation Models: Towards Explainable and Effective Forecasting

对话式时间序列基础模型:迈向可解释且有效的预测

Defu Cao, Michael Gee, Jinbo Liu, Hengxuan Wang, Wei Yang, Rui Wang, Yan Liu

机构 * University of Southern California(南加州大学) Amazon AWS(亚马逊AWS)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种对话式时间序列基础模型,通过智能法官机制协调集成模型,提升预测的可解释性和效果。

Comments 31Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16887 2025-12-19 physics.soc-ph physics.comp-ph 50%

An evacuation simulator for pedestrian dynamics based on the Social Force Model

基于社交力模型的行人动态疏散模拟器

Julián López, Virginia Mazzone, M. Leticia Rubio Puzzo, Juan Cruz Moreno

专题命中 Agent评测 :planning(abstract)

AI总结 基于社交力模型的开源疏散模拟器,提供直观界面和模块化设计,用于分析行人动态和优化疏散规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16011 2025-12-19 cs.RO 50%

dLITE: Differentiable Lighting-Informed Trajectory Evaluation for On-Orbit Inspection

dLITE:可微分的光照感知轨道检查轨迹评估

Jack Naylor, Raghav Mishra, Nicholas H. Barbara, Donald G. Dansereau

机构 * Australian Centre for Robotics(澳大利亚机器人中心) School of Aerospace, Mechanical and Mechatronic Engineering, The University of Sydney(航空航天、机械与机电工程学院,悉尼大学) Asset Management Hub (ARIAM), The University of Sydney(资产管理工作中心(ARIAM),悉尼大学)

专题命中 Agent评测 :planning(abstract)

AI总结 dLITE是一种全新的可微分模拟流水线,用于优化轨道检查轨迹以提高图像质量,为航天器任务规划提供创新方法。

Comments 13 pages, 9 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00329 2025-12-19 cs.SI 50%

When Small Acts Scale: Ethical Thresholds in Network Diffusion

当小行为扩大:网络扩散中的伦理阈值

Masoud Makrehchi

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出一个信息传递模型,研究网络扩散中的伦理阈值,揭示不同平台设计因素如何影响下游责任,应用于流行病防控和规范放大。

Comments 11 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏