arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-24 至 2025-12-24 共收录 67 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 11 篇

2512.19696 2025-12-24 cs.NI cs.AI cs.LG 62%

QoS-Aware Dynamic CU Selection in O-RAN with Graph-Based Reinforcement Learning

基于图的强化学习的O-RAN中服务质量感知的动态CU选择

Sebastian Racedo, Brigitte Jaumard, Oscar Delgado, Meysam Masoudi

机构 * Concordia University(康科迪亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于图的强化学习方法,实现O-RAN中动态CU选择以降低能耗并满足服务质量约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19992 2025-12-24 cs.AI cs.CY 57%

S$^3$IT: A Benchmark for Spatially Situated Social Intelligence Test

S$^3$IT:一种用于空间情境社交智能测试的基准

Zhe Sun, Xueyuan Yang, Yujie Lu, Zhenliang Zhang

机构 * State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(通用人工智能国家重点实验室,北京通用人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 S$^3$IT基准通过座位安排任务评估代理在现实情境中整合物理与社会约束的能力,揭示LLMs在空间智能上的不足及在冲突解决中的潜力。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19682 2025-12-24 cs.CL 57%

GenEnv: Difficulty-Aligned Co-Evolution Between LLM Agents and Environment Simulators

GenEnv:LLM代理与环境模拟器之间的难度对齐共进化

Jiacheng Guo, Ling Yang, Peter Chen, Qixin Xiao, Yinjie Wang, Xinzhe Juan, Jiahao Qiu, Ke Shen, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 GenEnv通过动态生成任务与代理能力对齐的共进化机制,在减少数据使用量的同时显著提升代理性能。

Comments Our codes are available at https://github.com/Gen-Verse/GenEnv

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05495 2025-12-24 cs.AI 57%

Deep Research Comparator: A Platform For Fine-grained Human Annotations of Deep Research Agents

深度研究比较器:一种用于深度研究代理细粒度人工标注的平台

Prahaladh Chandrahasan, Jiahe Jin, Zhihan Zhang, Tevin Wang, Andy Tang, Lucy Mo, Morteza Ziyadi, Leonardo F. R. Ribeiro, Zimeng Qiu, Markus Dreyer, Akari Asai, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 深度研究比较器平台通过细粒度人工标注和端到端代理框架,提升深度研究代理的评估与开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20600 2025-12-24 eess.SY cs.SY econ.GN q-fin.EC 50%

Modeling Economic Systems as Multiport Networks

将经济系统建模为多端口网络

Coen Hutters, Max B. Mendel

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用多端口网络理论建模经济系统,通过配对商品流动与激励,分析宏观经济行为的微观基础。

Comments 29 pages, 16 figures, to be submitted to Journal of the Franklin Institute

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20261 2025-12-24 cs.GT 50%

Maximizing the Egalitarian Welfare in Friends and Enemies Games

在朋友与敌人游戏中最大化平等福利

Edith Elkind, Michele Flammini, Giovanna Varricchio

专题命中 Agent评测 :agent(abstract)

AI总结 研究在朋友与敌人游戏中最大化平等福利的复杂性,提出两种经典场景的近似算法及特殊情况下的多项式时间解决方案。

Comments Accepted paper at AAMAS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20221 2025-12-24 cs.HC 50%

The Effect of Empathic Expression Levels in Virtual Human Interaction: A Controlled Experiment

共情表达水平对虚拟人类交互的影响:一项受控实验

Sung Park, Daeho Yoon, Jungmin Lee

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过实验发现,基于视频的共情表达在情感共情方面效果更佳,表明共情表达应作为渐进变量而非二元能力。

详情

展开后加载摘要…

URL PDF HTML 收藏