arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2025-12-22 至 2025-12-22 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 11 篇

2512.17838 2025-12-22 cs.CV 86%

ReX-MLE: The Autonomous Agent Benchmark for Medical Imaging Challenges

ReX-MLE:医疗影像挑战的自主代理基准

Roshan Kenia, Xiaoman Zhang, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院) Department of Biomedical Informatics(生物医学信息学系)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(title)

AI总结 ReX-MLE是一个针对医学影像挑战的自主代理基准,通过评估端到端工作流程,揭示了现有代理在领域知识和工程能力上的不足。

Comments https://github.com/rajpurkarlab/ReX-MLE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14512 2025-12-22 cs.AI 84%

Helmsman: Autonomous Synthesis of Federated Learning Systems via Collaborative LLM Agents

Helmsman: 通过协作LLM代理实现联邦学习系统的自主合成

Haoyuan Li, Mathias Funk, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);workflow(abstract);agentic(abstract)

AI总结 Helmsman通过协作LLM代理实现联邦学习系统的自主合成,提供端到端的自动化解决方案,生成性能优于传统手工基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17092 2025-12-22 cs.CL 79%

Data Augmentation Supporting a Conversational Agent Designed for Smoking Cessation Support Groups

数据增强支持用于戒烟支持小组的对话代理

Salar Hashemitaheri, Ian Harris

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 本文提出了一种两级数据增强策略,通过合成和真实数据提升对话代理在戒烟支持小组中的表现,验证了数据增强对F1分数提升的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17066 2025-12-22 cs.AI 74%

Realistic threat perception drives intergroup conflict: A causal, dynamic analysis using generative-agent simulations

现实威胁感知驱动群体冲突:基于生成代理模拟的因果动态分析

Suhaib Abdurahman, Farzan Karimi-Malekabadi, Chenxiao Yu, Nour S. Kteily, Morteza Dehghani

专题命中 Agent评测 :agent(title);分类 cs.AI

AI总结 本文通过生成代理模拟研究现实威胁与象征威胁对群体冲突的因果影响,发现现实威胁直接提升敌意,而象征威胁的影响需通过群体内偏见中介,非敌对接触可缓解冲突升级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16969 2025-12-22 cs.AI cs.CL cs.LG 67%

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

通过科学家对齐的工作流探测大语言模型的科学通用智能

Wanghan Xu, Yuhao Zhou, Yifan Zhou, Qinglong Cao, Shuo Li, Jia Bu, Bo Liu, Yixin Chen, Xuming He, Xiangyu Zhao, Xiang Zhuang, Fengxiang Wang, Zhiwang Zhou, Qiantai Feng, Wenxuan Huang, Jiaqi Wei, Hao Wu, Yuejin Yang, Guangshuai Wang, Sheng Xu, Ziyan Huang, Xinyao Liu, Jiyao Liu, Cheng Tang, Wei Li, Ying Chen, Junzhi Ning, Pengfei Jiang, Chenglong Ma, Ye Du, Changkai Ji, Huihui Xu, Ming Hu, Jiangbin Zheng, Xin Chen, Yucheng Wu, Feifei Jiang, Xi Chen, Xiangru Tang, Yuchen Fu, Yingzhou Lu, Yuanyuan Zhang, Lihao Sun, Chengbo Li, Jinzhe Ma, Wanhao Liu, Yating Liu, Kuo-Cheng Wu, Shengdu Chai, Yizhou Wang, Ouwen Zhangjin, Chen Tang, Shufei Zhang, Wenbo Cao, Junjie Ren, Taoyong Cui, Zhouheng Yao, Juntao Deng, Yijie Sun, Feng Liu, Wangxu Wei, Jingyi Xu, Zhangrui Li, Junchao Gong, Zijie Guo, Zhiyu Yao, Zaoyu Chen, Tianhao Peng, Fangchen Yu, Bo Zhang, Dongzhan Zhou, Shixiang Tang, Jiaheng Liu, Fenghua Ling, Yan Lu, Yuchen Ren, Ben Fei, Zhen Zhao, Xinyu Gu, Rui Su, Xiao-Ming Wu, Weikang Si, Yang Liu, Hao Chen, Xiangchao Yan, Xue Yang, Junchi Yan, Jiamin Wu, Qihao Zheng, Chenhui Li, Zhiqiang Gao, Hao Kong, Junjun He, Mao Su, Tianfan Fu, Peng Ye, Chunfeng Song, Nanqing Dong, Yuqiang Li, Huazhu Fu, Siqi Sun, Lijing Cheng, Jintai Lin, Wanli Ouyang, Bowen Zhou, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17259 2025-12-22 cs.MA cs.AI cs.LG 62%

Verifiability-First Agents: Provable Observability and Lightweight Audit Agents for Controlling Autonomous LLM Systems

可验证性优先代理:可证明的可观测性和轻量级审计代理用于控制自主大语言模型系统

Abhivansh Gupta

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种以可验证性为核心的代理架构,通过加密和符号方法实现运行时认证,嵌入轻量级审计代理并采用挑战-响应协议,以提高自主大语言模型系统的可控性和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03480 2025-12-22 stat.AP cs.LG 57%

Foundation for unbiased cross-validation of spatio-temporal models for species distribution modeling

用于物种分布建模中空间-时间模型无偏交叉验证的基础

Diana Koldasbayeva, Alexey Zaytsev

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺科学与技术研究所)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文提出基于空间自相关阻塞和外部时间验证的稳健SDM工作流程,以提高物种分布模型在空间和时间转移中的可靠性。

Comments Accepted manuscript. Published in Ecological Informatics (2025)

Journal ref Ecological Informatics, Volume 92, Article 103521, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17604 2025-12-22 cs.GT 56%

Comparing the Fairness of Recursively Balanced Picking Sequences

比较递归平衡选取序列的公平性

Karen Frilya Celine, Warut Suksompong, Sheung Man Yuen

专题命中 Agent评测 :agent(abstract);autonomous agent(comments)

AI总结 本文比较了递归平衡选取序列的公平性,发现通过调整选取顺序可优化最大最小份额保证。

Comments Appears in the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17238 2025-12-22 cs.GT 50%

Fairly Dividing Non-identical Random Items: Just Sample or Match

公平分配非相同随机物品:仅采样还是匹配

Aprup Kale, Rucha Kulkarni, Navya Garg

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在典型或随机实例中公平高效分配非相同随机物品的可能性,并提出通过采样而非全部计算来提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11362 2025-12-22 cs.RO 50%

An Anatomy of Vision-Language-Action Models: From Modules to Milestones and Challenges

视觉-语言-动作模型的解剖:从模块到里程碑与挑战

Chao Xu, Suyu Zhang, Yang Liu, Baigui Sun, Weihong Chen, Bo Xu, Qi Liu, Juncheng Wang, Shujun Wang, Shan Luo, Jan Peters, Athanasios V. Vasilakos, Stefanos Zafeiriou, Jiankang Deng

机构 * IROOTECH TECHNOLOGY(IROOTECH技术公司) Wolf 1069 b Lab, Sany Group(Sany集团沃尔夫1069b实验室) Department of Engineering, King’s College London(伦敦国王学院工程系) Hong Kong Polytechnic University(香港理工大学) Computer Science Department of the Technische Universität Darmstadt(德累斯顿技术大学计算机科学系) Department of ICT and Center for AI Research, University of Agder (UiA)(阿格德大学信息与通信技术系及人工智能研究中心) Department of Computing, Imperial College London(伦敦帝国理工学院计算系)

专题命中 Agent评测 :agent(abstract)

AI总结 本文系统分析了视觉-语言-动作模型的核心挑战,从模块构建到里程碑发展,为研究者提供结构化指南和未来研究方向。

Comments project page: https://suyuz1.github.io/VLA-Survey-Anatomy/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15984 2025-12-22 cs.HC 50%

Neuroadaptive Haptics: Comparing Reinforcement Learning from Explicit Ratings and Neural Signals for Adaptive XR Systems

神经适应性触觉:比较基于显式评分和神经信号的强化学习在自适应XR系统中的应用

Lukas Gehrke, Aleksandrs Koselevs, Marius Klug, Klaus Gramann

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出利用强化学习结合脑电图信号实现自适应XR触觉反馈,通过比较显式评分与神经信号的性能,验证了隐含神经反馈在个性化触觉适应中的有效性。

Comments 15 pages, 6 figures

Journal ref https://www.frontiersin.org/journals/virtual-reality/articles/10.3389/frvir.2025.1616442/full

详情

展开后加载摘要…

URL PDF HTML 收藏