arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-26 至 2026-01-26 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2601.16685 2026-01-26 cs.AI 89%

AgentsEval: Clinically Faithful Evaluation of Medical Imaging Reports via Multi-Agent Reasoning

AgentsEval: 通过多智能体推理实现医学影像报告的临床可信评估

Suzhong Fu, Jingqi Dong, Xuan Ding, Rui Sun, Yiming Yang, Shuguang Cui, Zhen Li

机构 * FNii-Shenzhen, The Chinese University of Hong Kong (Shenzhen) School of Science and Engineering(深圳FNii、香港中文大学(深圳)科学与工程学院)

专题命中 Agent评测 :agent(title,abstract);multi-agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 AgentsEval通过多智能体推理框架,实现医学影像报告的临床可信评估,提供结构化反馈和稳健的评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 85%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 Agent评测 :autonomous agent(title);agent(abstract);AI agent(abstract);multi-agent(abstract)

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06579 2026-01-26 cs.SI 82%

An Agent-based Model of Citation Behavior

引用行为的智能体模型

George Chacko, Minhyuk Park, Vikram Ramavarapu, Ananth Grama, Pablo Robles-Granda, Tandy Warnow

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文通过智能体模型研究引用行为,探讨引用策略对后续引用的影响,并发现适应性和局部性等效应在引用捕捉中的作用。

Journal ref Applied Network Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16478 2026-01-26 cs.CL cs.AI 81%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16367 2026-01-26 cs.GT cs.SY eess.SY 67%

Game-to-Real Gap: Quantifying the Effect of Model Misspecification in Network Games

游戏到现实的差距:量化网络博弈中模型不规范的影响

Bryce L. Ferguson, Chinmay Maheshwari, Manxi Wu, Shankar Sastry

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出游戏到现实的差距度量,用于量化多智能体环境中模型不规范的影响,并开发了新的网络中心性度量方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16866 2026-01-26 cs.RO cs.AI 57%

Boosting Deep Reinforcement Learning with Semantic Knowledge for Robotic Manipulators

通过语义知识提升机器人操作机的深度强化学习

Lucía Güitta-López, Vincenzo Suriani, Jaime Boal, Álvaro J. López-López, Daniele Nardi

机构 * Institute for Research in Technology (IIT), ICAI School of Engineering, Comillas Pontifical University(研究技术研究所(IIT)、ICAI工程学院、科利马斯天主教大学) University of Basilicata(巴利卡塔大学) Sapienza University of Rome(罗马萨皮恩扎大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出通过整合语义知识图嵌入提升机器人操作机深度强化学习效率,实验显示学习时间减少60%且任务准确性提升15个百分点。

Journal ref Robotics, published 24 June 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI 57%

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16720 2026-01-26 cs.HC 50%

Watching AI Think: User Perceptions of Visible Thinking in Chatbots

观察AI思考:用户对聊天机器人中可见思考的看法

Samuel Rhys Cox, Jade Martin-Lise, Simo Hosio, Niels van Berkel

专题命中 Agent评测 :agent(abstract)

AI总结 研究探讨可见思考对用户感知的影响,通过实验发现不同思考内容和情境对同理心、温暖、能力和参与度有显著影响,为设计更有效的对话代理提供依据。

Comments 22 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16654 2026-01-26 physics.bio-ph 50%

Magnetic Nanoparticles as Label-Free Dual-Function Nanoheaters and Nanothermometers

磁性纳米颗粒作为无标记双功能纳米加热器和纳米温度计

Alejandro Venegas-Gomez, Pablo Palacios-Alonso, Cristina C. Carrizo, Julieta Velasco Martínez-Pardo, Olmo Gómez-Rubio, Sedef Ozel-Okcu, Rafael Delgado-Buscalioni, Sebastian A. Thompson, Francisco J. Teran

专题命中 Agent评测 :agent(abstract)

AI总结 本研究利用钴铁磁性纳米颗粒作为无标记双功能平台,实现纳米尺度同时热生成与温度读取,通过动态磁化测量和光热转换技术,实现了实时热控制。

Comments 20pages, 6 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16583 2026-01-26 cs.HC 50%

Who You Explain To Matters: Learning by Explaining to Conversational Agents with Different Pedagogical Roles

你解释的对象很重要:通过向具有不同教学角色的对话代理解释来学习

Zhengtao Xu, Junti Zhang, Anthony Tang, Yi-Chieh Lee

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了不同教学角色的对话代理对学习动态的影响,发现不同角色在认知投入、学习兴趣和批判性思维方面有显著差异。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16579 2026-01-26 cs.GT 50%

On Best-of-Both-Worlds Fairness via Sum-of-Variances Minimization

通过方差和最小化实现最佳双世界公平性

Moshe Babaioff, Yuval Grofman

专题命中 Agent评测 :agent(abstract)

AI总结 通过最小化方差和实现事前比例性和事后公平性的分配方法,但在估值不同时会导致分配不公。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15864 2026-01-26 cs.GT cs.DS 50%

Minimum Envy Graphical House Allocation Beyond Identical Valuations

超越相同估值的最小嫉妒图形房屋分配

Tanmay Inamdar, Pallavi Jain, Pranjal Pandey

专题命中 Agent评测 :agent(abstract)

AI总结 研究在非相同估值下最小化嫉妒的图形房屋分配问题,设计了多项式时间算法和中等指数时间算法。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏