arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-23 至 2026-01-23 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 11 篇

2601.15778 2026-01-23 cs.AI cs.CL 86%

Agentic Confidence Calibration

代理置信度校准

Jiaxin Zhang, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出Holistic Trajectory Calibration (HTC)方法,通过提取代理轨迹上的过程级特征,提升AI代理的置信度校准能力,实现更可靠的自主系统。

Comments 37 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15679 2026-01-23 cs.AI 85%

Improving Methodologies for Agentic Evaluations Across Domains: Leakage of Sensitive Information, Fraud and Cybersecurity Threats

提升跨领域的代理评估方法:敏感信息泄露、欺诈和网络安全隐患

Ee Wei Seah, Yongsen Zheng, Naga Nikshith, Mahran Morsidi, Gabriel Waikin Loh Matienzo, Nigel Gay, Akriti Vij, Benjamin Chua, En Qi Ng, Sharmini Johnson, Vanessa Wilfred, Wan Sie Lee, Anna Davidson, Catherine Devine, Erin Zorer, Gareth Holvey, Harry Coppock, James Walpole, Jerome Wynee, Magda Dubois, Michael Schmatz, Patrick Keane, Sam Deverett, Bill Black, Bo Yan, Bushra Sabir, Frank Sun, Hao Zhang, Harriet Farlow, Helen Zhou, Lingming Dong, Qinghua Lu, Seung Jang, Sharif Abuadbba, Simon O'Callaghan, Suyu Ma, Tom Howroyd, Cyrus Fung, Fatemeh Azadi, Isar Nejadgholi, Krishnapriya Vishnubhotla, Pulei Xiong, Saeedeh Lohrasbi, Scott Buffett, Shahrear Iqbal, Sowmya Vajjala, Anna Safont-Andreu, Luca Massarelli, Oskar van der Wal, Simon Möller, Agnes Delaborde, Joris Duguépéroux, Nicolas Rolin, Romane Gallienne, Sarah Behanzin, Tom Seimandi, Akiko Murakami, Takayuki Semitsu, Teresa Tsukiji, Angela Kinuthia, Michael Michie, Stephanie Kasaon, Jean Wangari, Hankyul Baek, Jaewon Noh, Kihyuk Nam, Sang Seo, Sungpil Shin, Taewhi Lee, Yongsu Kim

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究通过跨领域合作,提升代理评估方法,聚焦敏感信息泄露、欺诈和网络安全等共同风险,推动AI系统测试的最佳实践。

Comments The author/contributor list organises contributors by country and alphabetical order within each country. In some places, the order has been altered to match other related publications

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14691 2026-01-23 cs.AI cs.CL 81%

Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation

操纵法官:不忠的推理链可能损害智能体评估

Muhammad Khalifa, Lajanugen Logeswaran, Jaekyeom Kim, Sungryull Sohn, Yunxiang Zhang, Moontae Lee, Hao Peng, Lu Wang, Honglak Lee

机构 * University of Michigan(密歇根大学) LG AI Research(LG人工智能研究) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL

AI总结 本文揭示了LLM法官对智能体推理轨迹操纵的脆弱性,表明基于内容的操纵能显著提高假阳性率,凸显了需验证推理与证据的评估机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15551 2026-01-23 cs.AI cs.MA 70%

ALIGNAgent: Adaptive Learner Intelligence for Gap Identification and Next-step guidance

ALIGNAgent: 适应性学习智能用于知识缺口识别与下一步指导

Bismack Tokoli, Luis Jaimes, Ayesha S. Dina

机构 * Department Of Data Science and Business Analytics, *Department Of Computer Science, Florida Polytechnic University(数据科学与商业分析系、计算机科学系,佛罗里达理工学院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 ALIGNAgent是一种多智能体教育框架,通过整合知识估计、技能缺口识别和定向资源推荐,实现个性化学习,实验证明其在知识熟练度估计上的高精度和高F1分数。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22777 2026-01-23 cs.CL 70%

MEDAL: A Framework for Benchmarking LLMs as Multilingual Open-Domain Dialogue Evaluators

MEDAL:一个用于评估LLM作为多语言开放领域对话评估器的框架

John Mendonça, Alon Lavie, Isabel Trancoso

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 MEDAL框架通过多语言多代理方法,评估LLM作为开放领域对话评估者的性能,揭示了现有评判者在检测细微问题上的不足。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13710 2026-01-23 cs.LG cs.AI cs.CL 67%

Who Benefits From Sinus Surgery? Comparing Generative AI and Supervised Machine Learning for Predicting Surgical Outcomes in Chronic Rhinosinusitis

哪些人会从鼻窦手术中受益?比较生成式AI与监督学习在预测慢性鼻窦炎手术结果中的应用

Sayeed Shafayet Chowdhury, Snehasis Mukhopadhyay, Shiaofen Fang, Vijay R. Ramakrishnan

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Computer Science, Indiana University Indianapolis(计算机科学系,印第安纳大学印第安纳波利斯分校) Department of Otolaryngology—Head and Neck Surgery, Indiana University School of Medicine(耳鼻喉科—头颈外科,印第安纳大学医学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文比较生成式AI与监督学习在预测慢性鼻窦炎手术预后中的表现,发现监督学习在准确率和校准上优于生成式AI,后者在解释性上与临床经验一致,支持以ML为主、生成式AI辅助的决策流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15487 2026-01-23 cs.AI cs.CL cs.MA 62%

MiRAGE: A Multiagent Framework for Generating Multimodal Multihop Question-Answer Dataset for RAG Evaluation

MiRAGE:一种多智能体框架,用于生成多模态多跳问题-答案数据集以评估RAG系统

Chandan Kumar Sahu, Premith Kumar Chilukuri, Matthew Hetrich

机构 * ABB Inc(ABB公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 MiRAGE通过多智能体框架生成多模态多跳问题-答案数据集,提升RAG系统评估的准确性和复杂性。

Comments 12 pages, 2 figures, Submitted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12471 2026-01-23 cs.CL cs.AI 62%

Knowing When to Abstain: Medical LLMs Under Clinical Uncertainty

知何时退避:医疗大语言模型在临床不确定性中的表现

Sravanthi Machcha, Sushrita Yerra, Sahil Gupta, Aishwarya Sahoo, Sharmin Sultana, Hong Yu, Zonghai Yao

机构 * Manning College of Information and Computer Sciences, UMass Amherst, MA, USA(马萨诸塞大学阿姆赫斯特曼宁信息与计算机科学学院) Center for Healthcare Organization and Implementation Research, VA Bedford Health Care(医疗组织与实施研究中心) Miner School of Computer and Information Sciences, UMass Lowell, MA, USA(米纳尔计算机与信息科学学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出MedAbstain基准,探讨医疗LLM在临床不确定性中的退避能力,发现显式退避选项能显著提升安全性,而模型规模和提示方法效果有限。

Comments Equal contribution for the first two authors; To appear in proceedings of the Main Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15676 2026-01-23 cs.SD cs.LG eess.AS 57%

Bridging the Perception Gap: A Lightweight Coarse-to-Fine Architecture for Edge Audio Systems

弥合感知差距:一种轻量级由粗到细架构用于边缘音频系统

Hengfan Zhang, Yueqian Lin, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 CoFi-Agent通过工具增强的条件边缘-云协作,在边缘音频系统中实现了更高效的感知与准确性提升。

Comments 10 pages, 3 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15120 2026-01-23 cs.AI 57%

Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories

从地面崛起:通过推导真实调用为虚拟轨迹来解决工具使用代理中的意图偏差

Qian Xiong, Yuekai Huang, Bo Yang, Yujia Zheng, Tianhao Li, Ziyou Jiang, Zhiyuan Chang, Zhaoyang Li, Huanxiang Feng, Mingyang Li

机构 * Beijing Forestry University(北京林业大学) State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Duke University(杜克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 RISE通过推导真实调用为虚拟轨迹,解决工具使用代理中的意图偏差问题,提升任务完成和意图对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15293 2026-01-23 cs.HC cs.RO 50%

Social Robotics for Disabled Students: An Empirical Investigation of Embodiment, Roles and Interaction

面向残疾学生的社会机器人:关于具身性、角色和互动的经验研究

Alva Markelius, Fethiye Irmak Doğan, Julie Bailey, Guy Laban, Jenny L. Gibson, Hatice Gunes

机构 * University of Cambridge, CST(剑桥大学,CST) University of Cambridge, EDUC(剑桥大学,EDUC)

专题命中 Agent评测 :agent(abstract)

AI总结 本研究探讨残疾学生对基于机器人的支持的感知,比较不同互动角色和具身类型的影响,揭示具身性对社会性和隐私感知的作用,以及不同残疾类型间的差异。

Comments Preprint. Accepted at ACM IEEE International Conference on Human Robot Interaction 2026, Edinburgh, Scotland, UK

详情

展开后加载摘要…

URL PDF HTML 收藏