arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-01 至 2026-01-01 共收录 12 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 12 篇

2512.23844 2026-01-01 cs.SE cs.AI cs.HC 88%

From Correctness to Collaboration: Toward a Human-Centered Framework for Evaluating AI Agent Behavior in Software Engineering

从正确性到协作:迈向以人为中心的评估AI代理行为在软件工程中的框架

Tao Dong, Harini Sampath, Ja Young Lee, Sherry Y. Shi, Andrew Macvean

机构 * Google LLC(谷歌公司)

专题命中 Agent评测 :agent(title,abstract);AI agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本文提出以人为中心的评估框架,旨在评估AI代理在软件工程中的协作行为,通过定义代理行为期望和引入情境适应框架,推动AI代理向协作智能发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25055 2026-01-01 cs.AI cs.HC 83%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23961 2026-01-01 cs.IR cs.AI cs.MA 79%

An Comparative Analysis about KYC on a Recommendation System Toward Agentic Recommendation System

面向代理推荐系统的KYC比较分析

Junjie H. Xu

机构 * Hechu Tech(海楚科技)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 本文提出利用代理AI的KYC推荐系统,通过对比不同垂直领域的性能,评估其在金融领域的应用效果。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24959 2026-01-01 cs.LG cs.AI 73%

Semi-overlapping Multi-bandit Best Arm Identification for Sequential Support Network Learning

半重叠多臂老虎机最佳臂识别用于序列支持网络学习

András Antos, András Millinghoffer, Péter Antal

机构 * Department of Artificial Intelligence and Systems Engineering(人工智能与系统工程系) Budapest University of Technology and Economics(布达佩斯技术与经济大学) E-Group ICT Software Zrt.(E-Group ICT软件公司)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半重叠多臂老虎机模型,用于高效学习支持网络,改进多老虎机最佳臂识别的误差界并提升性能保证。

Comments 29 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23859 2026-01-01 cs.HC cs.AI cs.CY 70%

Seeking Late Night Life Lines: Experiences of Conversational AI Use in Mental Health Crisis

寻找深夜生活线:在心理健康危机中使用对话AI的体验

Leah Hope Ajmani, Arka Ghosh, Benjamin Kaveladze, Eugenia Kim, Keertana Namuduri, Theresa Nguyen, Ebele Okoli, Jessica Schleider, Denae Ford, Jina Suh

机构 * University of Minnesota(明尼苏达大学) Northwestern University(西北大学) Dartmouth College(达特茅斯学院) Microsoft(微软) Mental Health America(心理健康美国) Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文研究了在心理健康危机中使用对话AI的体验,发现AI在填补人类支持空缺中的作用,同时强调人类连接的重要性,并提出负责任的AI干预应促进积极行动并缓解负面行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24415 2026-01-01 cs.CR cs.HC 67%

Language Model Agents Under Attack: A Cross Model-Benchmark of Profit-Seeking Behaviors in Customer Service

语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试

Jingyu Zhang

专题命中 Agent评测 :agent(abstract);agentic(abstract)

AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06205 2026-01-01 cs.AI cs.CL cs.LG 67%

On measuring grounding and generalizing grounding problems

关于测量 grounding 并推广 grounding 问题

Daniel Quigley, Eric Maynard

机构 * Center for Possible Minds(可能心智中心) Indiana University(印第安纳大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出了一种框架,用于测量和推广 grounding 问题,通过定义不同需求和评估标准,分析了符号、参照、向量和关系四种模式的 grounding 现状,并探讨了其在不同任务中的表现。

Comments resubmission: 39 pages, 85 sources, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24848 2026-01-01 cs.CL cs.AI 62%

PrivacyBench: A Conversational Benchmark for Evaluating Privacy in Personalized AI

PrivacyBench: 一个用于评估个性化AI隐私的对话基准

Srija Mukhopadhyay, Sathwik Reddy, Shruthi Muthukumar, Jisun An, Ponnurangam Kumaraguru

机构 * International Institute of Information Technology Hyderabad(国际信息科技研究所(海得拉巴)) Indiana University(印第安纳大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 PrivacyBench通过多轮对话评估揭示RAG助手在隐私保护上的缺陷,指出需结构性隐私保障措施以确保伦理网络环境。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23762 2026-01-01 cs.LG cs.AI cs.NI 62%

Drift-Based Dataset Stability Benchmark

基于漂移的数据集稳定性基准

Dominik Soukup, Richard Plný, Daniel Vašata, Tomáš Čejka

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校) CESNET

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于概念漂移检测的方法,用于评估数据集稳定性并提供基准工作流程,以比较不同数据集的稳定性及优化影响。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23739 2026-01-01 cs.CL cs.AI cs.CV cs.RO 62%

Break Out the Silverware -- Semantic Understanding of Stored Household Items

拿出银器——对存储家居物品的语义理解

Michaela Levi-Richter, Reuth Mirsky, Oren Glickman

机构 * Bar Ilan University, Computer Science Department(巴伊兰大学计算机科学系) Tufts University, Department of Computer Science(塔夫茨大学计算机科学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出NOAM模型,通过结合结构化场景理解和大语言模型推理,实现对家庭物品存储位置的语义理解,显著提升预测准确率并接近人类水平。

Comments Poster presented at the Israeli Seminar on Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24733 2026-01-01 cs.CL 57%

BIOME-Bench: A Benchmark for Biomolecular Interaction Inference and Multi-Omics Pathway Mechanism Elucidation from Scientific Literature

BIOME-Bench: 一个用于生物分子相互作用推断和多组学通路机制阐明的基准

Sibo Wei, Peng Chen, Lifeng Dong, Yin Luo, Lei Wang, Peng Zhang, Wenpeng Lu, Jianbin Guo, Hongjun Yang, Dajun Zeng

机构 * Beijing Wenge Technology Co., Ltd(北京文格科技有限公司) Experimental Research Center, China Academy of Chinese Medical Sciences(中国中医科学院实验研究中心) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Qilu University of Technology (Shandong Academy of Sciences)(齐鲁工业大学(山东科学院)) School of New Media and Communication, Tianjin University(天津大学新闻与传播学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 BIOME-Bench通过四阶段工作流评估LLMs在多组学分析中的生物分子相互作用推断和通路机制阐明能力,揭示现有模型在细粒度关系区分和通路解释上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24934 2026-01-01 cs.DS 50%

Fair Committee Selection under Ordinal Preferences and Limited Cardinal Information

在有序偏好和有限基数信息下公平委员会选择

Ameet Gadekar, Aristides Gionis, Suhas Thejaswi, Sijing Tu

专题命中 Agent评测 :agent(abstract)

AI总结 研究在有序偏好和有限基数信息下设计公平的k-委员会选择算法,提出因子5的度量算法,通过有限查询实现最小化成本与公平性保障。

Comments AAMAS EA'26

详情

展开后加载摘要…

URL PDF HTML 收藏