arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-27 至 2026-01-27 共收录 172 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 34 篇

2601.17722 2026-01-27 cs.AI 70%

EntWorld: A Holistic Environment and Benchmark for Verifiable Enterprise GUI Agents

EntWorld: 一个综合环境和基准,用于可验证的企业GUI代理

Ying Mo, Yu Bai, Dapeng Sun, Yuqian Shi, Yukai Miao, Li Chen, Dan Li

机构 * Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI

AI总结 EntWorld是一个综合的企业GUI代理基准,通过基于模式的任务生成和SQL验证机制,评估代理在企业环境中的表现,揭示当前代理能力的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17344 2026-01-27 cs.CL 70%

The Shadow Self: Intrinsic Value Misalignment in Large Language Model Agents

阴影自我:大型语言模型代理中的内在价值偏差

Chen Chen, Kim Young Il, Yuan Yang, Wenhao Su, Yilin Zhang, Xueluan Gong, Qian Wang, Yongsen Zheng, Ziyao Liu, Kwok-Yan Lam

机构 * Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究提出IMPRESS框架,系统评估大型语言模型代理中的内在价值偏差风险,发现其在不同模型中普遍存在,且受上下文化和框架机制显著影响。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01993 2026-01-27 cs.AI 70%

Towards Privacy-Preserving Mental Health Support with Large Language Models

面向隐私保护的大型语言模型在心理健康支持中的应用

Dong Xue, Jicheng Tu, Ming Wang, Xin Yan, Fangzhou Liu, Jie Hu

机构 * IEEE

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MindChat和MindCorpus,通过多智能体角色扮演框架生成高质量咨询数据,结合联邦学习和差分隐私优化,实现隐私保护的高效心理健康支持系统。

Comments 15 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 67%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17588 2026-01-27 cs.AI cs.CL 62%

Intelligence Requires Grounding But Not Embodiment

智能需要具身但不需要身体

Marcus Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出智能需要基础性而非具身,通过定义智能的四个属性并论证非具身智能体可实现这些属性,从而得出结论:基础性是智能的必要条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09715 2026-01-27 cs.CL cs.AI cs.HC cs.IR 62%

Introducing Axlerod: An LLM-based Chatbot for Assisting Independent Insurance Agents

引入Axlerod:一种基于大语言模型的聊天机器人,用于协助独立保险代理

Adam Bradley, John Hastings, Khandaker Mamun Ahmed

机构 * The Beacom College of Computer and Cyber Sciences, Dakota State University(计算机与网络安全学院,达科他州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Axlerod是一种基于大语言模型的聊天机器人,旨在通过自然语言处理、检索增强生成和领域知识整合,提高独立保险代理的工作效率。

Comments 6 pages, 2 figures, 1 table

Journal ref 2025 IEEE Cyber Awareness and Research Symposium (CARS'25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10994 2026-01-27 cs.CL cs.AI 62%

Deep Research with Open-Domain Evaluation and Multi-Stage Guardrails for Safety

基于开放领域评估和多阶段防护机制的深度研究

Wei-Chieh Huang, Henry Peng Zou, Yaozu Wu, Dongyuan Li, Yankai Chen, Weizhi Zhang, Yangning Li, Angelo Zangari, Jizhou Guo, Chunyu Miao, Liancheng Fang, Langzhou He, Yinghui Li, Renhe Jiang, Philip S. Yu

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出DeepResearchGuard和DRSafeBench,通过开放领域评估和多阶段防护机制提升深度研究的安全性和报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18754 2026-01-27 cs.CR cs.AI 57%

$α^3$-SecBench: A Large-Scale Evaluation Suite of Security, Resilience, and Trust for LLM-based UAV Agents over 6G Networks

$α^3$-SecBench:一个大规模评估套件,用于评估基于LLM的无人机代理在6G网络中的安全、韧性与信任

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, College of Information Technology, United Arab Emirates University(计算机与网络工程系,信息科技学院,阿拉伯联合酋长国大学) Khalifa University of Science and Technology(科学与技术喀拉奇大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 $α^3$-SecBench通过大规模评估基于LLM的无人机代理在6G网络中的安全、韧性和信任,揭示了现有模型在对抗环境下的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13588 2026-01-27 cs.AI cs.CE cs.CY 57%

CoBRA: Programming Cognitive Bias in Social Agents Using Classic Social Science Experiments

CoBRA:利用经典社会科学实验编程社会代理中的认知偏差

Xuan Liu, Haoyang Shang, Haojian Jin

机构 * University of California San Diego(加州大学圣地亚哥分校) Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 CoBRA通过经典社会科学实验设计,为社会代理提供了一种可编程的认知偏差控制方法,实现一致的行为模拟与可重用的AI训练环境。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17596 2026-01-27 cs.CL 57%

Learning to Ideate for Machine Learning Engineering Agents

为机器学习工程代理学习创意

Yunxiang Zhang, Kang Zhou, Zhichao Xu, Kiran Ramnath, Yun Zhou, Sangmin Woo, Haibo Ding, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室) University of Michigan(密歇根大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本文提出MLE-Ideator双代理框架,通过强化学习训练生成更有效的创意,显著提升机器学习工程代理的性能。

Comments EACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17335 2026-01-27 cs.AI 57%

The Relativity of AGI: Distributional Axioms, Fragility, and Undecidability

AGI的相对性:分布公理、脆弱性与不可判定性

Angshul Majumdar

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文研究了AGI的理论定义问题,证明其泛化本质为关系性,且无法通过计算过程可靠认证,指出强AGI主张在无明确索引时是未定义的。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18587 2026-01-27 stat.ME stat.AP 50%

Vaccine Efficacy Estimands Implied by Common Estimators Used in Individual Randomized Field Trials

由个体随机现场试验中常用估计器隐含的疫苗效力估计量

Michael P. Fay, Dean Follmann, Bruce J. Swihart, Lauren E. Dang

专题命中 Agent评测 :agent(abstract)

AI总结 本文探讨了个体随机现场试验中常用估计器隐含的疫苗效力估计量,分析了其在不同时间点的解释困难及敏感性分析方法。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18416 2026-01-27 physics.chem-ph 50%

Refinement and Performance Benchmark for Range-Separated Water Force Field

范围分离水力场的改进与性能基准

Qian Gao, Junmin Chen, Kuang Yu

专题命中 Agent评测 :workflow(abstract)

AI总结 本文改进了范围分离水力场,通过新训练流程提升稳定性,实现亚化学精度并展现先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18263 2026-01-27 cs.CV 50%

Revisiting Aerial Scene Classification on the AID Benchmark

重新审视AID基准上的空域场景分类

Subhajeet Das, Susmita Ghosh, Abhiroop Chatterjee

专题命中 Agent评测 :planning(abstract)

AI总结 本文提出Aerial-Y-Net模型,通过多尺度特征融合和空间注意力机制,在AID数据集上实现91.72%的分类准确率,优于现有方法。

Comments Presented at the IEEE India Geoscience and Remote Sensing Symposium 2025 and accepted for publication in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19233 2026-01-27 cs.NI 50%

An O-RAN Framework for AI/ML-Based Localization with OpenAirInterface and FlexRIC

面向AI/ML定位的O-RAN框架:结合OpenAirInterface和FlexRIC

Nada Bouknana, Mohsen Ahadi, Florian Kaltenberger, Robert Schmidt

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于O-RAN框架的AI/ML定位方案,利用OpenAirInterface和FlexRIC实现实时定位,验证了其在真实环境中的可行性。

Comments to be published in Proceedings of the Wireless On-demand Network systems and Services conference, 2-4 March 2026, Crans-Montana, Switzerland (WONS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09965 2026-01-27 cs.DS 50%

Seat Arrangement Problems under B-utility and W-utility

在B效用和W效用下的座位安排问题

José Rodríguez

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出B效用和W效用模型,研究在考虑一维偏好下座位安排问题的算法与复杂性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.07578 2026-01-27 cs.RO cs.MA 50%

Practical Distributed Control for VTOL UAVs to Pass a Virtual Tube

实用分布式控制用于VTOL无人机通过虚拟管

Quan Quan, Rao Fu, Mengxin Li, Donghui Wei, Yan Gao, Kai-Yuan Cai

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种实用的分布式控制方法,用于VTOL无人机通过虚拟管,解决碰撞避免和保持在虚拟管内的问题,并通过实验验证了方法的有效性。

Journal ref IEEE Transactions on Intelligent Vehicles, 2022, 7(2): 342-353

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17428 2026-01-27 cs.RO 50%

Scaling Rough Terrain Locomotion with Automatic Curriculum Reinforcement Learning

通过自动课程强化学习扩展粗糙地形运动

Ziming Li, Chenhao Li, Marco Hutter

机构 * Robotic Systems Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院机器人系统实验室) ETH AI Center, ETH Zurich, Switzerland(苏黎世联邦理工学院人工智能中心)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于学习进度的自动课程强化学习框架,使四足机器人在复杂地形上实现稳定高速运动,突破传统方法在地形适应上的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17245 2026-01-27 q-fin.TR physics.soc-ph 50%

Pregeometric Origins of Liquidity Geometry in Financial Order Books

金融订单簿流动性几何的预几何起源

João P. da Cruz

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种基于几何约束的金融订单簿流动性模型,通过谱嵌入和投影方法揭示流动性、供应和需求的涌现特性,并验证了积分伽马分布的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15586 2026-01-27 cs.GT econ.TH 50%

Settling the Score: Portioning with Cardinal Preferences

解决得分问题:基于基数偏好的分割

Edith Elkind, Matthias Greger, Patrick Lederer, Warut Suksompong, Nicholas Teh

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了基于基数偏好的分割问题,提出通过计算提案平均值的简单规则,在公平性方面表现优异,并从公理学角度进行了详细分析。

Comments A preliminary version appeared in the 26th European Conference on Artificial Intelligence (ECAI), 2023

Journal ref Artificial Intelligence, 352:104487 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2601.12658 2026-01-27 cs.CL cs.AI 62%

Augmenting Question Answering with A Hybrid RAG Approach

通过混合RAG方法增强问答

Tianyi Yang, Nashrah Haque, Vaishnave Jonnalagadda, Yuya Jeremy Ong, Zhehui Chen, Yanzhao Wu, Lei Yu, Divyesh Jadav, Wenqi Wei

机构 * Plastic Lab(塑料实验室) Google(谷歌) Florida International University(佛罗里达国际大学) Rensselaer Polytechnic Institute(伦塞拉尔理工学院)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出SSRAG方法,通过混合查询增强、代理路由和结构化检索技术,提升问答任务的响应质量。

Comments 10 pages, 5 tables, 2 figures; presented at IEEE CogMI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21717 2026-01-27 cs.NI cs.AI cs.LG cs.SI 62%

Multiconnectivity for SAGIN: Current Trends, Challenges, AI-driven Solutions, and Opportunities

SAGIN的多连接性:当前趋势、挑战、AI驱动的解决方案与机遇

Abd Ullah Khan, Adnan Shahid, Haejoon Jung, Hyundong Shin

机构 * Department of Electronics and Information Convergence Engineering, Kyung Hee University(电子与信息融合工程系,庆尚大学) ID Lab and imec, Ghent University(ID实验室和imec,根特大学)

专题命中 其他Agent :agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了SAGIN赋能多连接性的现状、挑战及AI驱动的解决方案,通过代理强化学习优化资源分配,提升网络性能与容量。

详情

展开后加载摘要…

URL PDF HTML 收藏