arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-01-14 至 2026-01-14 共收录 22 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 22 篇

2601.06093 2026-01-14 cs.CY cs.AI 88%

GenAITEd Ghana: A First-of-Its-Kind Context-Aware and Curriculum-Aligned Conversational AI Agent for Teacher Education

GenAITEd Ghana:首个基于情境感知和课程对齐的对话式人工智能代理用于教师教育

Matthew Nyaaba, Patrick Kyeremeh, Macharious Nabang, Bismark Nyaaba Akanzire, Sakina Acquah, Cyril Ababio Titty, Kotor Asare, Jerry Etornam Kudaya

专题命中 Agent评测 :agent(title,abstract);AI agent(title);multi-agent(abstract);分类 cs.AI

AI总结 GenAITEd Ghana是一款基于情境感知和课程对齐的对话式AI代理,旨在支持加纳教师教育,通过多代理系统和伦理约束确保负责任的AI应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08333 2026-01-14 cs.AI 86%

Semantic Laundering in AI Agent Architectures: Why Tool Boundaries Do Not Confer Epistemic Warrant

人工智能代理架构中的语义清洗:为什么工具边界不赋予认知证成

Oleg Romanchuk, Roman Bondar

专题命中 Agent评测 :agent(title,abstract);AI agent(title);分类 cs.AI

AI总结 本文指出基于LLM的代理架构中存在语义清洗问题,即缺乏证成的命题通过架构信任接口被接受,导致认知证成无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07880 2026-01-14 cs.CR cs.AI 86%

Sola-Visibility-ISPM: Benchmarking Agentic AI for Identity Security Posture Management Visibility

Sola-Visibility-ISPM:用于身份安全态势管理可见性的代理AI基准测试

Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Reuven Elezra, Idan Pinto, Tal Moalem, Shmuel Cohen, Yoni Weintrob

机构 * Sola Security(Sola安全)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Sola-Visibility-ISPM基准测试通过代理AI系统评估身份安全态势管理的可见性任务,展示了其在AWS、Okta和Google Workspace等环境中的高准确率和实用性。

Comments 20 pages, 3 figures. Benchmark and evaluation framework for agentic AI in identity security posture management, including expert evaluation and LLM-as-judge analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 86%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 Agent评测 :agent(title,abstract);planning(title)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 83%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08105 2026-01-14 cs.CL 77%

Query Suggestion for Retrieval-Augmented Generation via Dynamic In-Context Learning

通过动态上下文学习实现检索增强生成的查询建议

Fabian Spaeh, Tianyi Chen, Chen-Hao Chiang, Bin Shen

专题命中 Agent评测 :agent(abstract);workflow(abstract);agentic(abstract);分类 cs.CL

AI总结 本文提出通过动态上下文学习实现检索增强生成的查询建议,以提升用户交互的安全性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 77%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08003 2026-01-14 cs.CL cs.AI cs.MA 73%

LLM Review: Enhancing Creative Writing via Blind Peer Review Feedback

LLM Review: 通过盲审同行反馈增强创造性写作

Weiyue Li, Mingxiao Song, Zhenda Shen, Dachuan Zhao, Yunfan Long, Yi Li, Yongce Li, Ruyi Yang, Mengyu Wang

机构 * Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 LLM Review通过盲审同行反馈机制提升创造性写作,实验显示其优于多智能体基线,并使小模型超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02369 2026-01-14 cs.CL cs.AI 73%

AutoContext: Instance-Level Context Learning for LLM Agents

AutoContext:LLM代理的实例级上下文学习

Kuntai Cai, Juncheng Liu, Xianglin Yang, Zhaojie Niu, Xiaokui Xiao, Xing Chen

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 AutoContext通过解耦探索与任务解决,为LLM代理构建结构化的实例上下文,显著提升了任务执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09583 2026-01-14 cs.LG stat.ML 70%

YRC-Bench: A Benchmark for Learning to Coordinate with Experts

YRC-Bench:一种学习与专家协调的基准

Mohamad H. Danesh, Nguyen X. Khanh, Tu Trinh, Benjamin Plaut

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.LG

AI总结 YRC-Bench通过提供开放源代码基准,支持在无监督环境下学习与专家协调的方法研究。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08682 2026-01-14 cs.CL cs.AI 62%

Lessons from the Field: An Adaptable Lifecycle Approach to Applied Dialogue Summarization

领域经验:一种适用于应用对话摘要的可适应生命周期方法

Kushal Chawla, Chenyang Zhu, Pengshan Cai, Sangwoo Cho, Scott Novotney, Ayushman Singh, Jonah Lewis, Keasha Safewright, Alfy Samuel, Erin Babinsky, Shi-Xiong Zhang, Sambit Sahu

机构 * Capital One

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种适用于应用对话摘要的可适应生命周期方法,通过行业案例研究探讨了在动态需求下构建可靠摘要系统的挑战与解决方案。

Comments EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08477 2026-01-14 cs.CL cs.HC cs.SE 62%

Do You Understand How I Feel?: Towards Verified Empathy in Therapy Chatbots

你了解我感受吗?:朝向疗法聊天机器人中的验证共情

Francesco Dettori, Matteo Forasassi, Lorenzo Veronese, Livia Lestingi, Vincenzo Scotti, Matteo Giovanni Rossi

机构 * Université Paris-Saclay, Centre National de la Recherche Scientifique(巴黎萨克雷大学,法国国家科学研究中心) TU Wien(维也纳技术大学) Politecnico di Milano(米兰理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 本文提出通过自然语言处理与形式验证结合的方法,开发具有共情能力的疗法聊天机器人,通过统计模型检查验证共情属性并指导行为策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03333 2026-01-14 cs.LG cs.AI 62%

A Differential Perspective on Distributional Reinforcement Learning

分布强化学习的微分视角

Juan Sebastian Rojas, Chi-Guhn Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文从微分视角扩展分布强化学习至平均奖励设置,提出首个能有效学习长期每步奖励分布和微分回报分布的算法,并展示其在性能和信息捕捉方面的优势。

Comments In AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08748 2026-01-14 cs.CV cs.AI 57%

UR-Bench: A Benchmark for Multi-Hop Reasoning over Ultra-High-Resolution Images

UR-Bench:面向超高清图像的多跳推理基准

Siqi Li, Xinyu Cai, Jianbiao Mei, Nianchen Deng, Pinlong Cai, Licheng Wen, Yufan Shen, Xuemeng Yang, Botian Shi, Yong Liu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 UR-Bench是一个针对超高清图像多跳推理的基准,通过引入代理框架和语义工具,评估大语言模型在极端视觉信息下的推理能力。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08690 2026-01-14 cs.AI 57%

All Required, In Order: Phase-Level Evaluation for AI-Human Dialogue in Healthcare and Beyond

全部必要,按顺序:面向AI-人类对话在医疗保健及其他领域的相级评估

Shubham Kulkarni, Alexander Lyzhov, Shiva Chaitanya, Preetam Joshi

专题命中 Agent评测 :workflow(abstract);分类 cs.AI

AI总结 OIP-SCE是一种用于评估AI-人类对话在医疗及其他领域中合规性的方法,通过相级证据确保临床义务按顺序满足,提升AI与临床流程的对齐度。

Comments Accepted at the AI for Medicine and Healthcare (AIMedHealth) Bridge Program, AAAI-26, Singapore. Full-length paper; to appear in Proceedings of Machine Learning Research (PMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08406 2026-01-14 cs.AI cs.CR 57%

WebTrap Park: An Automated Platform for Systematic Security Evaluation of Web Agents

WebTrap Park: 一个用于系统评估Web代理安全性的自动化平台

Xinyi Wu, Jiagui Chen, Geng Hong, Jiayi Dong, Xudong Pan, Jiarun Dai, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 WebTrap Park通过自动化平台系统评估Web代理的安全性,揭示不同框架间的安全差异,强调架构重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08254 2026-01-14 cs.AI cs.SY eess.SY 57%

Large Artificial Intelligence Model Guided Deep Reinforcement Learning for Resource Allocation in Non Terrestrial Networks

大人工智能模型引导的深度强化学习用于非地面网络资源分配

Abdikarim Mohamed Ibrahim, Rosdiadee Nordin

机构 * Faculty of Engineering, Sunway University, Petaling Jaya, Malaysia(工程学院,Sunway大学,Petaling Jaya,马来西亚) Future Cities Research Institute, Sunway University, Petaling Jaya, Malaysia(未来城市研究 institute,Sunway大学,Petaling Jaya,马来西亚)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型引导深度强化学习,以提升非地面网络资源分配的性能,在极端天气下表现优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05157 2026-01-14 math.OC 50%

An emergence-oriented approach to circular formation

面向涌现的圆形编队方法

Zhaozhan Yao, Yuhua Yao, Xiaoming Hu

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出了一种面向涌现的圆形编队方法,通过局部测量自发形成圆形编队,利用不变集理论分析稳定性,适用于小规模 agent 组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07959 2026-01-14 cs.GT 50%

Robust Stable Matchings: Dealing with Changes in Preferences

鲁棒稳定匹配:应对偏好变化

Rohith Reddy Gangam, Tung Mai, Nitya Raju, Vijay V. Vazirani

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在偏好变化下鲁棒的稳定匹配,分析了不同扰动模型下的结构和计算特性,提出了高效算法并界定了可计算与不可计算的边界。

Comments 54 pages, 11 figures. arXiv admin note: substantial text overlap with arXiv:2304.02590, arXiv:1804.05537

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03486 2026-01-14 eess.SY cs.SY 50%

Adaptive Model-Based Reinforcement Learning for Orbit Feedback Control in NSLS-II Storage Ring

自适应模型驱动强化学习用于NSLS-II存储环轨道反馈控制

Zeyu Dong, Yuke Tian, Yu Sun

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出基于模型驱动强化学习的自适应框架,用于NSLS-II存储环轨道反馈控制,通过轨迹优化和在线模型优化实现束流稳定与对准误差最小化。

Comments Accepted by the 20th International Conference on Accelerator and Large Experimental Physics Control Systems (ICALEPCS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04249 2026-01-14 physics.soc-ph 50%

Stability of political structures modeled by simplicial complexes under mediation, splitting, and shellability

基于单纯复形的政体结构稳定性分析:在调解、分裂和壳性下的稳定性

Duško Jojić, Franjo Šarčević

专题命中 Agent评测 :agent(abstract)

AI总结 本文通过单纯复形分析政体结构稳定性,探讨调解、分裂和壳性对稳定性的影响,并以h向量和图独立复形为例展示稳定性分析方法。

Comments 23 pages, 5 figures, several new insights and improved results

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15012 2026-01-14 cs.RO 50%

Learning Contextually-Adaptive Rewards via Calibrated Features

通过校准特征学习上下文自适应奖励

Alexandra Forsey-Smerek, Julie Shah, Andreea Bobu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出通过校准特征显式建模上下文相关的特征显著性,以提高奖励学习的样本效率和适应性。

Comments Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), March 16 - 19, 2026, Edinburgh, Scotland, UK

详情

展开后加载摘要…

URL PDF HTML 收藏