arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-02-06 至 2026-02-06 共收录 8 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 8 篇

2602.05662 2026-02-06 cs.HC 82%

Making AI Agents Evaluate Misleading Charts without Nudging

让AI代理在不引导的情况下评估误导性图表

Swaroop Panda

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)

AI总结 本文研究了AI代理在未被引导的情况下评估误导性图表的能力,发现其在图形完整性受损时仍能保持较高的审美和可读性评分,表明需明确引导才能有效识别完整性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05105 2026-02-06 cs.AI cs.RO cs.SE 79%

GAMMS: Graph based Adversarial Multiagent Modeling Simulator

基于图的对抗多智能体建模模拟器

Rohan Patil, Jai Malegaonkar, Xiao Jiang, Andre Dion, Gaurav S. Sukhatme, Henrik I. Christensen

机构 * University of Southern California(美国南加州大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE

AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05671 2026-02-06 cs.HC 78%

(Computer) Vision in Action: Comparing Remote Sighted Assistance and a Multimodal Voice Agent in Inspection Sequences

行动中的视觉:比较远程视觉援助与多模态语音代理在检查序列中的表现

Damien Rudaz, Barbara Nino Carreras, Sara Merlino, Brian L. Due, Barry Brown

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究比较了远程视觉援助与多模态语音代理在检查任务中的表现,发现代理无法产生基于环境的视觉动作,从而缺乏关键资源。

Comments Conditionally accepted at CHI 2026, 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05392 2026-02-06 cs.CL cs.AI 62%

Beyond Length: Context-Aware Expansion and Independence as Developmentally Sensitive Evaluation in Child Utterances

超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估

Jiyun Chun, Eric Fosler-Lussier, Michael White, Andrew Perrault

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05087 2026-02-06 cs.LG cs.AI cs.HC cs.IR cs.SI 62%

Autodiscover: A reinforcement learning recommendation system for the cold-start imbalance challenge in active learning, powered by graph-aware thompson sampling

Autodiscover: 一种基于图感知汤普森采样强化学习的推荐系统,用于主动学习中的冷启动不平衡挑战

Parsa Vares

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 AutoDiscover通过图感知的强化学习方法,解决主动学习中的冷启动问题,提升文献综述的筛选效率。

Comments Master's Thesis, University of Luxembourg in collaboration with Luxembourg Institute of Science and Technology (LIST). Supervised by Prof. Jun Pang and Dr. Eloi Durant

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05920 2026-02-06 cs.AI cs.ET 57%

Quantum Reinforcement Learning with Transformers for the Capacitated Vehicle Routing Problem

基于变压器的量子强化学习在有容量限制的车辆路径问题中的应用

Eva Andrés

机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) University of Granada(格拉纳达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出利用量子强化学习与变压器架构解决有容量限制的车辆路径问题,通过混合模型实现更高效、稳健的路由策略。

Comments 22 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05690 2026-02-06 cs.LG cs.IT math.IT 57%

Almost Asymptotically Optimal Active Clustering Through Pairwise Observations

通过成对观测实现近似最优的主动聚类

Rachel S. Y. Teo, P. N. Karthik, Ramya Korlakai Vinayak, Vincent Y. F. Tan

机构 * National University of Singapore(国立新加坡大学) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 通过成对观测实现近似最优的主动聚类,利用测度变化技术建立查询次数下界,并设计渐近最优算法。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05249 2026-02-06 cs.AI 57%

Automatic Cognitive Task Generation for In-Situ Evaluation of Embodied Agents

为在场评估具身智能体而自动产生认知任务

Xinyi He, Ying Yang, Chuanjian Fu, Sihan Guo, Songchun Zhu, Lifeng Fan, Zhenliang Zhang, Yujia Peng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏