Making AI Agents Evaluate Misleading Charts without Nudging
让AI代理在不引导的情况下评估误导性图表
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文研究了AI代理在未被引导的情况下评估误导性图表的能力,发现其在图形完整性受损时仍能保持较高的审美和可读性评分,表明需明确引导才能有效识别完整性问题。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
让AI代理在不引导的情况下评估误导性图表
专题命中 Agent评测 :AI agent(title,abstract);agent(abstract)
AI总结 本文研究了AI代理在未被引导的情况下评估误导性图表的能力,发现其在图形完整性受损时仍能保持较高的审美和可读性评分,表明需明确引导才能有效识别完整性问题。
基于图的对抗多智能体建模模拟器
机构 * University of Southern California(美国南加州大学)
专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.AI、cs.SE
AI总结 GAMMS是一款轻量级多智能体仿真框架,支持图结构环境下的快速开发与评估,提供可视化反馈和现实基础,适用于复杂领域如交通和通信系统。
行动中的视觉:比较远程视觉援助与多模态语音代理在检查序列中的表现
专题命中 Agent评测 :agent(title,abstract)
AI总结 研究比较了远程视觉援助与多模态语音代理在检查任务中的表现,发现代理无法产生基于环境的视觉动作,从而缺乏关键资源。
Comments Conditionally accepted at CHI 2026, 32 pages, 8 figures
超越长度:基于上下文的扩展与独立性作为儿童言语发展的敏感评估
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL
AI总结 本文提出了一种基于上下文的评估框架,通过扩展和独立性两个维度评估儿童言语的发展性,提升对儿童对话质量的敏感度。
Autodiscover: 一种基于图感知汤普森采样强化学习的推荐系统,用于主动学习中的冷启动不平衡挑战
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 AutoDiscover通过图感知的强化学习方法,解决主动学习中的冷启动问题,提升文献综述的筛选效率。
Comments Master's Thesis, University of Luxembourg in collaboration with Luxembourg Institute of Science and Technology (LIST). Supervised by Prof. Jun Pang and Dr. Eloi Durant
基于变压器的量子强化学习在有容量限制的车辆路径问题中的应用
机构 * Department of Computer Science and Artificial Intelligence(计算机科学与人工智能系) ; University of Granada(格拉纳达大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出利用量子强化学习与变压器架构解决有容量限制的车辆路径问题,通过混合模型实现更高效、稳健的路由策略。
Comments 22 pages, 12 figures
通过成对观测实现近似最优的主动聚类
机构 * National University of Singapore(国立新加坡大学) ; Indian Institute of Technology Hyderabad(印度海得拉巴理工学院) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 通过成对观测实现近似最优的主动聚类,利用测度变化技术建立查询次数下界,并设计渐近最优算法。
Comments 31 pages, 1 figure
为在场评估具身智能体而自动产生认知任务
机构 * Peking University(北京大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; BIGAI
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出TEA系统,通过动态在场任务生成方法评估具身智能体在未见环境中的能力,揭示模型在基本感知和3D交互方面的不足。