GoalLadder: Incremental Goal Discovery with Vision-Language Models
GoalLadder: 基于视觉语言模型的增量目标发现
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。
Comments NeurIPS 2025
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
GoalLadder: 基于视觉语言模型的增量目标发现
机构 * University of Oxford(牛津大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 GoalLadder利用视觉语言模型在视觉环境中通过增量目标发现提升RL智能体性能,实现高成功率。
Comments NeurIPS 2025
MMSI-Video-Bench: 一个面向视频基于空间智能的综合基准
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Xi’an Jiaotong University(西安交通大学) ; University of Hong Kong(香港大学) ; Fudan University(复旦大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 MMSI-Video-Bench是一个综合评估视频基于空间智能的基准,通过多任务和多数据集评估25个MLLMs,揭示了人机推理差距和模型泛化不足的问题。
EcomBench: 向电子商务基础智能体的全面评估迈进
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 EcomBench通过真实电子商务场景评估智能体的核心能力,提供动态测试环境以衡量其在实际决策中的表现。
TheMCPCompany:创建通用代理的专用工具
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 TheMCPCompany通过评估工具调用代理在现实世界服务交互中的表现,揭示了当前模型在复杂任务中的挑战。
Comments Code: https://github.com/Reza-esfandiarpoor/the-mcp-company
增强人机协作的联合活动设计启发式方法
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出十四条启发式方法,用于设计支持联合人机协作的技术,强调五个关键宏观认知功能的支持与易用性同等重要。
Comments 10 pages
在重症护理中评估离线多目标强化学习基准
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文评估了三种离线多目标强化学习算法在重症护理中的性能,发现PEDA DT在灵活性和多目标决策方面表现优异,为个性化医疗决策提供了新思路。
从人类碰撞数据生成可控的风险场景用于自动驾驶测试
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Beijing DiDi Infinity Technology and Development Co., Ltd.(北京滴滴无限科技发展有限公司) ; Space Information Research Institute and Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息研究所和浙江空间信息感知与传输重点实验室,杭州电子科技大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 CRAG通过生成可控的风险场景,提升自动驾驶车辆在罕见安全关键条件下的鲁棒性评估效率。
一种基于深度学习的自适应多层蜜罐架构用于威胁行为分析
机构 * Georgia Institute of Technology Atlanta, United States of America(佐治亚理工学院亚特兰大分校,美国)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于深度学习的自适应多层蜜罐架构,通过强化学习实现威胁行为分析,旨在提高威胁情报质量并降低运营成本。
利用大语言模型实现离散控制器综合的自动语法错误修复
专题命中 Agent评测 :workflow(abstract);分类 cs.SE
AI总结 本文提出利用大语言模型自动修复离散控制器综合模型中的语法错误,通过设计提示策略提高修复准确性和效率,实验显示其比人类开发者快3.46倍。
BEDI:一种用于无人机上具身智能体评估的综合基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。
测绘MLLM景观:当前调研的元综述
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Indiana University(印第安纳大学) ; Purdue University(普渡大学) ; Emory University(埃默里大学) ; Sichuan University(四川大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; AppCubic ; Kyoto University(京都大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Rutgers University(罗格斯大学) ; National Taiwan Normal University(台湾师范大学)
专题命中 Agent评测 :autonomous agent(abstract);分类 cs.CL
AI总结 本文通过系统回顾现有调研,全面分析MLLMs的评估方法、挑战与趋势,为研究者提供当前评估现状的深入理解。
Comments The article consists of 22 pages, including 2 figures and 108 references. The paper provides a meta-review of surveys on Multimodal Large Language Models (MLLMs), categorizing findings into key areas such as evaluation, applications, security, and future directions
MAVERIX:多模态音频视觉评估与识别指数
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 MAVERIX是一个用于评估多模态模型音频视觉整合能力的统一基准,通过精心设计的问题展示模型在跨模态理解上的性能,揭示了与人类水平的显著差距。
Journal ref AAAI 2026
可执行治理 for AI:利用 LLMs 将政策翻译成规则
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 利用 LLMs 将 AI 政策转化为可执行规则,通过 P2T 框架实现标准化表示,提升政策执行的自动化与安全性。
Comments Accepted to AAAI-26 AI Governance Workshop (in-person presentation); 10 pages, 5 figures
CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集
机构 * KDDI Research, Inc.(KDDI研究公司) ; University of Southern California(南加州大学)
专题命中 Agent评测 :planning(abstract);分类 cs.CL
AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。
Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages
你是机器人吗?通过行为分析检测自动驾驶汽车
机构 * NEC Laboratories Europe GmbH(NEC欧洲实验室) ; Flyhound Co.(Flyhound公司) ; i2CAT Foundation(i2CAT基金会) ; Amazon Global Robotics - EU Innovation Lab(亚马逊全球机器人-欧盟创新实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种通过摄像头图像和状态信息自动识别自动驾驶车辆的框架,利用CARLA模拟器创建数据集并测试其识别准确率,达到80%-93%的识别效果。
软件的进化生态:约束、创新与人工智能颠覆
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本文研究软件进化生态,探讨人工智能驱动开发工具对软件创新和文化演变的影响。
Comments This article is a contributed chapter to the SFI edited volume: The Economy as a Complex Evolving System, Part IV (2025)
最小最大假设检验用于布雷德利-蒂尔-刘模型
机构 * Department of Computer Science and the Elmore Family School of Electrical and Computer Engineering, Purdue University(计算机科学系和埃尔莫尔家族电气与计算机工程学院,普渡大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种基于最小最大理论的假设检验方法,用于判断给定的成对比较数据是否源自布雷德利-蒂尔-刘模型,并通过实验验证了该方法的性能。
Comments 41 pages, 5 figures
Journal ref IEEE Transactions on Information Theory, vol. 71, no. 12, December 2025
QJoin: 基于强化学习的变换感知可连接数据发现
机构 * Cornell University(康奈尔大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 QJoin通过强化学习框架学习并重用变换策略,提升连接发现的准确性和效率。
TradeTrap: LLM-based Trading Agents 是否 truly 可靠和忠实?
机构 * Shanghai AI Laboratory(上海人工智能实验室)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 TradeTrap 提出了一种统一的评估框架,用于系统性压力测试基于 LLM 的交易代理,揭示其在系统级扰动下的鲁棒性问题。
学习大规模多任务世界模型用于连续控制
机构 * University of California San Diego(加州大学圣地亚哥分校)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 Newt通过大规模预训练和在线交互,实现智能体在数百个任务上的多任务学习,提升连续控制的效率和适应性。
Comments Webpage: https://www.nicklashansen.com/NewtWM
OPOR-Bench:评估大型语言模型在在线公共舆论报告生成中的表现
机构 * Communication University of China(中国传媒大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司) ; School of Engineering, Santa Clara University(圣克拉拉大学工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 OPOR-Bench通过定义自动在线公共舆论报告生成任务,构建了包含463个危机事件的数据集,并提出OPOR-EVAL框架评估生成报告质量,为该领域研究提供基础。
Comments 27 pages, accepted by CMC-Computers, Materials & Continua, 2025
力学建模自动化:LLM作为物理约束神经网络的设计者,用于材料本构建模
机构 * Institute of Material Systems Modeling, Helmholtz-Zentrum Hereon(材料系统建模研究所,海德堡中心) ; Institute for Continuum and Material Mechanics, Hamburg University of Technology(连续力学与材料力学研究所,汉堡技术大学) ; Helmholtz-Zentrum Hereon(海德堡中心) ; Hamburg University of Technology(汉堡技术大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.LG
AI总结 本文提出利用LLM自动设计物理约束神经网络,用于材料本构建模,实现建模自动化和高效准确的本构模型生成。
Comments Currently under review
利用LLMs进行设计构思:一种辅助创造力的AI工具
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出了一种名为ALIA的AI工具,利用LLMs通过语音交互提升设计构思阶段的创造性潜力。
Comments 9 pages, 4 figures
Journal ref Responsible and Resilient Design for Society, Volume 4. ICoRD 2025, pp 579 to 589
LLM-Cave: 一个用于大型语言模型推理和决策系统的基准和轻量环境
机构 * College of Artificial Intelligence Nankai University(人工智能学院 南开大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 LLM-Cave提出了一种轻量环境和基准,用于评估大型语言模型的推理和决策能力,展示了不同模型在复杂任务中的表现及改进方法。
Comments 8 pages, 5 figures, ICICN 2025
AppSelectBench: 应用级工具选择基准
机构 * Microsoft(微软)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 AppSelectBench通过评估CUAs的应用选择能力,揭示了模型在跨应用推理中的系统性优劣,为智能代理的研究提供了新基准。
ONCOPILOT:一种可提示的CT基础模型用于实体肿瘤评估
机构 * Raidium, Paris Biotech Santé(Raidium,巴黎生物医疗健康) ; AP-HP. Nord, Department of Radiology, FHU MOSAIC, Beaujon Hospital(AP-HP. Nord,放射科,FHU MOSAIC,贝琼医院) ; Université Paris Cité(巴黎城市大学) ; Université Paris Cité, AP-HP, Hôpital Européen Georges Pompidou, Department of Vascular and Oncological Interventional Radiology(巴黎城市大学,AP-HP,欧文·庞皮杜医院,血管和肿瘤介入放射科) ; Department of Radiology, Hôpital Cochin, AP-HP(放射科,克里克医院,AP-HP) ; Centre d’Imagerie du Nord(北影像中心)
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 ONCOPILOT是一种基于CT的可提示基础模型,通过交互式分割提升肿瘤评估精度,实现放射科医生级别的RECIST测量和体积生物标志物分析。
Journal ref npj Precis. Onc. 9, 121 (2025)
用负责任的AI考虑来防御大型语言模型对抗劫持攻击
机构 * National University of Singapore(新加坡国立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出三种防御策略,通过提示级、logit引导和领域特定代理方法,有效降低大型语言模型的劫持攻击成功率。
Comments 20 pages including appendix; technical report; NeurIPS 2024 style
强化学习用于自修复材料系统
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究通过强化学习方法实现材料自修复,展示了TD3智能体在动态环境下更高效的自修复能力。
Comments Accepted to INCOM 2026. This is the camera-ready version
基于大语言模型的自动化依赖升级代理
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本文提出基于LLM代理的自动化依赖升级方法,通过合成数据验证,实现了高效准确的代码更新与兼容性保障。
Comments Accepted to AISM Workshop at ASE 2005
关于结构因果投递的强化学习
机构 * Graduate School of Data Science(数据科学研究生院) ; Seoul National University(首尔国立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出了一种结构因果投递框架,通过融合源环境的先验信息来增强部署学习,实现了亚线性遗憾界并可能优于传统方法。