Context-Mediated Domain Adaptation in Multi-Agent Sensemaking Systems
多智能体感知系统中的上下文引导领域适应
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种上下文引导的领域适应方法,通过多智能体系统中的用户修改来隐式指定领域知识,从而改进大语言模型驱动的多代理推理行为。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
多智能体感知系统中的上下文引导领域适应
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种上下文引导的领域适应方法,通过多智能体系统中的用户修改来隐式指定领域知识,从而改进大语言模型驱动的多代理推理行为。
VISTAQA: 评估联合视觉问答与像素级证据
机构 * University of Waterloo(滑铁卢大学) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出VISTAQA基准,用于评估视觉问答中自由回答的正确性和像素级证据的定位,通过引入GROVE指标,强调回答正确性与视觉证据对齐的重要性,实验显示现有系统在该指标下表现有限,揭示了回答准确性和视觉证据对齐之间的显著差距。
顺从综合征:具身机器人代理中的退避基准测试
机构 * Purdue University(普渡大学) ; Bilkent University(比尔肯特大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种用于具身机器人代理的退避基准测试框架RoboAbstention,通过五种机器人数据集中的图像生成退避指令,评估了多个前沿VLMs在退避任务中的表现,并探讨了改进退避性能的方法。
EnterpriseRAG-Bench: 一个用于企业内部知识的RAG基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出EnterpriseRAG-Bench,一个包含50万文档和500个问题的基准测试,用于评估和比较基于检索增强生成(RAG)方法在企业内部知识处理中的性能。
Comments Code and dataset available at https://github.com/onyx-dot-app/EnterpriseRAG-Bench or https://huggingface.co/datasets/onyx-dot-app/EnterpriseRAG-Bench
CaMo:基于摄像机运动的视觉-语言模型评估与训练
机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。
Comments Code and model available at https://github.com/hsiangwei0903/CaMo
WoundFormer: 多尺度空间特征融合用于多类伤口组织分割
机构 * School of Computing, Mathematics and Engineering(计算、数学与工程学院) ; Charles Sturt University(查尔斯·斯特劳特大学) ; NSW, Australia(新南威尔士州,澳大利亚)
专题命中 推理评测 :planning(abstract)
AI总结 本研究提出WoundFormer框架,通过多尺度空间特征融合提升多类伤口组织分割的准确性,解决了现有方法在处理异质组织组成时的不足。
Comments 10 pages
用于开放即兴分割的视觉引导代理
机构 * University of Michigan(密歇根大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出了一种名为VASA的视觉引导即兴分割代理,该代理通过结合视觉语言模型、分割基础模型和视觉引导工作流,实现了无需训练的即兴分割任务,其在PARS和RefCOCO等基准测试中均表现出色。
Comments 23 pages, 11 figures
MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估
机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) ; Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。
HAVEN:用于统一视频理解的层次对齐多模态基准
机构 * Department of Information and Computer Sciences(信息与计算机科学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出HAVEN,一个用于统一视频理解的层次对齐多模态基准,旨在解决现有多模态大语言模型在复杂叙事总结和推理方面评估不足的问题,通过引入全粒度和全多模态的数据集架构,提供了一个严谨的标准测试平台。
GraphInstruct: 一个用于诊断LLM图生成能力差距的渐进性基准
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出GraphInstruct基准,通过六个复杂性层级和五个评估维度,结合800个人工指令和1582个算法生成的参考解决方案,评估LLM图生成能力,发现多约束组合而非推理深度具有更强区分能力,且无单一提示策略能跨层级或模型家族主导,域语义约束在所有测试方法中保持迭代不变,表明检索而非额外计算是下一步研究方向。
Comments 44 pages, 17 figures
Artifact-Bench: 评估MLLMs在检测和评估AI生成视频中的伪影
机构 * Kling Team(Kling团队) ; Shanghai AI Lab(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Artifact-Bench,一个用于评估多模态大语言模型在检测和分析AI生成视频伪影能力的基准,揭示了现有模型在伪影感知和推理上的显著局限性。
DisasterVQA: 一个用于灾难场景的视觉问答基准数据集
机构 * Qatar Computing Research Institute(卡塔尔计算研究所) ; Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) ; College of Science & Engineering(科学与工程学院) ; Qatar University(卡塔尔大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出DisasterVQA数据集,用于灾难场景中的感知与推理任务,通过1395张真实图像和4405对专家 curated 的问答对,评估了七种最先进的视觉-语言模型在灾难响应中的性能,发现模型在细粒度定量推理、物体计数和上下文敏感解释方面存在不足。
Comments Accepted at ICWSM 2026
利用扩散模型从街景图像中设计街道景观
机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) ; Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) ; Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) ; Department of Agronomy, University of Florida(农业系,佛罗里达大学)
专题命中 推理评测 :planning(abstract)
AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。
辅助人工智能的放射学分析用于检测牙槽骨丧失的严重程度和模式
机构 * Faculty of Engineering, University of Peradeniya(工程学院,珀德尼亚大学) ; Faculty of Dental Sciences, University of Peradeniya(牙科学院,珀德尼亚大学) ; Simula Metropolitan Center for Digital Engineering(模拟 Metropolitan 数字工程中心)
专题命中 推理评测 :planning(abstract)
AI总结 本研究提出了一种新型的基于人工智能的深度学习框架,利用牙内窥镜根尖放射图像自动检测和量化牙槽骨丧失及其模式,通过结合YOLOv8进行牙齿检测和Keypoint R-CNN模型识别解剖标志物,实现了对牙槽骨丧失严重程度的精确计算,并通过几何分析确定水平与角状骨丧失模式,实验结果在1000张专家标注的放射图像上达到了高准确率。
Comments This manuscript is 17 pages with 5 tables and 12 figures. The manuscript is under review at Nature Scientific Reports
基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述
机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) ; Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) ; Purple Mountain Laboratory, China(紫金山实验室) ; Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) ; Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) ; School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) ; Institute of Big Data, Fudan University, China(复旦大学大数据研究院) ; Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) ; School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。
Comments 20 pages, 8 figures
大型音频语言模型能否忽略多语言干扰?对其选择性听觉注意力能力的评估
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过引入MUSA多语言基准测试,评估了大型音频语言模型在多语言干扰下的选择性听觉注意力能力,发现单阶段性能强并不意味着在复杂环境下具有鲁棒性,分离技术虽减少声音重叠但无法解决源归属问题。
Comments 2 figures, 9 tables, and 12 pages total, with 4 pages of main text
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
机构 * X-Humanoid ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Manchester(曼彻斯特大学) ; Monash University(墨尔本大学) ; Celonis AI ; University of New South Wales(新南威尔士大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。
Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器
机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) ; School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) ; Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。
Comments 11 pages, 2 figures
评估由LLM解释所引发的虚假信任
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过用户研究评估不同解释类型对用户判断AI答案正确性及产生虚假信任的影响,发现推理轨迹和事后解释具有说服力但不具信息性,而对比双解释能提升用户区分正确与错误输出的能力。
从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力
机构 * University of South Florida Tampa USA ; University of Alabama Tuscaloosa USA ; University of Michigan Ann Arbor USA ; Texas Tech University Lubbock USA ; Texas A \& M University College Station USA ; University of Pittsburgh Pittsburgh USA ; University of South Florida ; University of Alabama ; University of Michigan ; Texas Tech University ; Texas A \& M University ; University of Pittsburgh
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。
BioXArena:在多模态生物医学机器学习任务上评估LLM代理的基准测试
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出BioXArena基准测试,旨在评估LLM代理能否为异构多模态生物医学数据集生成任务特定的模型训练流程,包含9个领域76个端到端任务,评估指标涵盖隐藏标签、隐藏评分者和生物意识度量,通过标准化环境评估11种代理配置。
Comments 69 pages, 13 figures, 34 tables
AI 对岗位的影响应从证据而非模型先验来衡量
专题命中 推理评测 :reasoning(abstract)
AI总结 本文主张通过基于证据的方法测量AI对岗位的影响,而非仅依赖LLM先验。提出一个检索增强框架,利用公开权重推理和检索到的新闻和论文摘要,为O*NET 30.2中的18796个职业-任务对分配AI影响标签,优于零样本基线。
多智能体方法用于油藏历史匹配
专题命中 推理评测 :planning(abstract)
AI总结 本文提出PetroGraph多智能体框架,通过分解工作流实现智能油藏历史匹配,降低复杂模拟工作流的操作门槛,提升历史匹配精度。
MemLens:大型视觉-语言模型多模态长期记忆的基准测试
机构 * CSE Deparment, HKUST(香港科技大学计算机科学与工程系) ; CUHK(香港大学) ; OmniMemory (Shenzhen) Intelligent Technology Co., Ltd.(深圳奥米克记忆科技有限公司) ; NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达AI技术中心(NVAITC),英伟达,美国圣克拉拉)
专题命中 推理评测 :reasoning(abstract)
AI总结 MemLens基准测试评估大型视觉-语言模型在多模态多会话对话中的长期记忆能力,通过789个问题测试五种记忆能力,揭示长上下文模型和记忆增强代理的优缺点,推动混合架构发展。
Comments Work in progress
ViDR:基于源视觉证据的多模态深度研究报告 grounding
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; National Key Laboratory of Data Space Technology and System(数据空间技术与系统国家重点实验室) ; School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) ; College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 ViDR通过源视觉证据构建多模态深度研究报告框架,提升报告质量与证据可验证性。
Topo-R1: 通过视觉-语言模型检测拓扑异常
机构 * Stony Brook University(石溪大学) ; Massachusetts General Hospital and Harvard Medical School(麻省总医院和哈佛医学院) ; Stanford University(斯坦福大学) ; Penn State University(宾夕法尼亚州立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文通过构建拓扑感知基准Topo-R1,评估视觉-语言模型在检测管状网络拓扑异常中的能力,发现现有模型缺乏拓扑感知,提出基于拓扑感知奖励的联合评分方法,显著提升模型在ID和OOD测试中的性能。
Comments 26 pages, 6 figures
H3D-MarNet:基于小波引导的双路径学习用于金属伪影抑制和CT模态转换用于放疗工作流程
机构 * Machine Learning and Perception Lab, Università degli Studi di Udine(机器学习与感知实验室,乌迪内大学) ; Centro di Riferimento Oncologico di Aviano IRCCS(阿维亚诺肿瘤参考中心)
专题命中 推理评测 :planning(abstract)
AI总结 H3D-MarNet通过小波引导的双路径学习有效抑制金属伪影并实现CT模态转换,提升放疗图像质量与诊断准确性。
Comments Accepted for publication at the 28th International Conference on Pattern Recognition, Lyon, France August, 17-22, 2026
UHR-Micro: 诊断和缓解地球观测VLMs中的分辨率错觉
机构 * National Key Laboratory of Science and Technology on Space-Born Intelligent Information Processing(国家空间智能信息处理科技重点实验室) ; Beijing Institute of Technology(北京理工大学) ; School of Computer Science(计算机学院) ; Wuhan University(武汉大学) ; Zhongguancun Academy(中关村学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(测绘遥感信息工程国家重点实验室) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 UHR-Micro通过11253条指令和1212张超高清图像,评估VLM在高分辨率地球观测图像中的空间极限表现,揭示高分辨率输入下空间定位和证据解析的失败,并提出MAP代理以证据为中心提升微尺度感知。
Chronicles-OCR: 中国文字演变轨迹的跨时代感知基准
机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) ; Tencent(腾讯) ; Anyang Normal University(安阳师范学院) ; The Palace Museum(故宫博物院) ; Nankai University(南开大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 Chronicles-OCR通过跨时代视觉感知任务评估VLLMs在汉字演变中的鲁棒性,包含2800张平衡图像和四个量化任务,推动历史文本感知研究。
QuiLL:一种基于LLM的漏洞评估框架
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出QuiLL,首个针对真实世界漏洞检测的综合评估框架,通过端到端流程结合先进LLM优化技术,提供动态上下文学习和新颖评分指标,用于系统评估不同LLM的漏洞检测能力。