Symmetry breaking for inductive logic programming
归纳逻辑编程中的对称性打破
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种在归纳逻辑编程中打破对称性的方法,通过答案集编程实现,显著提升了在视觉推理和游戏玩法等领域的求解效率。
Comments AAAI26
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
归纳逻辑编程中的对称性打破
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出了一种在归纳逻辑编程中打破对称性的方法,通过答案集编程实现,显著提升了在视觉推理和游戏玩法等领域的求解效率。
Comments AAAI26
Event-VStream: 基于事件驱动的长视频流实时理解
机构 * University of Houston(德克萨斯大学休斯顿分校) ; The University of Texas at Arlington(德克萨斯理工大学) ; Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Temple University(特拉华大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 Event-VStream通过事件感知框架实现长视频流的实时理解,利用事件序列进行语义连贯的处理,提升性能并保持低延迟。
CoF-T2I: 视频模型作为纯视觉推理器用于文本到图像生成
机构 * Peking University(北京大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) ; Sun Yat-sen University(中山大学) ; Zhejiang University(浙江大学) ; Nanjing University(南京大学)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 CoF-T2I通过引入链式帧推理提升文本到图像生成的质量,通过逐步视觉细化和显式推理步骤实现高质量图像生成。
Comments 16 pages, 8 figures
SciNets: 图约束多跳推理用于科学文献综合
机构 * Jaypee Institute of Information Technology(杰伊佩 Institute 信息科技学院)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG
AI总结 SciNets通过图约束多跳推理实现科学文献综合,通过多跳路径连接罕见共现的概念,提升机制解释的稳定性和多样性。
Comments 19 pages, 2 figures
SkinFlow: 通过动态视觉编码和分阶段强化学习实现开放性皮肤病诊断的高效信息传输
机构 * Baichuan Inc.(百川公司) ; Department of Dermatology Peking University First Hospital(北京大学第一医院皮肤科) ; Beijing Key Laboratory of Molecular Diagnosis on Dermatoses(北京分子皮肤病诊断重点实验室) ; National Clinical Research Center for Skin and Sexually Transmitted Diseases(国家皮肤及性传播疾病临床医学研究中心) ; NMPA Key Laboratory for Quality Control and Evaluation of Cosmetics(国家药监局化妆品质量控制与评价重点实验室) ; School of Biomedical Engineering Tsinghua University(清华大学生物医学工程学院) ; University of Hong Kong(香港大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SkinFlow通过动态视觉编码和分阶段强化学习提升皮肤病诊断效率,实现比通用模型更优的准确率
LP-LLM:基于大多模态模型的端到端真实世界退化车牌文本识别
机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 LP-LLM通过端到端结构感知多模态推理框架,结合字符感知模块和LoRA微调策略,提升真实世界退化车牌文本识别性能。
生成数字孪生:用于可执行工业系统的视觉-语言模拟模型
机构 * Institute of Artificial Intelligence Innovation(人工智能创新研究所)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI
AI总结 本文提出视觉-语言模拟模型VLSM,通过统一视觉与文本理解,实现从布局草图和自然语言提示生成可执行的工业模拟代码,建立首个大规模生成数字孪生数据集并提出三个专用评估指标。
Comments 10 pages, 9 figures
基于地图的思考:用于地理定位的强化并行地图增强智能体
机构 * Xiamen University(厦门大学) ; AMAP, Alibaba Group(阿里集团AMAP) ; Southern University of Science and Technology(南方科技大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于地图的强化并行智能体,通过两阶段优化提升地理定位精度,实验显示在Acc@500m指标上显著优于现有模型。
CoV:基于视角链的立体推理
机构 * ZIP Lab, Zhejiang University(浙江大学ZIP实验室) ; Monash University(墨尔本大学) ; AIML, Adelaide University(阿德莱德大学AIML)
专题命中 视觉推理 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 CoV通过链式视角提示方法提升3D具身问答中的空间推理能力,无需额外训练。
Comments Code link https://github.com/ziplab/CoV
AtomThink: 多模态慢思考与原子步骤推理
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; ETH Zurich(苏黎世联邦理工学院) ; Hong Kong University of Science and Technology(香港科技大学) ; University of Hong Kong(香港大学) ; Noah’s Ark Lab(诺亚实验室) ; Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 AtomThink通过引入原子步骤推理,提升多模态大语言模型的推理性能和效率。
Comments TPAMI accepted
在跨模态冲突下分析大型多模态模型的推理一致性
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Peng Cheng Laboratory(鹏城实验室) ; National University of Singapore(新加坡国立大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出逻辑图扰动协议,通过主动视觉上下文细化方法,解决大型多模态模型在跨模态冲突下的推理一致性问题,提升推理鲁棒性。
Comments 10 pages, 5 figures
大语言模型能否通过像素感知空间智能?基于文本描述的空间智能基准测试
机构 * School of Computer Science & Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 SiT-Bench通过文本描述评估大语言模型的空间智能,揭示其在全局一致性方面的不足,并表明显式空间推理可提升性能。
Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景
机构 * NVIDIA
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。
评估可回收性中的情境智能:图像推理系统的全面研究
机构 * Harvard College(哈佛学院) ; Stanford University(斯坦福大学) ; Department of Biomedical Informatics(生物医学信息学系) ; Harvard Medical School(哈佛医学院)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究利用先进视觉-语言模型评估物品可回收性,探讨其在不同场景下的表现,揭示模型在情境理解上的进展与不足。
Comments x
提升视觉:基于推理引导的地面到空中定位
机构 * School of Computer Science, UPES(UPES计算机科学学院) ; Department of CS&E, NIT Warangal(NIT Warangal计算机科学与工程系)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
AI总结 本文提出ViReLoc框架,通过视觉推理实现地面到空中定位,无需依赖GPS数据,提升空间推理和跨视角检索性能。
PathFound: 一种促进证据寻求病理诊断的代理多模态模型
机构 * Qing Yuan Research Institute, Shanghai Jiao Tong University(上海交通大学庆元研究院) ; Shanghai Innovation Institute(上海创新研究院) ; Department of Pathology, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China(中国科学技术大学生命科学与医学学院病理科) ; Intelligent Pathology Institute, Division of Life Sciences and Medicine(生命科学与医学学院智能病理研究所) ; Department of Pathology, Fudan University Shanghai Cancer Center(复旦大学上海癌症中心病理科) ; Department of Oncology, Shanghai Medical College, Fudan University(复旦大学上海医学院肿瘤科) ; Institute of Pathology, Fudan University(复旦大学病理研究所) ; Department of Pathology, The First Affiliated Hospital with Nanjing Medical University(南京医科大学第一附属医院病理科)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 PathFound是一种通过主动信息获取和诊断完善来提升病理诊断准确性的代理多模态模型,其在多种临床场景中表现出卓越的诊断性能。
视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享
机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。
Comments 21 pages, 7 figures; Accepted by IEEE TIP
跨多模态领域自奖励的推理框架
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 SR-MCR通过自奖励机制提升多模态推理的连贯性和准确性,在视觉基准测试中取得领先性能。
VideoZoomer: 用于长视频推理的强化学习时序聚焦
机构 * Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。
归纳式视觉编程:从经验中演化工具库以进行空间推理
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 通过从经验中归纳学习工具库,TVP在空间推理任务中实现了更高效的工具发现和重用,优于现有方法。
Comments Project Website: https://transductive-visualprogram.github.io/
MapTrace: 用于地图路线追踪的可扩展数据生成
机构 * Google XR(谷歌XR) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 MapTrace通过合成数据生成提升地图路线追踪性能,微调模型使成功率提升6.4个百分点,减少路径追踪误差。
InSight-o3: 通过通用视觉搜索增强多模态基础模型
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Huawei(华为)
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.LG
AI总结 InSight-o3通过通用视觉搜索任务提升多模态基础模型的推理能力,解决复杂视觉信息整合问题。
Robust-R1: 为鲁棒视觉理解的退化感知推理
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 Robust-R1通过结构化推理链显式建模视觉退化,提升多模态大语言模型在现实世界退化下的鲁棒性与抗干扰能力。
Comments Accepted by AAAI2026 Oral
peek-a-boo推理:多模态大语言模型中的对比区域遮挡
机构 * Algoverse AI Research(Algoverse AI研究机构) ; Princeton University(普林斯顿大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 对比区域遮挡通过遮挡视觉区域并对比推理轨迹,揭示多模态大语言模型在推理过程中的依赖模式和失败模式。
STAR:用于统一多模态学习的堆叠自回归方案
机构 * Meituan Inc(美团公司)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 STAR通过堆叠自回归方案提升多模态生成性能,同时保持理解能力,实验验证其在统一多模态学习中的有效性。
Comments 18 pages, 7 figures
为何文本占上风:视觉可能损害多模态医疗决策制定
机构 * University of Texas Rio Grande Valley(德克萨斯大学里奥格兰德谷大学) ; University of Pittsburgh(匹兹堡大学) ; NC State University(北卡罗来纳州立大学) ; University of Washington(华盛顿大学) ; University of Maryland(马里兰大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本研究发现文本推理在医疗多模态决策中优于多模态输入,提出三种策略以提升多模态医疗决策能力。
Comments Accepted by ICDM 2025 the Workshop on Synergy of AI and Multimodal Biomedical Data Mining
利用ChatGPT、Claude和Gemini评估绿地吸引力:AI模型能反映人类感知吗?
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了AI模型在评估绿地吸引力方面的表现,发现其在正式绿地和非正式空间的判断一致性较高,但存在对安全性和本地嵌入质量的低估问题。
通过上下文神经错误本增强的检索反馈
机构 * School of CSE Chung-Ang University(计算机科学与工程学院 Chung-Ang 大学)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG
AI总结 REFINE通过结构化反馈框架,系统分析并缓解多模态推理中的错误,提升推理效率和可扩展性。
Comments Accepted at EMNLP 2025 main
超越文字和像素:生成模型中隐式世界知识推理的基准测试
机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) ; Fudan University(复旦大学) ; D^{4} Lab(D⁴实验室) ; HHMI Janelia Research Campus(HHMI贾能实验室)
专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。
无需训练的双双曲适配器用于更高效的跨模态推理
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; Department of Electrical and Electronic Engineering, Southern University of Science and Technology(南方科技大学电子与电气工程系) ; Department of Applied Mathematics and Theoretical Physics, University of Cambridge(剑桥大学应用数学与理论物理系) ; Yau Mathematical Sciences Center, Tsinghua University(清华大学应用数学中心)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出无需训练的双双曲适配器方法,通过双曲空间嵌入提升跨模态推理性能,实现更高效的领域泛化和少样本识别。
Comments Accepted in IEEE Transactions on Multimedia (TMM)