Two-stage Rule-induction Visual Reasoning on RPMs with an Application to Video Prediction
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments Under review
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments Under review
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.AI
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.LG
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments CVPR2019
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments 17 pages, 5 figures
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments CVPR 2018
专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV
Comments workshop paper at ICLR 2018
何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循
机构 * University of Tübingen(蒂宾根大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Brown University(布朗大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。
Comments Accepted at COLM 2026
基于证据链的多模态推理用于少样本时序动作定位
机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于证据链的多模态推理方法,通过结合文本和视觉信息提升少样本时序动作定位的性能。
Comments Accepted by TIP2026
NARU:用于理解日语超长视频中叙事演变与文化细微差别的基准
机构 * The University of Tokyo(东京大学) ; Kyushu University(九州大学) ; Macau University of Science and Technology(澳门科技大学) ; Infinimind Japan Inc.(Infinimind日本公司) ; University of Alberta(阿尔伯塔大学)
专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究推出NARU基准,涵盖155个146.8小时日语视频的1481个问题,评估模型在长程叙事整合与文化推理上的局限,为MLLM开发提供测试平台。
Comments Yuheng Huang and Jianlang Chen contributed equally to this work. More details available on the project's website https://ma-labo.github.io/naru/ and https://infinimind.io/en/company/news/2026/narubench-release
超越试错:面向图像到视频一致性的智能体优化
机构 * Google Cloud(谷歌云) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对图像到视频模型试错效率低的问题,提出Agentic Self-Improvement框架,通过两阶段优化提升视频与文本一致性,生成视频胜率达69%,为视频生成模型提供实用可控的优化方法。
Sci-VBench:面向科学领域知识与推理密集型视频生成的评估
机构 * Zhejiang University(浙江大学) ; UCAS(中国科学院大学) ; Tongji University(同济大学) ; Yale University(耶鲁大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI
AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。
Comments COLM 2026
PrismVAU: 用于多模态视频异常理解的提示优化推理系统
机构 * Universitat de Barcelona(巴塞罗那大学) ; Computer Vision Center(计算机视觉中心) ; Aalborg University(奥胡斯大学) ; Milestone Systems(Milestone系统)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。
Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)
我在视频中寻找你:面向以人为中心的视频推理的身份条件查询
机构 * Beijing Jiaotong University(北京交通大学) ; HUJING Digital Media & Entertainment Group(汇晶数字媒体与娱乐集团) ; MAIS Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS)
专题命中 视觉推理 :grounding(abstract,abstract_cn);MLLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出了身份条件查询(ICQ)任务,构建了ISYV基准、训练集与框架,实验显示主流多模态大语言模型在该任务上表现不佳,ISYV模型性能优于强基线且接近闭源模型。
Comments Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables
PhysMind:从视频到可执行世界的无训练物理推理框架
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 PhysMind是无训练的智能体框架,为每个视频构建可执行世界,在CLEVRER、Physion++数据集及反事实问题上的物理推理准确率显著优于现有视觉语言模型。
Comments 27 pages, 18 figures. Project page: https://physmind.github.io/
CURV:通过课程可视化接地推理增强图表理解
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。
DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧
机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) ; School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) ; Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; School of Automation, Southeast University(东南大学自动化学院) ; Department of Geography, National University of Singapore(新加坡国立大学地理系)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。
利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架
机构 * National University of Singapore(新加坡国立大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) ; Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Jilin University(吉林大学)
专题命中 视觉推理 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。
Comments Accepted by ECCV 2026
约束锚定推理轨迹
机构 * University of Oxford(牛津大学)
专题命中 视觉推理 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。
Comments 15 pages, ACM MM 2026
通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型
机构 * Tsinghua University(清华大学) ; ByteDance(字节跳动)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。
IQA-T1:基于工具的图像质量评估视觉证据推理
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。
Comments Accepted by ECCV 2026
MatPhaseBench:用于材料相图理解的语义引导基准测试
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Manchester(曼彻斯特大学) ; Institute of Metal Research, Chinese Academy of Sciences(中国科学院金属研究所) ; China University of Geosciences(中国地质大学)
专题命中 视觉推理 :VLM(summary_cn,abstract_cn);分类 cs.CV、cs.AI
AI总结 介绍用于材料相图理解的MatPhaseBench基准测试,从文献选图与文字构建,有复杂科学图像理解、图文全面对齐、高质量人工监督文本采集三个关键特性,实验显示当前VLM距专家理解有差距。
VisReason: 面向视觉思维链推理的大规模数据集
机构 * Stony Brook University(石溪大学) ; Boston University(波士顿大学) ; MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)
专题命中 视觉推理 :visual reasoning(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG
AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。
Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; AI2(艾伦人工智能研究所) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。
Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg
Geo-Strat-RL:从可验证任务中学习地质事件推理
专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出Geo-Strat-RL合成环境,通过可验证奖励的强化学习(RLVR)训练视觉语言模型进行地质事件重建,并证明从地层图学到的推理可迁移至合成地震数据。
Comments 21 pages, 8 figures
MemDreamer: 通过分层图记忆和智能体检索机制解耦感知与推理以实现长视频理解
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Central South University(中南大学) ; HKUST(GZ)(香港科技大学(广州))
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出MemDreamer框架,通过分层图记忆和智能体检索机制解耦感知与推理,将长视频理解转化为智能体探索过程,在四个基准上达到SOTA,推理上下文窗口仅占全量2%且准确率提升12.5点。
VideoLatent: 通过潜在自强制进行视频-语言学习
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI(微图AI)
专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。
HPP:通过解耦感知与推理的分层程序化探测用于长视频理解
机构 * Queen’s University Belfast(贝尔法斯特女王大学) ; AMD(AMD公司) ; Queen Mary University of London(伦敦玛丽女王大学)
专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。
Comments Project page: https://awaisrauf.com/HPP