arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2603.19137 2026-03-20 cs.CV cs.RO 70%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17693 2026-03-19 cs.CV 70%

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17043 2026-03-19 cs.CV 70%

OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials

OpenQlaw: 一种用于二维量子材料分析的代理AI助手

Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) University of Utah, USA(美国犹他大学) Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16495 2026-03-18 cs.AI 70%

ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation

ExpressMind:一种用于高速公路运营的多模态预训练大语言模型

Zihe Wang, Yihuan Wang, Haiyang Yu. Zhiyong Cui, Xiaojian Liao, Chengcheng Wang, Yonglin Tian, Yongxin Tong

机构 * Beihang University(北航) Shandong Hi-speed Group Co., Ltd(山东高速集团有限公司) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出ExpressMind,一种针对高速公路运营的多模态预训练大语言模型,通过构建全栈数据集和双层预训练方法,提升事件检测、安全响应生成和复杂交通分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16256 2026-03-18 cs.CV 70%

When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition

当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘

Xiaokun Sun, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05551 2026-03-18 cs.IR cs.CV 70%

AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction

AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制

Jiashu Yang, Chi Zhang, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xu Jia, Xunliang Cai

机构 * Dalian University of Technology(大连理工大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-03-18 cs.CV 70%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17018 2026-03-18 cs.CV 70%

SophiaVL-R1: Reinforcing MLLMs Reasoning with Thinking Reward

SophiaVL-R1: 通过思考奖励强化大语言模型的推理能力

Kaixuan Fan, Kaituo Feng, Haoming Lyu, Dongzhan Zhou, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(MMLab,香港中文大学) Shanghai Artifcial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SophiaVL-R1通过引入思考奖励信号提升多模态大语言模型的推理能力,采用信任GRPO方法和退火训练策略,有效缓解奖励黑客问题,实验表明其在多个基准测试中表现优异。

Comments ICLR 2026, Project page:https://github.com/kxfan2002/SophiaVL-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15418 2026-03-17 cs.RO cs.AI 70%

MA-VLCM: A Vision Language Critic Model for Value Estimation of Policies in Multi-Agent Team Settings

MA-VLCM:一种用于多智能体团队设置中策略价值估计的视觉语言批评模型

Shahil Shaik, Aditya Parameshwaran, Anshul Nayak, Jonathon M. Smereka, Yue Wang

机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Clemson University(克莱姆斯大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出MA-VLCM,通过预训练的视觉语言模型替代传统集中批评者,提升多智能体强化学习的样本效率和泛化能力,适用于资源受限的机器人部署。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 70%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14669 2026-03-17 cs.AI 70%

RenderMem: Rendering as Spatial Memory Retrieval

RenderMem:将渲染作为空间记忆检索

JooHyun Park, HyeongYeop Kang

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 RenderMem通过将渲染作为3D世界与空间推理的接口,使智能体能直接进行视角相关的可见性与遮挡推理,提升空间记忆系统的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09924 2026-03-17 cs.CV 70%

Towards Reason-Informed Video Editing in Unified Models with Self-Reflective Learning

面向统一模型的基于推理的视频编辑:带有自我反思学习

Xinyu Liu, Hangjie Yuan, Yujie Wei, Jiazheng Xing, Yujin Han, Jiahao Pan, Yanbiao Ma, Chi-Min Chan, Kang Zhao, Shiwei Zhang, Wenhan Luo, Yike Guo

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出RVE任务,通过构建RVE-Bench基准,引入自反思学习框架ReViSE,提升视频编辑的准确性和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03667 2026-03-17 cs.CV 70%

Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning

Colon-X:推动智能结肠镜向临床推理迈进

Ge-Peng Ji, Jingyi Liu, Deng-Ping Fan, Huazhu Fu, Nick Barnes

机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)

专题命中 视觉推理 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。

Comments Technical report (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20054 2026-03-17 cs.CV 70%

Marmot: Object-Level Self-Correction via Multi-Agent Reasoning

Marmot:通过多智能体推理实现对象级自校正

Jiayang Sun, Hongbo Wang, Jie Cao, Huaibo Huang, Ran He

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 Marmot通过多智能体推理实现对象级自校正,提升图像文本对齐的准确性,解决多对象场景中计数、属性和空间关系的校正问题。

Journal ref Machine Intelligence Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13100 2026-03-16 cs.RO cs.AI 70%

Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences

评估VLMs在机器人运动中的空间推理能力:迈向具有运动偏好的机器人规划的一步

Wenxi Wu, Jingjing Zhang, Martim Brandão

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文评估了四种先进VLMs在机器人运动中的空间推理能力,探讨了运动偏好(如物体接近性和路径风格)的处理,并分析了准确率与计算成本的权衡。

Comments Accepted to the First Workshop on Efficient Spatial Reasoning at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 70%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12266 2026-03-13 cs.CV 70%

MM-CondChain: A Programmatically Verified Benchmark for Visually Grounded Deep Compositional Reasoning

MM-CondChain: 一种可编程验证的视觉基础深度组合推理基准

Haozhan Shen, Shilin Yan, Hongwei Xue, Shuaiqi Lu, Xiaojun Tang, Guannan Zhang, Tiancheng Zhao, Jianwei Yin

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 MM-CondChain提出了一种可编程验证的视觉基础深度组合推理基准,通过多层推理链评估多模态大语言模型在复杂视觉任务中的表现,实验表明深度组合推理仍是重大挑战。

Comments Project Page: https://accio-lab.github.io/MM-CondChain

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10370 2026-03-12 cs.CV 70%

GeoSense: Internalizing Geometric Necessity Perception for Multimodal Reasoning

GeoSense: 内化几何必要性感知以实现多模态推理

Ruiheng Liu, Haihong Hao, Mingfei Han, Xin Gu, Kecheng Zhang, Changlin Li, Xiaojun Chang

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 GeoSense通过内化几何必要性感知,提升多模态推理的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 70%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09512 2026-03-11 cs.CV 70%

Probing the Reliability of Driving VLMs: From Inconsistent Responses to Grounded Temporal Reasoning

探测驾驶视觉语言模型的可靠性:从不一致响应到基于现实的时序推理

Chun-Peng Chang, Chen-Yu Wang, Holger Caesar, Alain Pagani

机构 * DFKI Augmented Vision(DFKI增强视觉实验室) TU Delft(代尔夫特理工大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究了驾驶视觉语言模型的可靠性问题,通过引入FutureVQA数据集和自监督微调方法,提升模型在时序推理和一致性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07901 2026-03-10 cs.RO cs.LG 70%

NaviDriveVLM: Decoupling High-Level Reasoning and Motion Planning for Autonomous Driving

NaviDriveVLM:解耦高层推理与运动规划用于自动驾驶

Ximeng Tao, Pardis Taghavi, Dimitar Filev, Reza Langari, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 NaviDriveVLM通过解耦高层推理与运动规划,提升自动驾驶中的推理能力与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18064 2026-03-10 cs.CV 70%

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

3DMedAgent:面向3D医学分析的统一感知-理解框架

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院) TUD Dresden University of Technology(德累斯顿技术大学) University of Oxford(牛津大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16053 2026-03-10 cs.RO cs.AI 70%

Compose by Focus: Scene Graph-based Atomic Skills

通过聚焦:基于场景图的原子技能

Han Qi, Changhe Chen, Heng Yang

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于场景图的原子技能学习框架,结合图神经网络与扩散式模仿学习,并与视觉-语言模型结合,提升机器人在复杂任务中的稳健性和组合泛化能力。

Comments Acceptance to ICRA 2026. Website: https://computationalrobotics.seas.harvard.edu/SkillComposition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06032 2026-03-09 cs.CV 70%

StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision

StruVis: 通过结构化视觉进行推理的文本到图像生成增强

Yuanhuiyi Lyu, Kaiyu Lei, Ziqiao Weng, Xu Zheng, Lutao Jiang, Teng Li, Yangfu Li, Ziyuan Huang, Linfeng Zhang, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) Hong Kong University of Science and Technology(香港科技大学) East China Normal University(华东师范大学)

专题命中 视觉推理 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 StruVis通过结构化视觉引导推理,提升基于推理的文本到图像生成性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05708 2026-03-09 cs.CV 70%

Interpretable Perception and Reasoning for Audiovisual Geolocation

可解释的视听定位与推理

Yiyang Su, Xiaoming Liu

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出了一种基于可解释感知和多模态推理的视听定位框架,通过合成声学原子与视觉特征,实现高精度全球定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05075 2026-03-06 cs.CV 70%

UniM: A Unified Any-to-Any Interleaved Multimodal Benchmark

UniM:一个统一的任意到任意交错多模态基准

Yanlin Li, Minghui Guo, Kaiwen Zhang, Shize Zhang, Yiran Zhao, Haodong Li, Congyue Zhou, Weijie Zheng, Yushen Yan, Shengqiong Wu, Wei Ji, Lei Cui, Furu Wei, Hao Fei, Mong-Li Lee, Wynne Hsu

机构 * NUS(新加坡国立大学) SCUT(上海交通大学) NTU(国立科技大学) NJU(南京大学) Microsoft Research(微软研究院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniM基准通过统一的任意到任意交错多模态数据集和评估套件,评估多模态大语言模型在复杂交错生成任务中的能力与挑战。

Comments 70 pages, 63 figures, 30 tables, CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10689 2026-03-06 cs.AI 70%

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

OmniVideoBench: 向多模态大语言模型的音频-视觉理解评估迈进

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Wentao Wang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao Ma, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu

机构 * NJU-LINK Team(南京大学链接团队)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 OmniVideoBench通过大规模基准测试评估多模态大语言模型在音频-视觉理解中的协同推理能力,揭示模型与人类推理间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26905 2026-03-05 cs.AI 70%

Cognition Envelopes for Bounded Decision Making in Autonomous UAS Operations

认知边界用于自主无人机操作中的有限决策

Pedro Antonio Alarcon Granadeno, Arturo Miguel Bernal Russell, Sofia Nelson, Demetrius Hernandez, Maureen Petterson, Michael Murphy, Walter J. Scheirer, Jane Cleland-Huang

机构 * University of Notre Dame(诺特大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出认知边界概念,用于约束自主无人机在搜索救援任务中的决策,结合概率推理和资源分析,以减少 AI 生成决策中的错误。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03198 2026-03-04 cs.RO cs.CL cs.CV 70%

ACE-Brain-0: Spatial Intelligence as a Shared Scaffold for Universal Embodiments

ACE-Brain-0:空间智能作为通用具身化体系的共享框架

Ziyang Gong, Zehang Luo, Anke Tang, Zhe Liu, Shi Fu, Zhi Hou, Ganlin Yang, Weiyun Wang, Xiaofeng Wang, Jianbo Liu, Gen Luo, Haolan Kang, Shuang Luo, Yue Zhou, Yong Luo, Li Shen, Xiaosong Jia, Yao Mu, Xue Yang, Chunxiao Liu, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) University of Science(科学技术大学) Fudan University(复旦大学) Xiamen University(厦门大学) East China Normal University(华东师范大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ACE-Brain-0 通过空间智能作为共享框架,统一了自动驾驶、机器人和 UAVs 的具身化任务,采用 SSR 范式和 GRPO 方法实现跨领域泛化和领域精通的平衡。

Comments Code: https://github.com/ACE-BRAIN-Team/ACE-Brain-0 Hugging Face: https://huggingface.co/ACE-Brain/ACE-Brain-0-8B

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00438 2026-03-04 cs.CV 70%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏