arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26117 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2603.01637 2026-03-03 cs.CV 70%

DriveCombo: Benchmarking Compositional Traffic Rule Reasoning in Autonomous Driving

DriveCombo:自主驾驶中组合交通规则推理的基准测试

Enhui Ma, Jiahuan Zhang, Guantian Zheng, Tao Tang, Shengbo Eben Li, Yuhang Lu, Xia Zhou, Xueyang Zhang, Yifei Zhan, Kun Zhan, Zhihui Hao, Xianpeng Lang, Kaicheng Yu

机构 * Autolab, Westlake University(西lake大学自动化实验室) Li Auto Inc(Li Auto公司) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 DriveCombo提出了一种基于文本和视觉的基准,用于评估自动驾驶中复杂交通规则的推理能力,通过五级认知阶梯和Rule2Scene代理提升模型在多规则冲突场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01416 2026-03-03 cs.AI 70%

Securing the Floor and Raising the Ceiling: A Merging-based Paradigm for Multi-modal Search Agents

保障地板,提升天花板:一种基于合并的多模态搜索代理范式

Zhixiang Wang, Jingxuan Xu, Dajun Chen, Yunfang Wu, Wei Jiang, Yong Li

机构 * Peking University, Beijing, China(北京大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种无需训练的多模态搜索代理范式,通过跨模态模型合并提升VLMs的自主搜索能力,OBM算法在搜索任务中表现出更高的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01082 2026-03-03 cs.CV cs.IR 70%

Beyond Global Similarity: Towards Fine-Grained, Multi-Condition Multimodal Retrieval

超越全局相似性:面向细粒度、多条件多模态检索

Xuan Lu, Kangle Li, Haohang Huang, Rui Meng, Wenjun Zeng, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究所) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative(宁波空间智能与数字衍生关键实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 MCMR提出一个多条件多模态检索基准,通过细粒度多模态检索评估模型在复杂查询中的条件感知推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00409 2026-03-03 cs.CV 70%

SSR: Pushing the Limit of Spatial Intelligence with Structured Scene Reasoning

SSR:通过结构化场景推理推动空间智能的极限

Yi Zhang, Youya Xia, Yong Wang, Meng Song, Xin Wu, Wenjun Wan, Bingbing Liu, AiXue Ye, Hongbo Zhang, Feng Wen

机构 * Foundation Model Department, Huawei(华为基础模型部门)

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 SSR通过结构化场景推理框架,在减少对齐成本的同时,实现了高效的空间智能,优于更大规模模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11428 2026-03-03 cs.CV 70%

ImagiDrive: A Unified Imagination-and-Planning Framework for Autonomous Driving

ImagiDrive: 一种用于自动驾驶的统一想象与规划框架

Jingyu Li, Bozhou Zhang, Xin Jin, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Eastern Institute of Technology(技术东院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ImagiDrive通过整合视觉-语言模型和驾驶世界模型,实现自动驾驶中的统一想象与规划循环,提升场景生成和决策预测的准确性与效率。

Comments Accepted for publication in 2026 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02814 2026-03-02 cs.AI 70%

Radiologist Copilot: An Agentic Framework Orchestrating Specialized Tools for Reliable Radiology Reporting

放射科助手:一种协调专用工具的代理框架以实现可靠的放射学报告

Yongrui Yu, Zhongzhen Huang, Linjie Mu, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, Shanghai, China(商汤研究) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 放射科助手通过协调专用工具实现全面的放射学报告流程,提升报告准确性和临床标准符合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22939 2026-03-02 cs.CV 70%

ColaVLA: Leveraging Cognitive Latent Reasoning for Hierarchical Parallel Trajectory Planning in Autonomous Driving

ColaVLA: 借助认知潜在推理实现自动驾驶中的分层并行轨迹规划

Qihang Peng, Xuesong Chen, Chenye Yang, Shaoshuai Shi, Hongsheng Li

机构 * Tsinghua University(清华大学) CUHK MMLab(香港中文大学MMLab) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ColaVLA通过统一视觉-语言-动作框架,解决自动驾驶中轨迹规划的效率与准确性问题,实现高效、安全的多尺度轨迹生成。

Comments CVPR2026(Main Conference). Project page: https://pqh22.github.io/projects/ColaVLA/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23351 2026-02-27 cs.CL cs.CV 70%

Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning

规模无法克服语用学:报告偏差对视觉-语言推理的影响

Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Samaya AI(Samaya人工智能) Mistral AI(Mistral人工智能) Allen Institute for AI(人工智能研究所)

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文指出视觉-语言模型在推理能力上的不足源于训练数据中的报告偏差,通过实验表明单纯扩大数据规模无法提升推理技能,但专门收集隐含信息的注释能有效改善模型表现。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22278 2026-02-27 cs.IR cs.LG 70%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03467 2026-02-27 cs.CV 70%

ThinkRL-Edit: Thinking in Reinforcement Learning for Reasoning-Centric Image Editing

ThinkRL-Edit: 基于强化学习的图像编辑推理框架

Hengjia Li, Liming Jiang, Qing Yan, Yizhi Song, Hao Kang, Zichuan Liu, Xin Lu, Boxi Wu, Deng Cai

机构 * Zhejiang University(浙江大学)

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 ThinkRL-Edit通过引入链式推理和无偏奖励策略,提升图像编辑的推理能力,实现更精准和稳定的编辑效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21952 2026-02-26 cs.CV 70%

MindDriver: Introducing Progressive Multimodal Reasoning for Autonomous Driving

MindDriver: 引入渐进多模态推理用于自动驾驶

Lingjun Zhang, Yujian Yuan, Changjie Wu, Xinyuan Chang, Xin Cai, Shuang Zeng, Linzhe Shi, Sijin Wang, Hang Zhang, Mu Xu

机构 * Amap, Alibaba Group(阿里集团蚂巴公司) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 MindDriver通过渐进多模态推理框架提升自动驾驶系统的推理能力,实现语义到物理空间的转化与轨迹规划,展现优异的性能表现。

Comments CVPR2026; Yujian Yuan and Lingjun Zhang contributed equally with random order

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06034 2026-02-26 cs.CV 70%

V-Retrver: Evidence-Driven Agentic Reasoning for Universal Multimodal Retrieval

V-Retrver: 以证据驱动的代理推理用于通用多模态检索

Dongyang Chen, Chaoyang Wang, Dezhao Su, Xi Xiao, Zeyu Zhang, Jing Xiong, Qing Li, Yuzhang Shang, Shichao Kan

机构 * Tsinghua University(清华大学) University of Central Florida(中央佛罗里达大学) Fudan University(复旦大学) The Australian National University(澳大利亚国立大学) The University of Hong Kong(香港大学) Pengcheng Laboratory(鹏城实验室) Central South University(中南大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 V-Retrver通过引入证据驱动的代理推理机制,提升多模态检索的准确率和推理可靠性。

Comments Project page: https://github.com/chendy25/V-Retrver

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06899 2026-02-26 cs.CL cs.AI 70%

RPTS: Tree-Structured Reasoning Process Scoring for Faithful Multimodal Evaluation

RPTS: 基于树结构的推理过程评分用于忠实多模态评估

Haofeng Wang, Yu Zhang

专题命中 视觉推理 :vision-language model(abstract);LLaVA(abstract);分类 cs.AI

AI总结 RPTS提出了一种基于树结构的评分方法,用于评估多模态推理过程的忠实度,通过构建推理树和动态权重调整,揭示模型推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19497 2026-02-24 cs.CV 70%

MICON-Bench: Benchmarking and Enhancing Multi-Image Context Image Generation in Unified Multimodal Models

MICON-Bench: 多图像上下文图像生成的基准测试与增强

Mingrui Wu, Hang Liu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 MICON-Bench通过六个任务评估多图像上下文生成能力,并提出DAR机制提升生成质量与连贯性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18374 2026-02-23 cs.RO cs.AI 70%

Zero-shot Interactive Perception

零样本交互感知

Venkatesh Sripada, Frank Guerin, Amir Ghalamzan

机构 * University of Surrey(萨里大学) University of Sheffield(谢菲尔德大学)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ZS-IP通过结合多策略操作与基于记忆的视觉语言模型,实现零样本交互感知,提升复杂场景中推操作的性能。

Comments Original manuscript submitted on April 24, 2025. Timestamped and publicly available on OpenReview: https://openreview.net/forum?id=7MhpFcr5Nx

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16702 2026-02-19 cs.CV 70%

Saliency-Aware Multi-Route Thinking: Revisiting Vision-Language Reasoning

具有显著性意识的多路由思考:重新审视视觉-语言推理

Mingjia Shi, Yinhan He, Yaochen Zhu, Jundong Li

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出Saliency-Aware Principle(SAP)方法,通过高层次推理原则提升视觉-语言推理的稳定性与效率,减少幻觉并提升响应速度。

Comments preprint 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15183 2026-02-18 cs.LG cs.CL 70%

Seeing to Generalize: How Visual Data Corrects Binding Shortcuts

看见以泛化:视觉数据如何纠正绑定捷径

Nicolas Buzeta, Felipe del Rio, Cristian Hinostroza, Denis Parra, Hans Lobel, Rodrigo Toro Icarte

机构 * Department of Computer Science, Pontificia Universidad Católica, Santiago, Chile(计算机科学系,天主教大学,圣地亚哥,智利)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.LG

AI总结 视觉数据训练可增强模型在单模态任务中的推理与泛化能力,通过改变绑定策略提升分布外性能。

Comments Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09443 2026-02-11 cs.AI 70%

P1-VL: Bridging Visual Perception and Scientific Reasoning in Physics Olympiads

P1-VL: 联结视觉感知与物理竞赛中的科学推理

Yun Luo, Futing Wang, Qianjia Cheng, Fangchen Yu, Haodi Lei, Jianhao Yan, Chenxi Li, Jiacheng Chen, Yufeng Zhao, Haiyuan Wan, Yuchen Zhang, Shenghe Zheng, Junchi Yao, Qingyang Zhang, Haonan He, Wenxuan Zeng, Li Sheng, Chengxing Xie, Yuxin Zuo, Yizhuo Li, Yulun Wu, Rui Huang, Dongzhan Zhou, Kai Chen, Yu Qiao, Lei Bai, Yu Cheng, Ning Ding, Bowen Zhou, Peng Ye, Ganqu Cui

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 P1-VL通过融合课程强化学习和代理增强技术,成为首个在物理竞赛中获得12枚金牌的开源视觉-语言模型,展示了卓越的科学推理能力和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13666 2026-02-11 cs.RO cs.AI 70%

DREAM: Domain-aware Reasoning for Efficient Autonomous Underwater Monitoring

DREAM:面向高效自主水下监测的领域感知方法

Zhenqi Wu, Abhinav Modi, Angelos Mavrogiannis, Kaustubh Joshi, Nikhil Chopra, Yiannis Aloimonos, Nare Karapetyan, Ioannis Rekleitis, Xiaomin Lin

机构 * Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Maryland Robotics Center (MRC), University of Maryland(马里兰大学机器人中心) Woods Hole Oceanographic Institution (WHOI)(伍兹霍尔海洋研究所) Mechanical Engineering, University of Delaware(德雷克塞尔大学机械工程系)

专题命中 视觉推理 :vision language model(abstract);VLM(abstract);分类 cs.AI

AI总结 DREAM通过视觉语言模型引导的自主框架,实现了高效、低耗的水下长期监测,显著提升了目标物体探测效率与覆盖范围。

Comments In Proceeding of ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08346 2026-02-10 cs.CV 70%

What, Whether and How? Unveiling Process Reward Models for Thinking with Images Reasoning

什么是、是否以及如何?揭示图像推理中的过程奖励模型

Yujin Zhou, Pengcheng Wen, Jiale Chen, Boqin Yin, Han Zhu, Jiaming Ji, Juntao Dai, Chi-Min Chan, Sirui Han

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本研究提出首个图像推理范式下的PRMs综合基准,定义7种细粒度错误类型,揭示当前LVLMs在视觉推理评估中的不足,为改进PRMs提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06041 2026-02-09 cs.CV 70%

Predicting Camera Pose from Perspective Descriptions for Spatial Reasoning

从透视描述预测相机姿态用于空间推理

Xuejun Zhang, Aditi Tiwari, Zhenhailong Wang, Heng Ji

专题命中 视觉推理 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CAMCUE通过姿态感知的多图像框架,从自然语言描述中准确预测相机姿态,提升多视角空间推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02071 2026-02-09 cs.AI 70%

Human-AI Co-Embodied Intelligence for Scientific Experimentation and Manufacturing

人类-人工智能协同具身智能用于科学实验与制造

Xinyi Lin, Yuyang Zhang, Yuanhang Gan, Juntao Chen, Hao Shen, Yichun He, Lijun Li, Ze Yuan, Shuang Wang, Chaohao Wang, Rui Zhang, Na Li, Jia Liu

专题命中 视觉推理 :vision language model(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本研究提出人类-人工智能协同具身智能,通过智能体-物理实验系统提升科学实验与制造的精度与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06040 2026-02-06 cs.CV 70%

SwimBird: Eliciting Switchable Reasoning Mode in Hybrid Autoregressive MLLMs

SwimBird: 在混合自回归大语言模型中实现可切换的推理模式

Jintao Tong, Shilin Yan, Hongwei Xue, Xiaojun Tang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Huazhong University of Science and Technology(华中科技大学) Accio Team, Alibaba Group(阿里集团Accio团队)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 SwimBird通过动态切换三种推理模式,提升多模态大语言模型在视觉密集任务中的性能,同时保持文本推理能力。

Comments Project Page: https://accio-lab.github.io/SwimBird

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03665 2026-02-04 cs.CV cs.HC 70%

MM-SCALE: Grounded Multimodal Moral Reasoning via Scalar Judgment and Listwise Alignment

MM-SCALE: 基于标量判断和列表对齐的 grounded 多模态道德推理

Eunkyu Park, Wesley Hanwen Deng, Cheyon Jin, Matheus Kunzler Maldaner, Jordan Wheeler, Jason I. Hong, Hong Shen, Adam Perer, Ken Holstein, Motahhare Eslami, Gunhee Kim

机构 * Seoul National University(首尔国立大学) Carnegie Mellon University(卡内基梅隆大学) University of Florida(佛罗里达大学) Epic Games

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 MM-SCALE通过5点标量评分和显式模态接地,提升多模态模型在道德推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02873 2026-02-04 cs.CV 70%

ViThinker: Active Vision-Language Reasoning via Dynamic Perceptual Querying

ViThinker: 通过动态感知查询实现主动视觉-语言推理

Weihang You, Qingchan Zhu, David Liu, Yi Pan, Geng Yuan, Hanqi Jiang

机构 * School of Computing, University of Georgia(计算机学院,佐治亚大学) School of Engineering and Applied Science, Princeton University(工程与应用科学学院,普林斯顿大学)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 ViThinker通过动态感知查询实现主动视觉-语言推理,提升感知基础和推理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 70%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 70%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22155 2026-01-30 cs.CV cs.CL 70%

UEval: A Benchmark for Unified Multimodal Generation

UEval:一个统一多模态生成的评估基准

Bo Li, Yida Yin, Wenhao Chai, Xingyu Fu, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UEval是一个评估统一多模态生成模型的基准,通过专家精选问题和评分表系统,揭示推理能力对复杂任务的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21821 2026-01-30 cs.CV 70%

MMFineReason: Closing the Multimodal Reasoning Gap via Open Data-Centric Methods

MMFineReason: 通过以开放数据为中心的方法缩小多模态推理差距

Honglin Lin, Zheng Liu, Yun Zhu, Chonghan Qin, Juekai Lin, Xiaoran Shang, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室、OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 视觉推理 :vision language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 MMFineReason通过大规模多模态推理数据集和基于难度的过滤策略,提升模型推理能力与参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19433 2026-01-28 cs.CV 70%

RoamScene3D: Immersive Text-to-3D Scene Generation via Adaptive Object-aware Roaming

RoamScene3D: 通过自适应物体感知漫游实现沉浸式文本到3D场景生成

Jisheng Chu, Wenrui Li, Rui Zhao, Wangmeng Zuo, Shifeng Chen, Xiaopeng Fan

机构 * Faculty of Computing, Harbin Institute of Technology(计算机学院,哈尔滨工业大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) Nanyang Technological University(南洋理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology Suzhou Research Institute(哈尔滨工业大学苏州研究院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RoamScene3D通过自适应物体感知漫游实现沉浸式文本到3D场景生成,结合语义推理和几何约束提升场景一致性与逼真度。

详情

展开后加载摘要…

URL PDF HTML 收藏