arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-03 至 2026-02-03 共收录 112 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2602.01541 2026-02-03 cs.CV cs.AI 86%

Toward Cognitive Supersensing in Multimodal Large Language Model

迈向多模态大语言模型的认知超感知

Boyi Li, Yifan Shen, Yuanzhe Liu, Yifan Xu, Jiateng Liu, Xinzhuo Li, Zhengyuan Li, Jingyuan Zhu, Yunhan Zhong, Fangzhou Lan, Jianguo Cao, James M. Rehg, Heng Ji, Ismini Lourentzou, Xu Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉问答 :multimodal large language model(title,abstract);visual reasoning(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出认知超感知方法,通过整合视觉图像预测头和强化学习阶段,提升多模态大语言模型在复杂认知任务中的表现,展现其在视觉问答基准中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 84%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 视觉问答 :visual question answering(title);vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03194 2026-02-03 cs.CV cs.AI cs.LG 83%

HueManity: Probing Fine-Grained Visual Perception in MLLMs

HueManity: 探索 MLLMs 中的细粒度视觉感知

Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

机构 * Google(谷歌) Waymo

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 HueManity 通过细粒度视觉感知基准测试揭示 MLLMs 在捕捉细粒度视觉细节方面的显著缺陷。

Journal ref ICML 2025 Workshop on Assessing World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00746 2026-02-03 cs.SE cs.CV 83%

Can Vision-Language Models Handle Long-Context Code? An Empirical Study on Visual Compression

视觉-语言模型能处理长上下文代码吗?对视觉压缩的实证研究

Jianping Zhong, Guochang Li, Chen Zhi, Junxiao Han, Zhen Qin, Xinkui Zhao, Nan Wang, Shuiguang Deng, Jianwei Yin

机构 * Zhejiang University(浙江大学) Hangzhou City University(杭州市大学) Shenzhou Aerospace Software Technology Company Limited(神州航天软件技术有限公司)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出LongCodeOCR,通过视觉压缩替代文本压缩,提升长上下文代码任务的性能与效率,同时揭示了视觉压缩在全局依赖支持与保真度之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16403 2026-02-03 cs.CV 79%

ReasonVQA: A Multi-hop Reasoning Benchmark with Structural Knowledge for Visual Question Answering

ReasonVQA: 一个带有结构知识的多跳推理问答基准数据集

Duong T. Tran, Trung-Kien Tran, Manfred Hauswirth, Danh Le Phuoc

机构 * Bosch Center for AI(博世人工智能中心) Technical University of Berlin(柏林技术大学) Fraunhofer FOKUS(弗劳恩霍夫研究所)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 ReasonVQA是一个结合结构知识的多跳推理问答基准数据集,通过生成复杂问题挑战现有VQA模型,推动领域发展。

Comments Accepted at the IEEE/CVF International Conference on Computer Vision (ICCV) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06582 2026-02-03 cs.CL cs.AI cs.CV cs.IR cs.LG 67%

TabRAG: Improving Tabular Document Question Answering for Retrieval Augmented Generation via Structured Representations

TabRAG:通过结构化表示改进表格文档问答以增强检索增强生成

Jacob Si, Mike Qu, Michelle Lee, Marek Rei, Yingzhen Li

专题命中 视觉问答 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 TabRAG通过结构化表示改进表格文档问答,采用布局分割和视觉语言模型解析,提升表格问答性能。

Comments NeurIPS 2025 AI4Tab

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00083 2026-02-03 cs.IR cs.AI cs.CL cs.LG 62%

SPARC-RAG: Adaptive Sequential-Parallel Scaling with Context Management for Retrieval-Augmented Generation

SPARC-RAG:基于上下文管理的自适应顺序-并行扩展用于检索增强生成

Yuxin Yang, Gangda Deng, Ömer Faruk Akgül, Nima Chitsazan, Yash Govilkar, Akasha Tigalappanavara, Shi-Xiong Zhang, Sambit Sahu, Viktor Prasanna

机构 * University of Southern California(南加州大学) Capital One

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 SPARC-RAG通过多代理框架实现顺序与并行扩展的协调,提升检索增强生成在多跳问答中的性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00029 2026-02-03 cs.CL cs.AI cs.LG 62%

Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management

构建、对齐与推理:面向企业知识管理的大型本体模型

Yao Zhang, Hongyin Zhu

机构 * Yonyou AI Lab(用友人工智能实验室) Yonyou Network Technology Co., Ltd.(用友网络技术有限公司)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大型本体模型(LOM),通过构建、对齐和推理框架,实现企业知识管理中多源异构数据的整合与复杂语义推理,实验表明其在复杂图推理任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 50%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 24 篇

2602.01816 2026-02-03 cs.CV 83%

Seeing Is Believing? A Benchmark for Multimodal Large Language Models on Visual Illusions and Anomalies

看见即相信?多模态大语言模型在视觉错觉和异常上的基准测试

Wenjin Hou, Wei Liu, Han Hu, Xiaoxiao Sun, Serena Yeung-Levy, Hehe Fan

机构 * Zhejiang University(浙江大学) Tencent Hunyuan Team(腾讯文言团队) Stanford University(斯坦福大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出VIA-Bench基准测试,评估多模态大语言模型在视觉错觉和异常上的性能,揭示其在复杂视觉任务中的鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01298 2026-02-03 cs.CV 83%

Interaction-Consistent Object Removal via MLLM-Based Reasoning

基于MLLM的交互一致物体移除

Ching-Kai Huang, Wen-Chieh Lin, Yan-Cen Lee

机构 * National Yang Ming Chiao Tung University(阳明交通大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出基于MLLM的REORM框架,通过多模态语言模型推断需共同删除的交互元素,解决交互一致物体移除问题,并在ICOREval基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01200 2026-02-03 cs.CV 83%

Med3D-R1: Incentivizing Clinical Reasoning in 3D Medical Vision-Language Models for Abnormality Diagnosis

Med3D-R1: 促进3D医学视觉-语言模型的临床推理

Haoran Lai, Zihang Jiang, Kun Zhang, Qingsong Yao, Rongsheng Wang, Zhiyang He, Xiaodong Tao, Wei Wei, Shaohua Kevin Zhou

机构 * School of Biomedical Engineering, Division of Life Sciences and Medicine, University of Science and Technology of China(生物医学工程学院,生命科学与医学系,中国科学技术大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(先进研究所,中国科学技术大学) Stanford University(斯坦福大学) Medical Business Department, iFlytek Co.Ltd(iFlytek公司医学业务部) The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine University of Science and Technology of China(中国科学技术大学第一附属医院,生命科学与医学系)

专题命中 视觉推理 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 Med3D-R1通过两阶段训练框架提升3D医学视觉-语言模型的临床推理能力,实现更准确的异常诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17587 2026-02-03 cs.CV cs.AI cs.LG 82%

HalluRNN: Mitigating Hallucinations via Recurrent Cross-Layer Reasoning in Large Vision-Language Models

HalluRNN: 通过大规模视觉-语言模型中的递归跨层推理缓解幻觉

Le Yu, Kaishen Wang, Jianlong Xiong, Yue Cao, Lei Zhang, Zhang Yi Tao He

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 HalluRNN通过递归跨层推理模块缓解大规模视觉-语言模型中的幻觉问题,提升模型稳定性和性能。

Comments 6 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00211 2026-02-03 cs.CV cs.AI cs.LG 82%

Interpretable Unsupervised Deformable Image Registration via Confidence-bound Multi-Hop Visual Reasoning

可解释的无监督变形图像配准:通过置信度界限多跳视觉推理

Zafar Iqbal, Anwar Ul Haq, Srimannarayana Grandhi

机构 * School of Engineering and Technology(工程与技术学院)

专题命中 视觉推理 :visual reasoning(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出了一种基于多跳视觉推理的可解释无监督变形图像配准框架,通过局部空间细化和跨参考注意力机制,实现高精度且透明的医学图像配准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02043 2026-02-03 cs.CV cs.AI 81%

Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models

Auto-Comp: 一种用于可扩展组合探测对比视觉-语言模型的自动化流水线

Cristian Sbrolli, Matteo Matteucci, Toshihiko Yamasaki

机构 * Politecnico di Milano(米兰理工学院) The University of Tokyo(东京大学)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Auto-Comp通过自动化生成可扩展基准,揭示了对比视觉-语言模型在组合推理中的普遍缺陷及视觉-语言上下文的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01163 2026-02-03 cs.CV cs.AI 81%

Semantically Aware UAV Landing Site Assessment from Remote Sensing Imagery via Multimodal Large Language Models

基于多模态大语言模型的语义感知无人机着陆地评估:从遥感图像

Chunliang Hua, Zeyuan Yang, Lei Zhang, Jiayang Sun, Fengwen Chen, Chunlan Zeng, Xiao Hu

机构 * School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学) LASER, International Digital Economy Academy(LASER,国际数字经济学院) Department of Electronic Engineering, East China Normal University(电子工程系,华东师范大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于多模态大语言模型的无人机着陆地评估方法,通过语义感知与多模态融合提升风险识别精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22221 2026-02-03 cs.CV 79%

Towards Faithful Reasoning in Remote Sensing: A Perceptually-Grounded GeoSpatial Chain-of-Thought for Vision-Language Models

迈向遥感中的可信推理:一种基于感知的地理空间思维链用于视觉-语言模型

Jiaqi Liu, Lang Sun, Ronghao Fu, Bo Yang

机构 * Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 本研究提出Geo-CoT框架,通过两阶段策略提升遥感VLMs的推理能力,实现可验证的多步骤分析,显著优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 79%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16123 2026-02-03 cs.CL 71%

FinCoT: Grounding Chain-of-Thought in Expert Financial Reasoning

FinCoT:在专家金融推理中 grounding 思维链

Natapong Nitarach, Warit Sirichotedumrong, Panop Pitchayarthorn, Pittawat Taveekitworachai, Potsawee Manakul, Kunat Pipatanakul

机构 * SCB 10X, SCBX Group(SCB 10X集团)

专题命中 视觉推理 :grounding(title)

AI总结 FinCoT通过整合专家金融推理蓝图,提升金融领域模型性能并减少推理成本,实现更可解释的推理过程。

Comments Accepted at FinNLP-2025, EMNLP (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21717 2026-02-03 cs.CL cs.CV 70%

CrossCheck-Bench: Diagnosing Compositional Failures in Multimodal Conflict Resolution

CrossCheck-Bench:多模态冲突解决中的组成性故障诊断

Baoliang Tian, Yuxuan Si, Jilong Wang, Lingyao Li, Zhongyuan Bao, Zineng Zhou, Tao Wang, Sixu Li, Ziyao Xu, Mingze Wang, Zhouzhuo Zhang, Zhihao Wang, Yike Yun, Ke Tian, Ning Yang, Minghui Qiu

专题命中 视觉推理 :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 CrossCheck-Bench通过多阶段注释流程构建的基准测试,揭示了多模态模型在处理跨模态冲突时的瓶颈,并表明融合符号推理与视觉处理的方法能提升模型的稳健性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18561 2026-02-03 cs.CV 70%

CoT-RVS: Zero-Shot Chain-of-Thought Reasoning Segmentation for Videos

CoT-RVS:零样本链式推理视频对象分割

Shiu-hong Kao, Yu-Wing Tai, Chi-Keung Tang

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) Dartmouth College(达特茅斯学院)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 CoT-RVS通过零样本链式推理能力,实现了对视频对象的高效分割,无需训练即可处理复杂查询和在线视频流。

Comments Accepted to ICLR 2026. Project page: https://danielshkao.github.io/cot-rvs.html. Code: https://github.com/DanielSHKao/CoT-RVS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02456 2026-02-03 cs.RO 67%

Relationship-Aware Hierarchical 3D Scene Graph for Task Reasoning

关系感知的层次3D场景图用于任务推理

Albert Gassol Puigjaner, Angelos Zacharia, Kostas Alexis

专题命中 视觉推理 :vision language model(abstract);VLM(abstract)

AI总结 本文提出了一种关系感知的层次3D场景图,结合视觉语言模型和大型语言模型,用于任务推理和环境交互。

Comments ICRA 2026, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01884 2026-02-03 cs.AI cs.LG 62%

Entropy-Guided Data-Efficient Training for Multimodal Reasoning Reward Models

熵引导的数据高效训练用于多模态推理奖励模型

Shidong Yang, Tongwen Huang, Hao Wen, Yong Wang, Li Chen, Xiangxiang Chu

机构 * School of Software, Tsinghua University(清华大学软件学院) AMAP, Alibaba Group(阿里巴巴集团AMAP)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出熵引导训练方法,通过熵指导数据筛选和训练策略提升多模态推理奖励模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01477 2026-02-03 cs.LG cs.AI 62%

Achieving Time Series Reasoning Requires Rethinking Model Design, Tasks Formulation, and Evaluation

实现时间序列推理需要重新思考模型设计、任务制定和评估

Yaxuan Kong, Yiyuan Yang, Shiyu Wang, Chenghao Liu, Yuxuan Liang, Ming Jin, Stefan Zohren, Dan Pei, Yan Liu, Qingsong Wen

机构 * University of Oxford, UK(牛津大学) Hong Kong University of Science(香港科学大学) Griffith University, Australia(格里菲斯大学) Tsinghua University, China(清华大学) University of Southern California, USA(南加州大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文指出时间序列推理需重新审视模型设计、任务制定和评估,提出统一框架以提升现实应用中的鲁棒性、可解释性和决策相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02341 2026-02-03 cs.CV 57%

LongVPO: From Anchored Cues to Self-Reasoning for Long-Form Video Preference Optimization

LongVPO:从锚定线索到自我推理的长视频偏好优化

Zhenpeng Huang, Jiaqi Li, Zihan Jia, Xinhao Li, Desen Meng, Lingxue Song, Xi Chen, Liang Li, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) JIUTIAN Research(Jiutian研究) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 LongVPO通过两阶段直接偏好优化框架,利用合成数据和递归标注流程,在无需长视频标注的情况下实现高效长视频理解,优于现有开源模型并保持短视频性能。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02156 2026-02-03 cs.CV 57%

LoopViT: Scaling Visual ARC with Looped Transformers

LoopViT: 通过循环变换器扩展视觉ARC

Wen-Jie Shu, Xuerui Qiu, Rui-Jie Zhu, Harold Haodong Chen, Yexin Liu, Harry Yang

机构 * HKUST(香港科技大学) CASIA(中国科学院自动化研究所) UC Santa Cruz(加州大学圣克ruz分校)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV

AI总结 LoopViT通过循环变换器实现视觉推理的高效扩展,采用权重绑定递归结构和动态退出机制,提升ARC-AGI基准测试性能。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01608 2026-02-03 cs.AI 57%

Reasoning with Autoregressive-Diffusion Collaborative Thoughts

基于自回归扩散协同思想的推理

Mu Yuan, Liekang Zeng, Guoliang Xing, Lan Zhang, Yunhao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本文提出协同思想框架,通过自回归和扩散模型的闭环协作提升空间推理可靠性与生成可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01004 2026-02-03 cs.CV 57%

SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning

SRVAU-R1: 通过反射感知学习增强视频异常理解

Zihao Zhao, Shengting Cao, Muchao Ye

机构 * The University of Iowa(艾奥瓦大学) Knox College(克诺克斯学院)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00637 2026-02-03 cs.CV 57%

VIZOR: Viewpoint-Invariant Zero-Shot Scene Graph Generation for 3D Scene Reasoning

VIZOR: 视点不变的零样本场景图生成用于3D场景推理

Vivek Madhavaram, Vartika Sengar, Arkadipta De, Charu Sharma

机构 * Machine Learning Lab, IIIT Hyderabad, India(IIIT海得拉巴机器学习实验室) Fujitsu Research India, Bangalore(印度班加罗尔 Fujitsu 研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 VIZOR通过无需训练的端到端框架,生成视点不变的零样本场景图,提升3D场景推理的准确性和泛化能力。

Comments WACV 2026, Project page: https://vivekmadhavaram.github.io/vizor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00463 2026-02-03 cs.CV 57%

PSGS: Text-driven Panorama Sliding Scene Generation via Gaussian Splatting

PSGS:通过高斯点划法实现文本驱动的全景滑动场景生成

Xin Zhang, Shen Chen, Jiale Zhou, Lei Li

机构 * East China University of Science and Technology(东华大学) Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉推理 :MLLM(abstract);分类 cs.CV

AI总结 PSGS通过高斯点划法和双阶段框架实现高质量文本驱动全景场景生成,提升3D场景的真实感和细节保真度。

Comments Accepted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏