arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2512.15310 2025-12-18 cs.CV 57%

SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation

SynthSeg-Agents: 多智能体合成数据生成用于零样本弱监督语义分割

Wangyu Wu, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SynthSeg-Agents利用大型语言模型生成合成数据,无需现实图像即可实现零样本弱监督语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07981 2025-12-18 cs.CV cs.AI 57%

Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation

Omni-Effects: 统一且空间可控的视觉效果生成

Fangyuan Mao, Aiming Hao, Jintao Chen, Dongxia Liu, Xiaokun Feng, Jiashu Zhu, Meiqi Wu, Chubin Chen, Jiahong Wu, Xiangxiang Chu

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 Omni-Effects通过统一框架实现空间可控的多效果生成,结合LoRA-MoE和SAP技术,提升视觉效果生成的精度和多样性。

Comments Accepted to AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07712 2025-12-17 cs.CV 57%

UnCageNet: Tracking and Pose Estimation of Caged Animal

UnCageNet: 有笼动物的跟踪与姿态估计

Sayak Dutta, Harish Katti, Shashikant Verma, Shanmuganathan Raman

机构 * Indian Institute of Technology Gandhinagar(印度古吉拉特邦理工学院加尔各答分校) National Institutes of Health (NIH)(美国国家卫生研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 UnCageNet通过三阶段预处理流程有效解决笼子结构和遮挡对动物跟踪与姿态估计的影响,提升姿态估计和关键点检测精度。

Comments 9 pages, 2 figures, 2 tables. Accepted to the Indian Conference on Computer Vision, Graphics, and Image Processing (ICVGIP 2025), Mandi, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14217 2025-12-17 cs.CV cs.RO 57%

DRAW2ACT: Turning Depth-Encoded Trajectories into Robotic Demonstration Videos

DRAW2ACT:将深度编码轨迹转化为机器人演示视频

Yang Bai, Liudi Yang, George Eskandar, Fengyi Shen, Mohammad Altillawi, Ziyuan Liu, Gitta Kutyniok

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) University of Freiburg(弗赖堡大学) Technical University of Munich(慕尼黑技术大学) Huawei Heisenberg Research Center (Munich)(华为海森堡研究中心(慕尼黑))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DRAW2ACT通过深度感知的轨迹条件视频生成框架,生成可控且一致的机器人演示视频,提升机器人操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14162 2025-12-17 cs.CV 57%

FastDDHPose: Towards Unified, Efficient, and Disentangled 3D Human Pose Estimation

FastDDHPose: 向统一、高效且解耦的3D人体姿态估计迈进

Qingyuan Cai, Linxin Zhang, Xuecai Hu, Saihui Hou, Yongzhen Huang

机构 * Watrix Technology Limited Company Ltd(沃特克斯技术有限公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FastDDHPose通过解耦扩散模型提升3D人体姿态估计的效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2025-12-17 cs.CV 57%

Beyond the Visible: Disocclusion-Aware Editing via Proxy Dynamic Graphs

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13008 2025-12-16 cs.CV 57%

TWLR: Text-Guided Weakly-Supervised Lesion Localization and Severity Regression for Explainable Diabetic Retinopathy Grading

TWLR: 基于文本引导的弱监督病变定位与严重程度回归用于可解释性糖尿病视网膜病变分级

Xi Luo, Shixin Xu, Ying Xie, JianZhong Hu, Yuwei He, Yuhui Deng, Huaxiong Huang

机构 * Guangdong Provincial Key Laboratory of Interdisciplinary Research and Application for Data Science(广东省级交叉学科研究与数据科学应用重点实验室) Department of Statistics and Data Science, Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学统计与数据科学系) Faculty of Science, Hong Kong Baptist University(香港 Baptist大学科学学院) Data Science Research Center, Duke Kunshan University(杜克-昆山大学数据科学研究中心) Shanxi Provincial People’s Hospital(山西人民医院) The Fifth Clinical Medical school of Shanxi Medical University(山西医科大学第五临床医学院) Research Center for Mathematics, Beijing Normal University(北京师范大学数学研究中心) Department of Mathematics and Statistics, York University(约克大学数学与统计学系)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 TWLR通过双阶段框架实现糖尿病视网膜病变的可解释性评估,结合视觉语言模型和弱监督分割,实现病变定位与严重程度回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12751 2025-12-16 cs.CV 57%

GenieDrive: Towards Physics-Aware Driving World Model with 4D Occupancy Guided Video Generation

GenieDrive: 向具有物理意识的驾驶世界模型迈进:基于4D占用的视频生成

Zhenya Yang, Zhe Liu, Yuxiang Lu, Liping Hou, Chenxuan Miao, Siyi Peng, Bailan Feng, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GenieDrive通过4D占用引导的视频生成,实现物理意识的驾驶视频生成,提升预测精度和视频质量。

Comments The project page is available at https://huster-yzy.github.io/geniedrive_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12664 2025-12-16 cs.CV 57%

InteracTalker: Prompt-Based Human-Object Interaction with Co-Speech Gesture Generation

InteracTalker: 基于提示的人-物体交互与同步手势生成

Sreehari Rajan, Kunal Bhosikar, Charu Sharma

机构 * Machine Learning Lab, IIIT Hyderabad, India(IIIT Hyderabad 机器学习实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InteracTalker通过整合基于提示的物体感知交互与同步手势生成,实现了人-物体交互的统一框架,提升了动作的真实性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11645 2025-12-15 cs.CV 57%

FactorPortrait: Controllable Portrait Animation via Disentangled Expression, Pose, and Viewpoint

FactorPortrait: 通过解耦的表情、姿态和视角实现可控的肖像动画

Jiapeng Tang, Kai Li, Chengxiang Yin, Liuhao Ge, Fei Jiang, Jiu Xu, Matthias Nießner, Christian Häne, Timur Bagautdinov, Egor Zakharov, Peihong Guo

机构 * Meta Reality Labs(Meta现实实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 FactorPortrait通过解耦表情、姿态和视角实现可控肖像动画,利用预训练编码器和3D网格跟踪生成逼真动态效果。

Comments Project page: https://tangjiapeng.github.io/FactorPortrait/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09585 2025-12-15 cs.SD cs.MM 57%

Video Echoed in Music: Semantic, Temporal, and Rhythmic Alignment for Video-to-Music Generation

视频中的音乐:语义、时间与节奏对齐用于视频到音乐生成

Xinyi Tong, Yiran Zhu, Jishang Chen, Chunru Zhan, Tianle Wang, Sirui Zhang, Nian Liu, Tiezheng Ge, Duo Xu, Xin Jin, Feng Yu, Song-Chun Zhu

专题命中 可控生成 :diffusion(abstract);分类 cs.MM

AI总结 VeM通过语义、时间和节奏对齐,生成高质量视频到音乐,提升视听沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05029 2025-12-15 cs.CV 57%

Estimating Object Physical Properties from RGB-D Vision and Depth Robot Sensors Using Deep Learning

基于RGB-D视觉和深度机器人传感器利用深度学习估计物体物理特性

Ricardo Cardoso, Plinio Moreno

机构 * Ricardo Pedreiras Cardoso Plinio Moreno

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出结合深度图像和RGB图像的数据,利用深度学习方法估计物体质量,通过合成数据集提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10943 2025-12-12 cs.CV cs.AI 57%

AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation

AlcheMinT:多参考一致视频生成的细粒度时间控制

Sharath Girish, Viacheslav Ivanov, Tsai-Shien Chen, Hao Chen, Aliaksandr Siarohin, Sergey Tulyakov

机构 * Snap Inc. UC Merced(加州大学默塞德分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlcheMinT通过引入显式时间戳条件化,实现了多主体视频生成中的细粒度时间控制,提升了视频生成的精确性和保真度。

Comments Project page: https://snap-research.github.io/Video-AlcheMinT/snap-research.github.io/Video-AlcheMinT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03040 2025-12-12 cs.CV cs.AI 57%

Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation

Video4Spatial: 通过基于场景的视频生成实现视觉空间智能

Zeqi Xiao, Yiwei Zhao, Lingxiao Li, Yushi Lan, Ning Yu, Rahul Garg, Roshni Cooper, Mohammad H. Taghavi, Xingang Pan

机构 * Netflix Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Eyeline Studios

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Video4Spatial通过仅使用视频数据训练的生成模型,实现了复杂空间任务的视觉空间智能,展示了视频生成模型在空间推理中的潜力。

Comments Project page at https://xizaoqu.github.io/video4spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.08591 2025-12-12 cs.CV 57%

Joint2Human: High-quality 3D Human Generation via Compact Spherical Embedding of 3D Joints

Joint2Human: 通过紧凑的球面嵌入3D关节实现高质量3D人体生成

Muxin Zhang, Qiao Feng, Zhuo Su, Chao Wen, Zhou Xue, Kun Li

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) PICO IDL, ByteDance China(字节跳动中国PICO IDL) Li Auto(利亚德)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Joint2Human通过紧凑球面嵌入3D关节,结合2D扩散模型和多视角重绘策略,实现高质量3D人体生成,兼顾全局结构与局部细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08534 2025-12-10 cs.CV 57%

PaintFlow: A Unified Framework for Interactive Oil Paintings Editing and Generation

PaintFlow:一种用于交互式油画创作与生成的统一框架

Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni

机构 * Zhangli Hu, Ye Chen, Jiajun Yao, Bingbing Ni(张立虎、陈叶、姚佳君、倪炳炳)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 PaintFlow提出了一种统一框架,通过多模态输入实现交互式油画创作与编辑,利用空间对齐、语义增强和自监督风格迁移技术,提升油画生成与编辑的风格一致性与艺术表现力。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08229 2025-12-10 cs.CV cs.RO 57%

Geometry-Aware Sparse Depth Sampling for High-Fidelity RGB-D Depth Completion in Robotic Systems

基于几何的稀疏深度采样用于机器人系统中高保真的RGB-D深度补全

Tony Salloom, Dandi Zhou, Xinhai Sun

机构 * Saisuode (Shanghai) Intelligent Technology Co., Ltd. (Synthoid.ai)(上海思度智能科技有限公司(Synthoid.ai))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于几何的稀疏深度采样方法,利用表面法线估计提升RGB-D深度补全的准确性和现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08215 2025-12-10 cs.CV 57%

Blur2Sharp: Human Novel Pose and View Synthesis with Generative Prior Refinement

Blur2Sharp: 基于生成先验细化的人体新颖姿态与视角合成

Chia-Hern Lai, I-Hsuan Lo, Yen-Ku Yeh, Thanh-Nguyen Truong, Ching-Chun Huang

机构 * National Yang Ming Chiao Tung University

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Blur2Sharp通过整合3D感知神经渲染和扩散模型,实现从单一视角生成清晰且几何一致的新视角图像,提升复杂场景下的姿态与视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 57%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01254 2025-12-09 cs.CV 57%

EmojiDiff: Advanced Facial Expression Control with High Identity Preservation in Portrait Generation

EmojiDiff: 高精度面部表情控制与高保真身份保持在肖像生成中

Liangwei Jiang, Ruida Li, Zhifeng Zhang, Shuo Fang, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EmojiDiff通过解耦训练和微调方法,实现了高精度面部表情控制与高保真身份保持的端到端肖像生成解决方案。

Comments accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13558 2025-12-09 cs.CV 57%

X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability

X-Scene: 通过高保真和灵活可控性实现大规模驾驶场景生成

Yu Yang, Alan Liang, Jianbiao Mei, Yukai Ma, Yong Liu, Gim Hee Lee

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 X-Scene通过高保真和灵活可控性实现大规模驾驶场景生成,支持多粒度控制和一致性外推,提升自动驾驶的数据生成与模拟能力。

Comments Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10339 2025-12-09 cs.CV 57%

Towards Unsupervised Domain Bridging via Image Degradation in Semantic Segmentation

通过图像退化实现无监督领域桥接的语义分割方法

Wangkai Li, Rui Sun, Huayu Mai, Tianzhu Zhang

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DiDA通过图像退化构建中间领域并补偿语义偏移,提升语义分割在不同领域间的适应性能。

Comments Accepted by Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05557 2025-12-08 cs.CV cs.AI 57%

2K-Characters-10K-Stories: A Quality-Gated Stylized Narrative Dataset with Disentangled Control and Sequence Consistency

2K角色-10K故事:一个具有解耦控制和序列一致性的质量门控风格化叙事数据集

Xingxi Yin, Yicheng Li, Gong Yan, Chenglin Li, Jian Zhao, Cong Huang, Yue Deng, Yin Zhang

机构 * Zhejiang University(浙江大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出2K-Characters-10K-Stories数据集,通过解耦控制和质量门控机制,实现高质量的风格化叙事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04534 2025-12-05 cs.CV 57%

Refaçade: Editing Object with Given Reference Texture

Refaçade: 基于给定参考纹理的物体编辑

Youze Huang, Penghui Ruan, Bojia Zi, Xianbiao Qi, Jianan Wang, Rong Xiao

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Refaçade通过纹理去除和局部纹理统计增强,实现精确可控的物体纹理迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03510 2025-12-04 cs.CV cs.RO 57%

CSMapping: Scalable Crowdsourced Semantic Mapping and Topology Inference for Autonomous Driving

CSMapping: 可扩展的众包语义制图与拓扑推断用于自动驾驶

Zhijian Qiao, Zehuan Yu, Tong Li, Chih-Chung Chou, Wenchao Ding, Shaojie Shen

机构 * the Department of Electronic and Computer Engineering, the Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科技大学,香港,中国) the Academy for Engineering and Technology, Fudan University, Shanghai, China(工程与技术学院,复旦大学,上海,中国) Zhuoyu Technology Co., Ltd., Shenzhen, China(珠海优创科技有限公司,深圳,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CSMapping通过潜在扩散模型和拓扑优化方法,实现高质量的语义地图和道路中心线生成,适用于自动驾驶场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03345 2025-12-04 cs.CV cs.AI 57%

HalluGen: Synthesizing Realistic and Controllable Hallucinations for Evaluating Image Restoration

HalluGen: 合成逼真且可控的幻觉以评估图像修复

Seunghoi Kim, Henry F. J. Tregidgo, Chen Jin, Matteo Figini, Daniel C. Alexander

机构 * Hawkes Institute, UCL(UCL哈维斯研究所) Dept. of Medical Physics and Biomedical Engineering, UCL(UCL医学物理与生物医学工程系) Dept. of Computer Science, UCL(UCL计算机科学系) Centre for AI, DS&AI, AstraZeneca, UK(阿斯利康AI中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HalluGen 通过合成逼真可控的幻觉,构建首个大规模幻觉数据集,用于评估图像修复中的幻觉检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02972 2025-12-03 cs.CV cs.RO 57%

BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection

BEVDilation:以LiDAR为中心的多模态融合用于3D目标检测

Guowen Zhang, Chenhang He, Liyi Chen, Lei Zhang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BEVDilation提出以LiDAR为中心的多模态融合方法,通过稀疏体素扩张和语义引导BEV扩张模块提升3D目标检测性能,有效缓解深度误差带来的空间错位问题。

Comments Accept by AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01686 2025-12-02 cs.CV 57%

DreamingComics: A Story Visualization Pipeline via Subject and Layout Customized Generation using Video Models

DreamingComics: 通过主体和布局定制生成实现故事可视化管道

Patrick Kwon, Chen Chen

机构 * Center for Research in Computer Vision, University of Central Florida(计算机视觉研究中心,中央佛罗里达大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamingComics通过结合视频模型和布局生成技术,实现了基于主体和布局定制的高效故事可视化方法,提升了角色一致性和风格相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12170 2025-12-02 cs.CV cs.AI 57%

Rethinking Multimodal Point Cloud Completion: A Completion-by-Correction Perspective

重新思考多模态点云补全:一种补全-修正视角

Wang Luo, Di Wu, Hengyuan Na, Yinlin Zhu, Miao Hu, Guocong Quan

机构 * Wang Luo, Di Wu, Hengyuan Na, Yinlin Zhu, Miao Hu, Guocong Quan(作者)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 PGNet通过补全-修正范式,结合多阶段框架和双特征编码,实现更鲁棒的点云补全,提升重建精度与结构一致性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22643 2025-12-02 cs.CV 57%

SPIRAL: Semantic-Aware Progressive LiDAR Scene Generation and Understanding

SPIRAL: 基于语义的渐进式LiDAR场景生成与理解

Dekai Zhu, Yixuan Hu, Youquan Liu, Dongyue Lu, Lingdong Kong, Slobodan Ilic

机构 * Technical University of Munich(慕尼黑技术大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Spiral提出了一种基于范围视图的LiDAR扩散模型,能够同时生成深度、反射图像和语义地图,实现高效的3D场景生成与理解。

Comments NeurIPS 2025; 24 pages, 10 figures, 9 tables; Code at https://github.com/worldbench/SPIRAL

详情

展开后加载摘要…

URL PDF HTML 收藏