arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2403.07247 2025-12-02 eess.IV cs.CV cs.LG 57%

GuideGen: A Text-Guided Framework for Paired Full-torso Anatomy and CT Volume Generation

GuideGen: 一种基于文本引导的完整躯干解剖和CT体积生成框架

Linrui Dai, Rongzhao Zhang, Yongrui Yu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GuideGen通过文本引导生成完整躯干解剖和CT体积,提升医学影像数据合成效率与质量。

Comments accepted as AAAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00355 2025-12-02 cs.CV 57%

SMamDiff: Spatial Mamba for Stochastic Human Motion Prediction

SMamDiff: 基于空间Mamba的随机人体运动预测

Junqiao Fan, Pengfei Liu, Haocong Rao

机构 * School of Computer Science, Nanyang Technological University(计算机科学学院,南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SMamDiff通过空间Mamba和余数-DCT编码提升随机人体运动预测的时空一致性,实现更高效且准确的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV 57%

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23051 2025-12-01 cs.CV 57%

GOATex: Geometry & Occlusion-Aware Texturing

GOATex: 几何与遮挡感知纹理生成

Hyunjin Kim, Kunho Kim, Adam Lee, Wonkwang Lee

机构 * KRAFTON AI(KRAFTON人工智能研究院) NC AI(NC人工智能研究院) UC Berkeley(伯克利大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GOATex通过基于命中层级的遮挡感知框架,实现高质量3D网格内外表面纹理生成,无需微调扩散模型,具备结构连贯性与无缝纹理输出。

Comments Accepted to NeurIPS 2025; Project Page: https://goatex3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22991 2025-12-01 cs.CV 57%

Guiding Visual Autoregressive Models through Spectrum Weakening

通过频谱弱化引导视觉自回归模型

Chaoyang Wang, Tianmeng Yang, Jingdong Wang, Yunhai Tong

机构 * Peking University(北京大学) Baidu(百度)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种无需重新训练的频谱弱化框架,用于提升视觉自回归模型的生成质量与条件对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04931 2025-12-01 cs.CV cs.AI 57%

CzechLynx: A Dataset for Individual Identification and Pose Estimation of the Eurasian Lynx

CzechLynx:用于欧亚猞猁个体识别和姿态估计的数据集

Lukas Picek, Elisa Belotti, Michal Bojda, Ludek Bufka, Vojtech Cermak, Martin Dula, Rostislav Dvorak, Luboslav Hrdy, Miroslav Jirik, Vaclav Kocourek, Josefa Krausova, Jirı Labuda, Jakub Straka, Ludek Toman, Vlado Trulık, Martin Vana, Miroslav Kutal

机构 * Faculty of Applied Sciences, University of West Bohemia in Pilsen, Czechia(西波西米亚大学应用科学学院) Inria, LIRMM, University of Montpellier, France(Inria、LIRMM、蒙彼利埃大学,法国) Faculty of Forestry and Wood Sciences, Czech University of Life Sciences Prague, Czechia(林业与木科学学院,捷克生命科学大学布拉格,捷克) Department of Research and Nature Protection, Šumava National Park Administration, Czechia(研究与自然保护部门,Šumava国家公园管理局,捷克) Department of Forest Ecology, Faculty of Forestry and Wood Technology, Mendel University in Brno, Czechia(森林生态学系,林业与木技术学院,梅德利大学布拉格,捷克) Friends of the Earth Czech Republic, Carnivore Conservation Programme, Czechia(捷克地球之友、食肉动物保护计划,捷克) Center for Machine Perception, Czech Technical University in Prague, Czechia(机器感知中心,布拉格捷克技术大学,捷克)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CzechLynx数据集通过合成图像和生成管道,为欧亚猞猁的个体识别和姿态估计提供了大规模、开放的基准测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22135 2025-12-01 cs.CV 57%

EASL: Multi-Emotion Guided Semantic Disentanglement for Expressive Sign Language Generation

EASL: 多情绪引导的语义解耦用于表达性手语生成

Yanchao Zhao, Jihao Zhu, Yu Liu, Weizhuo Chen, Yuling Yang, Kun Peng

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Health and Rehabilitation Sciences(康复科学大学) The University of Aberdeen(阿伯丁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EASL通过多情绪引导的语义解耦架构,提升手语生成的表达性和情感表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07769 2025-12-01 cs.CV 57%

Dream4D: Lifting Camera-Controlled I2V towards Spatiotemporally Consistent 4D Generation

Dream4D: 通过可控视频生成与神经4D重建提升I2V向时空一致4D生成

Xiaoyan Liu, Kangrui Li, Yuehao Song, Jiaxin Liu

机构 * The Chinese University of Hong Kong(香港中文大学) The Hong Kong Polytechnic University(香港理工大学) Huazhong University of Science and Technology(华中科技大学) The University of New South Wales(新南威尔士大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Dream4D通过可控视频生成与神经4D重建的协同,实现高质量的时空一致4D内容生成。

Comments Project Page: https://wanderer7-sk.github.io/Dream4D.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13911 2025-12-01 cs.CV 57%

GraspDiffusion: Synthesizing Realistic Whole-body Hand-Object Interaction

GraspDiffusion: 合成逼真的全身手-物体交互

Patrick Kwon, Chen Chen, Hanbyul Joo

机构 * University of Central Florida(中央佛罗里达大学) Seoul National University(首尔国立大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GraspDiffusion通过结合身体和手姿态的生成先验知识,生成逼真的全身手-物体交互场景,优于现有方法。

Comments Paper has been accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21043 2025-11-27 cs.CV 57%

PG-ControlNet: A Physics-Guided ControlNet for Generative Spatially Varying Image Deblurring

PG-ControlNet:一种用于生成空间变化图像去模糊的物理引导ControlNet

Hakki Motorcu, Mujdat Cetin

机构 * 1 Computer Science Department, University of Rochester 2 Goergen Institute for Data Science \& AIS, University of Rochester Computer Engineering Department, University of Rochester

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PG-ControlNet通过结合物理约束与生成模型,提升空间变化图像去模糊的物理准确性和感知真实感。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20784 2025-11-27 cs.CV 57%

One Patch is All You Need: Joint Surface Material Reconstruction and Classification from Minimal Visual Cues

一个补丁就够了:从最小的视觉线索联合表面材料重建与分类

Sindhuja Penchala, Gavin Money, Gabriel Marques, Samuel Wood, Jessica Kirschman, Travis Atkison, Shahram Rahimi, Noorbakhsh Amiri Golilarz

机构 * Department of Computer Science, The University of Alabama(计算机科学系,阿拉巴马大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SMARC通过单个补丁实现表面材料重建与分类,以应对稀疏视觉输入下的挑战,取得最佳性能。

Comments 9 pages,3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20563 2025-11-26 cs.CV 57%

A Reason-then-Describe Instruction Interpreter for Controllable Video Generation

用于可控视频生成的指令解释器

Shengqiong Wu, Weicai Ye, Yuanxing Zhang, Jiahao Wang, Quande Liu, Xintao Wang, Pengfei Wan, Kun Gai, Hao Fei, Tat-Seng Chua

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) National University of Singapore(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReaDe通过推理后再描述的方法,将模糊用户指令转化为精确规范,提升可控视频生成的准确性和质量。

Comments 27 pages, 13 figures, 13 tables, Project Page: https://sqwu.top/ReaDe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19919 2025-11-26 cs.CV 57%

HybriDLA: Hybrid Generation for Document Layout Analysis

HybriDLA:文档布局分析的混合生成

Yufan Chen, Omar Moured, Ruiping Liu, Junwei Zheng, Kunyu Peng, Jiaming Zhang, Rainer Stiefelhagen

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HybriDLA通过结合扩散和自回归解码,实现文档布局分析的高精度区域预测,达到83.5%的mAP性能。

Comments Accepted by AAAI 2026 (Oral). Project page at https://yufanchen96.github.io/projects/HybriDLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19856 2025-11-26 cs.CV 57%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27606 2025-11-26 cs.CV cs.AI 57%

Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning

Spatial-SSRL: 通过自监督强化学习增强空间理解

Yuhong Liu, Beichen Zhang, Yuhang Zang, Yuhang Cao, Long Xing, Xiaoyi Dong, Haodong Duan, Dahua Lin, Jiaqi Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Spatial-SSRL通过自监督强化学习提升大视觉-语言模型的空间理解能力,无需人工标注,在多个基准测试中取得显著准确率提升。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18277 2025-11-25 cs.CV 57%

Point-to-Point: Sparse Motion Guidance for Controllable Video Editing

点到点:用于可控视频编辑的稀疏运动引导

Yeji Song, Jaehyun Lee, Mijin Koo, JunHoo Lee, Nojun Kwak

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Point-to-Point通过引入锚点标记,利用视频扩散模型的先验知识,实现可控视频编辑中运动与编辑的高质量保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18173 2025-11-25 cs.CV 57%

EgoControl: Controllable Egocentric Video Generation via 3D Full-Body Poses

EgoControl: 通过3D全身姿态实现可控的目视视频生成

Enrico Pallotta, Sina Mokhtarzadeh Azar, Lars Doorenbos, Serdar Ozsoy, Umar Iqbal, Juergen Gall

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所) NVIDIA(NVIDIA公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EgoControl通过3D全身姿态控制生成高质量的目视视频,实现对动作的精细控制,推动具身AI的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17450 2025-11-24 cs.CV cs.AI cs.CL 57%

Planning with Sketch-Guided Verification for Physics-Aware Video Generation

基于草图引导验证的物理感知视频生成规划

Yidong Huang, Zun Wang, Han Lin, Dong-Ki Kim, Shayegan Omidshafiei, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) FieldAI Nanyang Technological University(南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SketchVerify通过草图验证和动态轨迹优化提升物理感知视频生成的效率与质量。

Comments website: https://sketchverify.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17269 2025-11-24 cs.CV cs.AI 57%

Range-Edit: Semantic Mask Guided Outdoor LiDAR Scene Editing

Range-Edit: 基于语义掩码的户外激光雷达场景编辑

Suchetan G. Uppur, Hemant Kumar, Vaibhav Kumar

机构 * GeoAI4Cities Lab(GeoAI4Cities实验室) IISER Bhopal(印度比哈尔理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Range-Edit通过语义掩码指导生成高质量的激光雷达点云,提升自动驾驶系统的鲁棒性与泛化能力。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16825 2025-11-24 cs.CV cs.AI 57%

WorldGen: From Text to Traversable and Interactive 3D Worlds

WorldGen: 从文本到可遍历和交互的3D世界

Dilin Wang, Hyunyoung Jung, Tom Monnier, Kihyuk Sohn, Chuhang Zou, Xiaoyu Xiang, Yu-Ying Yeh, Di Liu, Zixuan Huang, Thu Nguyen-Phuoc, Yuchen Fan, Sergiu Oprea, Ziyan Wang, Roman Shapovalov, Nikolaos Sarafianos, Thibault Groueix, Antoine Toisoul, Prithviraj Dhar, Xiao Chu, Minghao Chen, Geon Yeong Park, Mahima Gupta, Yassir Azziz, Rakesh Ranjan, Andrea Vedaldi

机构 * Reality Labs, Meta(Meta现实实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 WorldGen通过结合LLM、程序生成和扩散模型,实现从文本到可交互3D世界的自动创建,提升虚拟空间的生成效率与表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02260 2025-11-21 cs.CV 57%

MagicFace: High-Fidelity Facial Expression Editing with Action-Unit Control

MagicFace: 通过动作单元控制实现高保真的面部表情编辑

Mengting Wei, Tuomas Varanka, Xingxun Jiang, Huai-Qian Khor, Guoying Zhao

机构 * Center for Machine Vision and Signal Analysis, Faculty of Information Technology and Electrical Engineering, University of Oulu(机器视觉与信号分析中心,信息科技与电气工程学院,奥卢大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MagicFace通过动作单元控制实现高保真的面部表情编辑,结合扩散模型和ID编码器,能够精细调整表情并保持身份和背景一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13684 2025-11-18 cs.CV cs.LG 57%

Training-Free Multi-View Extension of IC-Light for Textual Position-Aware Scene Relighting

Jiangnan Ye, Jiedong Zhuang, Lianrui Mu, Wenjie Zheng, Jiaqi Hu, Xingze Zou, Jing Wang, Haoji Hu

机构 * College of Information Science(信息科学学院) Electronic Engineering, Zhejiang University, Hangzhou, 310027, Zhejiang, China(电子工程系,浙江大学,杭州,310027,浙江,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Submitting for Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13191 2025-11-18 cs.CV 57%

Birth of a Painting: Differentiable Brushstroke Reconstruction

Ying Jiang, Jiayin Lu, Yunuo Chen, Yumeng He, Kui Wu, Yin Yang, Chenfanfu Jiang

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26196 2025-11-18 cs.CV 57%

Sketch2PoseNet: Efficient and Generalized Sketch to 3D Human Pose Prediction

Li Wang, Yiyu Zhuang, Yanwen Wang, Xun Cao, Chuan Guo, Xinxin Zuo, Hao Zhu

机构 * Nanjing University(南京大学) Snap Inc.(Snap公司) Concordia University(Concordia大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19946 2025-11-18 cs.CV 57%

SCALAR: Scale-wise Controllable Visual Autoregressive Learning

Ryan Xu, Dongyang Jin, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15095 2025-11-18 cs.CV 57%

VistaDepth: Improving far-range Depth Estimation with Spectral Modulation and Adaptive Reweighting

Mingxia Zhan, Li Zhang, Yingjie Wang, Xiaomeng Chu, Beibei Wang, Yanyong Zhang

机构 * Hefei University of Technology(合肥工业大学) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12030 2025-11-18 cs.CV 57%

VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation

Jun Zhou, Chi Xu, Kaifeng Tang, Yuting Ge, Tingrui Guo, Li Cheng

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages, 9 figures, extended version of the AAAI 2026 paper "VPHO: Joint Visual-Physical Cue Learning and Aggregation for Hand-Object Pose Estimation"

详情

展开后加载摘要…

URL PDF HTML 收藏
2105.06421 2025-11-18 cs.CV cs.AI cs.LG 57%

Using Self-Supervised Auxiliary Tasks to Improve Fine-Grained Facial Representation

Mahdi Pourmirzaei, Gholam Ali Montazer, Farzaneh Esmaili

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18959 2025-11-17 cs.CV 57%

Generative AI in Map-Making: A Technical Exploration and Its Implications for Cartographers

Claudio Affolter, Sidi Wu, Yizi Chen, Lorenz Hurni

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏