arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2601.16532 2026-01-27 cs.CV 57%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17857 2026-01-27 cs.CV 57%

SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction

SynMind:减少基于fMRI的图像重建中的语义幻觉

Lan Yang, Minghan Yang, Ke Li, Honggang Zhang, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) SketchX Lab, Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(SketchX实验室,视觉、语音和信号处理中心(CVSSP), Surrey大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMind通过整合显式语义编码与视觉先验,提升基于fMRI的图像重建质量,减少语义幻觉并提高与人类视觉感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17088 2026-01-27 cs.CV 57%

GlassesGB: Controllable 2D GAN-Based Eyewear Personalization for 3D Gaussian Blendshapes Head Avatars

GlassesGB: 可控的基于GAN的2D眼镜个性化技术用于3D高斯混合形状头虚拟角色

Rui-Yang Ju, Jen-Shiun Chiang

机构 * Kyoto University(京都大学) Tamkang University(Tamkang 大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 GlassesGB结合GAN与3D高斯混合形状技术,实现可控的2D眼镜个性化生成,用于3D头虚拟角色的定制化设计。

Comments IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16429 2026-01-26 cs.CV cs.AI 57%

AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose

AlphaFace: 高保真和实时的面部交换器,对面部姿态具有鲁棒性

Jongmin Yu, Hyeontaek Oh, Zhongtian Sun, Angelica I Aviles-Rivero, Moongu Jeon, Jinhong Yang

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Tsinghua University(清华大学) Gwangju Institute of Science and Technology(全州科学技术院) Inje University(庆北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlphaFace通过结合视觉-语言模型和CLIP嵌入,实现高保真和实时的面部交换,提升对极端面部姿态的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10250 2026-01-26 cs.CV 57%

GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection

GAMMA: 通过多任务和操控增强训练实现通用对齐的AI生成图像检测

Haozhen Yan, Yan Hong, Suning Lang, Jiahui Zhan, Yikun Ji, Yujie Gao, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 GAMMA通过多任务和操控增强训练,提升AI生成图像检测的泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11074 2026-01-21 cs.CV 57%

Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image

评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式

Matthias Humt, Ulrich Hillenbrand, Rudolph Triebel

机构 * German Aerospace Center(德国航空航天中心) TU Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。

Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10117 2026-01-16 cs.CV 57%

Beyond Single Prompts: Synergistic Fusion and Arrangement for VICL

超越单一提示:协同融合与排列用于VICL

Wenwen Liao, Jianbo Yu, Yuansong Wang, Shifu Yan, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Microelectronics, Fudan University(微电子学院,复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ByteDance Ltd.(字节跳动有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出一种端到端的VICL框架,通过自适应融合模块和排列特定MLP,解决单一提示选择和结构信息利用的问题,提升跨任务的修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09255 2026-01-15 cs.CV 57%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08193 2026-01-14 cs.CV 57%

Unified Multi-Site Multi-Sequence Brain MRI Harmonization Enriched by Biomedical Semantic Style

统一多站点多序列脑部MRI谐调增强生物医学语义风格

Mengqi Wu, Yongheng Sun, Qianqian Wang, Pew-Thian Yap, Mingxia Liu

机构 * Department of Radiology and Biomedical Research Imaging Center (BRIC), University of North Carolina at Chapel Hill(放射科与生物医学研究成像中心(BRIC)、北卡罗来纳大学教堂山分校) Lampe Joint Department of Biomedical Engineering, University of North Carolina at Chapel Hill and North Carolina State University(Lampe联合生物医学工程部门、北卡罗来纳大学教堂山分校和北卡罗来纳州立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MMH通过生物医学语义先验实现多站点多序列脑部MRI谐调,有效分离风格与解剖结构,提升图像一致性与下游任务性能。

Comments 15 pages, 10 figures. Extended version of a paper published at MICCAI 2025 (DOI: 10.1007/978-3-032-04947-6_65)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07660 2026-01-13 cs.CV 57%

StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation

StdGEN++: 一种用于语义分解3D人物生成的综合性系统

Yuze He, Yanning Zhou, Wang Zhao, Jingwen Ye, Zhongkai Wu, Ran Yi, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tencent AIPD(腾讯AIPD) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 StdGEN++是一种基于双分支语义感知模型的综合性系统,通过语义分解和高效生成技术,实现高保真3D人物生成,适用于自动化角色资产生产。

Comments 13 pages, 12 figures. Extended version of CVPR 2025 paper arXiv:2411.05738

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05246 2026-01-09 cs.CV 57%

Pixel-Perfect Visual Geometry Estimation

像素级视觉几何估计

Gangwei Xu, Haotong Lin, Hongcheng Luo, Haiyang Sun, Bing Wang, Guang Chen, Sida Peng, Hangjun Ye, Xin Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Xiaomi EV(小米电动车)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。

Comments Code: https://github.com/gangweix/pixel-perfect-depth

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10688 2026-01-09 cs.CV 57%

Novel View Synthesis using DDIM Inversion

基于DDIM反向的新型视图合成

Sehajdeep Singh, A V Subramanyam, Aditya Gupta, Sahil Gupta

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔大学信息科技学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于DDIM反向的轻量级视图合成方法,利用预训练扩散模型生成高质量新视角重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03517 2026-01-08 cs.CV 57%

Semantic Belief-State World Model for 3D Human Motion Prediction

语义信念状态世界模型用于3D人体运动预测

Sarim Chaudhry

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出语义信念状态世界模型,通过将人体视为世界模型状态空间的一部分,实现更稳定的长期运动预测与模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02646 2026-01-07 cs.CV cs.AI 57%

DreamLoop: Controllable Cinemagraph Generation from a Single Photograph

DreamLoop:从单张照片生成可控的cinemagraph

Aniruddha Mahapatra, Long Mai, Cusuh Ham, Feng Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。

Comments Project Page: https://anime26398.github.io/dreamloop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 57%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23537 2026-01-05 cs.CV cs.AI 57%

AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization

AnyMS: 从下到上注意力解耦用于布局引导和无训练多主体定制

Binhe Yu, Zhen Wang, Kexin Li, Yuqian Yuan, Wenqiao Zhang, Long Chen, Juncheng Li, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Zhejiang Tobacco Monopoly Administration(浙江烟草专卖局)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnyMS通过从下到上的双层注意力解耦机制,实现无训练的布局引导多主体定制,有效解决文本对齐、主体身份保持和布局控制的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25075 2026-01-01 cs.CV cs.AI cs.RO 57%

SpaceTimePilot: Generative Rendering of Dynamic Scenes Across Space and Time

SpaceTimePilot: 动态场景在时空上的生成渲染

Zhening Huang, Hyeonho Jeong, Xuelin Chen, Yulia Gryaditskaya, Tuanfeng Y. Wang, Joan Lasenby, Chun-Hao Huang

机构 * University of Cambridge(剑桥大学) Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SpaceTimePilot通过解耦空间和时间实现动态场景的可控生成渲染,结合时序扭曲训练和CamxTime数据集提升时间控制精度。

Comments Project page: https://zheninghuang.github.io/Space-Time-Pilot/ Code: https://github.com/ZheningHuang/spacetimepilot

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03119 2026-01-01 cs.CV 57%

Controllable Human-centric Keyframe Interpolation with Generative Prior

可控的人本关键帧插值与生成先验

Zujin Guo, Size Wu, Zhongang Cai, Wei Li, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PoseFuse3D-KI框架,通过整合3D人体指导信号提升关键帧插值的可控性和保真度,实验表明其在PSNR和LPIPS指标上均优于现有方法。

Comments Project Page: https://gseancdat.github.io/projects/PoseFuse3D_KI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22464 2025-12-30 cs.CV cs.RO 57%

Pose-Guided Residual Refinement for Interpretable Text-to-Motion Generation and Editing

姿态引导的残差细化用于可解释的文本到运动生成与编辑

Sukhyun Jeong, Yong-Hoon Choi

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 姿态引导的残差细化(PGR$^2$M)通过结合可解释姿态代码和残差代码提升文本到运动生成与编辑的保真度和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20619 2025-12-29 cs.CV 57%

SemanticGen: Video Generation in Semantic Space

SemanticGen: 语义空间中的视频生成

Jianhong Bai, Xiaoshi Wu, Xintao Wang, Xiao Fu, Yuanxing Zhang, Qinghe Wang, Xiaoyu Shi, Menghan Xia, Zuozhu Liu, Haoji Hu, Pengfei Wan, Kun Gai

机构 * Zhejiang University(浙江大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) CUHK(香港中文大学) DLUT(大连理工大学) HUST(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SemanticGen通过在语义空间中生成视频,提高了长视频生成的效率和质量,优于现有方法。

Comments Project page: https://jianhongbai.github.io/SemanticGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19661 2025-12-23 cs.CV 57%

Over++: Generative Video Compositing for Layer Interaction Effects

Over++:用于层交互效果的生成视频合成

Luchao Qi, Jiaye Wu, Jun Myeong Choi, Cary Phillips, Roni Sengupta, Dan B Goldman

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland(马里兰大学) Industrial Light & Magic(工业光魔)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Over++是一种生成视频合成方法,通过文本提示和输入视频层生成逼真的环境效果,同时保留原始场景,无需假设相机姿态或深度信息。

Comments Project page: https://overplusplus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20431 2025-12-23 cs.CV cs.RO 57%

BRIC: Bridging Kinematic Plans and Physical Control at Test Time

BRIC: 在测试时弥合运动计划与物理控制之间的差距

Dohun Lim, Minji Kim, Jaewoon Lim, Sungchan Kim

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BRIC通过结合测试时适应与轻量级引导机制,实现长期人体运动生成的物理合理性和一致性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13031 2025-12-23 cs.CV 57%

Towards 3D Object-Centric Feature Learning for Semantic Scene Completion

面向语义场景补全的3D物体感知特征学习

Weihua Wang, Yubo Cui, Xiangru Lin, Zhiheng Li, Zheng Fang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ocean框架,通过分解场景为独立物体实例,提升语义场景补全的精度和性能。

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 57%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17040 2025-12-22 cs.CV 57%

Infinite-Homography as Robust Conditioning for Camera-Controlled Video Generation

无限透视作为摄像机控制的鲁棒条件化方法用于摄像机控制的视频生成

Min-Jung Kim, Jeongho Kim, Hoiyeong Jin, Junha Hyung, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InfCam通过无限透视变形和数据增强管道,实现高姿态保真度的摄像机控制视频生成,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14280 2025-12-22 cs.CV 57%

EasyHOI: Unleashing the Power of Large Models for Reconstructing Hand-Object Interactions in the Wild

EasyHOI: 释放大模型潜力以重建真实场景中的手-物体交互

Yumeng Liu, Xiaoxiao Long, Zemin Yang, Yuan Liu, Marc Habermann, Christian Theobalt, Yuexin Ma, Wenping Wang

机构 * The University of Hong Kong(香港大学) ShanghaiTech University(上海科技大学) Hong Kong University of Science and Technology(香港科学大学) Nanyang Technological University(南洋理工大学) Max Planck Institute for Informatics(马克斯·普朗克研究所(信息学)) Texas A&M University(德克萨斯大学奥斯汀分校)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 EasyHOI利用大模型实现单视角下手-物体交互的重建,通过先验引导优化提升重建精度。

Comments Project page: https://lym29.github.io/EasyHOI-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16913 2025-12-19 cs.CV 57%

Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation

全景深度估计的基础模型:Depth Any Panoramas

Xin Lin, Meixi Song, Dizhe Zhang, Wenxuan Lu, Haodong Li, Bo Du, Ming-Hsuan Yang, Truong Nguyen, Lu Qi

机构 * Insta360 Research(Insta360研究院) University of California, San Diego(加州大学圣地亚哥分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种全景深度估计的基础模型,通过三阶段伪标签流程和优化方法提升模型在不同场景下的鲁棒性和泛化能力。

Comments Project Page: https://insta360-research-team.github.io/DAP_website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12998 2025-12-19 cs.CV 57%

PerTouch: VLM-Driven Agent for Personalized and Semantic Image Retouching

PerTouch:基于VLM的个性化和语义图像润色代理

Zewei Chang, Zheng-Peng Duan, Jianxing Zhang, Chun-Le Guo, Siyu Liu, Hyungju Chun, Hyunhee Park, Zikun Liu, Chongyi Li

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PerTouch通过VLM驱动代理实现个性化和语义图像润色,结合语义替换与参数扰动机制,提升用户意图匹配与长期偏好捕捉能力。

Comments To appear at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15524 2025-12-18 cs.CV 57%

DeX-Portrait: Disentangled and Expressive Portrait Animation via Explicit and Latent Motion Representations

DeX-Portrait: 通过显式和潜在运动表示实现解耦且表达性的肖像动画

Yuxiang Shi, Zhe Li, Yanwen Wang, Hao Zhu, Xun Cao, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Central Media Technology Institute, Huawei(华为中央媒体技术研究所) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DeX-Portrait通过显式和潜在运动表示生成解耦且表达性的肖像动画,提升动画质量和可控性。

Comments Projectpage: https://syx132.github.io/DeX-Portrait/

详情

展开后加载摘要…

URL PDF HTML 收藏