arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2506.17201 2025-06-23 cs.CV 57%

Hunyuan-GameCraft: High-dynamic Interactive Game Video Generation with Hybrid History Condition

Jiaqi Li, Junshu Tang, Zhiyong Xu, Longhuang Wu, Yuan Zhou, Shuai Shao, Tianbao Yu, Zhiguo Cao, Qinglin Lu

机构 * Tencent Hunyuan(腾讯 Hunyuan)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://hunyuan-gamecraft.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16852 2025-06-23 cs.CV 57%

Controllable and Expressive One-Shot Video Head Swapping

Chaonan Ji, Jinwei Qi, Peng Zhang, Bang Zhang, Liefeng Bo

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://humanaigc.github.io/SwapAnyHead/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16730 2025-06-23 cs.CV 57%

TeSG: Textual Semantic Guidance for Infrared and Visible Image Fusion

Mingrui Zhu, Xiru Chen, Xin Wei, Nannan Wang, Xinbo Gao

机构 * Xidian University(西电大学) Chongqing University of Post and Telecommunications(重庆邮电大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11302 2025-06-23 cs.CV cs.AI 57%

TARDIS STRIDE: A Spatio-Temporal Road Image Dataset and World Model for Autonomy

Héctor Carrión, Yutong Bai, Víctor A. Hernández Castro, Kishan Panaganti, Ayush Zenith, Matthew Trang, Tony Zhang, Pietro Perona, Jitendra Malik

机构 * Tera AI UC Santa Cruz(加州大学圣克ruz分校) UC Berkeley(加州大学伯克利分校) California Institute of Technology(加州理工学院)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments Computer Vision, Pattern Recognition, Early-Fusion, Dataset, Data Augmentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06679 2025-06-18 cs.CV 57%

T2V-OptJail: Discrete Prompt Optimization for Text-to-Video Jailbreak Attacks

Jiayang Liu, Siyuan Liang, Shiqian Zhao, Rongcheng Tu, Wenbo Zhou, Aishan Liu, Dacheng Tao, Siew Kei Lam

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09323 2025-06-17 cs.CV 57%

T-SVG: Text-Driven Stereoscopic Video Generation

Qiao Jin, Xiaodong Chen, Wu Liu, Tao Mei, Yongdong Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hidream Inc.(海dream公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18458 2025-06-17 eess.IV cs.CV cs.LG physics.med-ph 57%

A robust and scalable framework for hallucination detection in virtual tissue staining and digital pathology

Luzhe Huang, Yuzhu Li, Nir Pillar, Tal Keidar Haran, William Dean Wallace, Aydogan Ozcan

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments 45 Pages, 22 Figures, 2 Tables

Journal ref Nature Biomedical Engineering (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13238 2025-06-17 cs.CV 57%

Learning Coherent Matrixized Representation in Latent Space for Volumetric 4D Generation

Qitong Yang, Mingtao Feng, Zijie Wu, Shijie Sun, Weisheng Dong, Yaonan Wang, Ajmal Mian

机构 * School of Artificial Intelligence(人工智能学院) School of Information Engineering(信息工程学院) School of Electrical and Information Engineering(电气与信息工程学院) Computer Science and Software Engineering(计算机科学与软件工程) The University of Western Australia(西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03082 2025-06-16 cs.CV 57%

SG2VID: Scene Graphs Enable Fine-Grained Control for Video Synthesis

Ssharvien Kumar Sivakumar, Yannik Frisch, Ghazal Ghazaei, Anirban Mukhopadhyay

机构 * Technical University Darmstadt(达姆施塔特技术大学) Universitätsmedizin der Johannes Gutenberg-Universität Mainz(美因茨约翰尼斯·古滕贝格大学医学中心) Carl Zeiss AG(蔡司股份公司)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15939 2025-06-16 cs.CV 57%

Diversifying Human Pose in Synthetic Data for Aerial-view Human Detection

Yi-Ting Shen, Hyungtae Lee, Heesung Kwon, Shuvra S. Bhattacharyya

机构 * University of Maryland, College Park(马里兰大学 College Park分校) BlueHalo DEVCOM Army Research Laboratory(国防部陆军研究实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16160 2025-06-12 cs.CV 57%

MIMO: Controllable Character Video Synthesis with Spatial Decomposed Modeling

Yifang Men, Yuan Yao, Miaomiao Cui, Liefeng Bo

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project Page: https://menyifang.github.io/projects/MIMO/index.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07740 2025-06-10 cs.CV 57%

Flow-Anything: Learning Real-World Optical Flow Estimation from Large-Scale Single-view Images

Yingping Liang, Ying Fu, Yutao Hu, Wenqi Shao, Jiaming Liu, Debing Zhang

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学) School of Computer Science and Engineering, Southeast University(计算机科学与工程学院,东南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tiamat AI Xiaohongshu(小红书)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18417 2025-06-10 cs.CV 57%

GHOST 2.0: generative high-fidelity one shot transfer of heads

Alexander Groshev, Anastasiia Iashchenko, Pavel Paramonov, Denis Dimitrov, Andrey Kuznetsov

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05338 2025-06-09 cs.CV 57%

Defurnishing with X-Ray Vision: Joint Removal of Furniture from Panoramas and Mesh

Alan Dolhasz, Chen Ma, Dave Gausebeck, Kevin Chen, Gregor Miller, Lucas Hayne, Gunnar Hovden, Azwad Sabik, Olaf Brandt, Mira Slavcheva

机构 * Matterport

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Paper website: https://matterport.github.io/defurnishing-with-x-ray-vision/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05554 2025-06-09 cs.CV 57%

EX-4D: EXtreme Viewpoint 4D Video Synthesis via Depth Watertight Mesh

Tao Hu, Haoyang Peng, Xiao Liu, Yuewen Ma

机构 * Pico, Bytedance(字节跳动)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05217 2025-06-06 cs.CV 57%

DSG-World: Learning a 3D Gaussian World Model from Dual State Videos

Wenhao Hu, Xuexiang Wen, Xi Li, Gaoang Wang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZJU-UIUC Institute, Zhejiang University(浙江大学-伊利诺伊大学联合研究所)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04612 2025-06-06 cs.CV 57%

Perfecting Depth: Uncertainty-Aware Enhancement of Metric Depth

Jinyoung Jun, Lei Chu, Jiahao Li, Yan Lu, Chang-Su Kim

机构 * Korea University(韩国大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04606 2025-06-06 cs.CV 57%

SmartAvatar: Text- and Image-Guided Human Avatar Generation with VLM AI Agents

Alexander Huang-Menders, Xinhang Liu, Andy Xu, Yuyao Zhang, Chi-Keung Tang, Yu-Wing Tai

机构 * The Hong Kong University of Science and Technology(香港科技大学) Dartmouth College(达特茅斯学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14184 2025-06-06 cs.CV cs.LG 57%

Bayesian SegNet for Semantic Segmentation with Improved Interpretation of Microstructural Evolution During Irradiation of Materials

Marjolein Oostrom, Alex Hagen, Nicole LaHaye, Karl Pazdernik

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) North Carolina State University(北卡罗来纳州立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03191 2025-06-05 cs.CV cs.AI 57%

Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward

Muhammad Islam, Tao Huang, Euijoon Ahn, Usman Naseem

机构 * College of Science and Engineering(科学与工程学院) James Cook University(詹姆斯库克大学) School of Computing(计算学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02697 2025-06-04 cs.CV 57%

LayoutRAG: Retrieval-Augmented Model for Content-agnostic Conditional Layout Generation

Yuxuan Wu, Le Wang, Sanping Zhou, Mengnan Liu, Gang Hua, Haoxiang Li

机构 * Xi’an Jiaotong University(西安交通大学) Amazon.com, Inc.(亚马逊公司) Pixocial Technology(Pixocial技术)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20156 2025-06-04 cs.CV 57%

HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

Yi Chen, Sen Liang, Zixiang Zhou, Ziyao Huang, Yifeng Ma, Junshu Tang, Qin Lin, Yuan Zhou, Qinglin Lu

机构 * Tencent(腾讯)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20218 2025-06-04 cs.CV 57%

Video Motion Graphs

Haiyang Liu, Zhan Xu, Fa-Ting Hong, Hsin-Ping Huang, Yi Zhou, Yang Zhou

机构 * The University of Tokyo(东京大学) Adobe Research(Adobe研究)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 14 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03498 2025-06-04 eess.IV cs.GR 57%

Controllable Satellite-to-Street-View Synthesis with Precise Pose Alignment and Zero-Shot Environmental Control

Xianghui Ze, Zhenbo Song, Qiwei Wang, Jianfeng Lu, Yujiao Shi

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01037 2025-06-03 cs.CV 57%

Self-supervised ControlNet with Spatio-Temporal Mamba for Real-world Video Super-resolution

Shijun Shi, Jing Xu, Lijing Lu, Zhihang Li, Kai Hu

机构 * Jiangnan University(江南大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 10 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00173 2025-06-03 cs.GR cs.RO 57%

MotionPersona: Characteristics-aware Locomotion Control

Mingyi Shi, Wei Liu, Jidong Mei, Wangpok Tse, Rui Chen, Xuelin Chen, Taku Komura

机构 * The University of Hong Kong(香港大学) Shandong University(山东大学) Hong Kong University of Science and Technology(香港科技大学) Adobe Research

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments 15 pages, 13 figures, webpage: https://motionpersona25.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02980 2025-06-02 cs.CV 57%

GPT4Point: A Unified Framework for Point-Language Understanding and Generation

Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23439 2025-05-30 cs.CV 57%

VITON-DRR: Details Retention Virtual Try-on via Non-rigid Registration

Ben Li, Minqi Li, Jie Ren, Kaibing Zhang

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

Comments 31 pages, 12 figures, Accepted by Computers & Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23192 2025-05-30 cs.CV cs.AI cs.CR 57%

Fooling the Watchers: Breaking AIGC Detectors via Semantic Prompt Attacks

Run Hao, Peng Ying

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01427 2025-05-29 cs.CV 57%

VideoAnydoor: High-fidelity Video Object Insertion with Precise Motion Control

Yuanpeng Tu, Hao Luo, Xi Chen, Sihui Ji, Xiang Bai, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) HUST(华中科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by SIGGRAPH2025 Project page: https://videoanydoor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏