arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4233 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4233 篇

2504.09588 2025-08-22 cs.CV cs.AI 57%

TextSplat: Text-Guided Semantic Fusion for Generalizable Gaussian Splatting

Zhicong Wu, Hongbin Xu, Gang Xu, Ping Nie, Zhixin Yan, Jinkai Zheng, Liangqiong Qu, Ming Li, Liqiang Nie

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) Guangdong Laboratory of Artificial Intelligence(广东省人工智能与数字经济实验室) Peking University(北京大学) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Hangzhou Dianzi University(杭州电子科技大学) Central Laboratory of Lishui Hospital of Wenzhou Medical University, The First Affiliated Hospital of Lishui University, Lishui People's Hospital(丽水市人民医院中央实验室、丽水大学第一附属医院、丽水人民医院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14814 2025-08-21 cs.CV cs.AI 57%

TransLight: Image-Guided Customized Lighting Control with Generative Decoupling

Zongming Li, Lianghui Zhu, Haocheng Shen, Longjin Ran, Wenyu Liu, Xinggang Wang

机构 * OpenAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13738 2025-08-20 cs.GR 57%

Eliminating Rasterization: Direct Vector Floor Plan Generation with DiffPlanner

Shidong Wang, Renato Pajarola

专题命中 可控生成 :diffusion(abstract);分类 cs.GR

Comments accepted to IEEE Transactions on Visualization and Computer Graphics

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13153 2025-08-19 cs.CV 57%

IGFuse: Interactive 3D Gaussian Scene Reconstruction via Multi-Scans Fusion

Wenhao Hu, Zesheng Li, Haonan Zhou, Liu Liu, Xuexiang Wen, Zhizhong Su, Xi Li, Gaoang Wang

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Project page: https://whhu7.github.io/IGFuse

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19183 2025-08-19 cs.CV 57%

Segmenting Objectiveness and Task-awareness Unknown Region for Autonomous Driving

Mi Zheng, Guanglei Yang, Zitong Huang, Zhenhua Guo, Kevin Han, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tianyijiaotong Technology Ltd.(天翼交通科技有限公司) Independent Researcher(独立研究者)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11256 2025-08-18 cs.CV cs.AI 57%

Generalized Decoupled Learning for Enhancing Open-Vocabulary Dense Perception

Junjie Wang, Keyu Chen, Yulin Li, Bin Chen, Hengshuang Zhao, Xiaojuan Qi, Zhuotao Tian

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments arXiv admin note: text overlap with arXiv:2505.04410

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10397 2025-08-15 cs.CV cs.AI 57%

PQ-DAF: Pose-driven Quality-controlled Data Augmentation for Data-scarce Driver Distraction Detection

Haibin Sun, Xinghui Song

机构 * College of Computer Science and Engineering, Shandong University of Science and Technology(计算机科学与工程学院,山东科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08588 2025-08-13 cs.CV eess.IV 57%

RealisMotion: Decomposed Human Motion Control and Video Generation in the World Space

Jingyun Liang, Jingkai Zhou, Shikai Li, Chenjie Cao, Lei Sun, Yichen Qian, Weihua Chen, Fan Wang

机构 * DAMO Academy, Alibaba Group(阿里达摩院) Hupan Lab(华盘实验室) INSAIT Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Project page: https://jingyunliang.github.io/RealisMotion

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16868 2025-08-12 cs.IT cs.AI cs.CV math.IT 57%

Codebook-enabled Generative End-to-end Semantic Communication Powered by Transformer

Peigen Ye, Yaping Sun, Shumin Yao, Hao Chen, Xiaodong Xu, Shuguang Cui

机构 * The Shenzhen Campus of Sun Yat-sen University, Sun Yat-sen University, Shenzhen, China(中山大学深圳校区,中山大学,深圳,中国) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) SSE, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学深圳校区,香港中文大学,深圳,中国) Beijing University of Posts(北京邮电大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments IEEE INFOCOM PerAI6G 2024(accepted)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20471 2025-08-08 cs.CV cs.AI cs.ET cs.LG cs.RO 57%

WeatherEdit: Controllable Weather Editing with 4D Gaussian Field

Chenghao Qian, Wenjing Li, Yuhu Guo, Gustav Markkula

机构 * University of Leeds(利兹大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16948 2025-08-08 cs.CV 57%

Follow-Your-Color: Multi-Instance Sketch Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Qifeng Chen, Zeyu Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06510 2025-08-08 cs.CV cs.AI 57%

AnomalyControl: Learning Cross-modal Semantic Features for Controllable Anomaly Synthesis

Shidan He, Lei Liu, Xiujun Shu, Bo Wang, Yuanhao Feng, Shen Zhao

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03069 2025-08-08 cs.CV cs.AI 57%

TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation

Liao Qu, Huichao Zhang, Yiheng Liu, Xu Wang, Yi Jiang, Yiming Gao, Hu Ye, Daniel K. Du, Zehuan Yuan, Xinglong Wu

机构 * ByteDance(字节跳动)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments CVPR 2025; Code and models: https://github.com/ByteVisionLab/TokenFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03754 2025-08-07 cs.CV 57%

Generating Synthetic Invoices via Layout-Preserving Content Replacement

Bevin V, Ananthakrishnan P, Ragesh KR, Sanjay M, Vineeth S, Bibin Wilson

机构 * BEO AI Address(BEO AI)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03691 2025-08-06 cs.CV cs.RO 57%

La La LiDAR: Large-Scale Layout Generation from LiDAR Data

Youquan Liu, Lingdong Kong, Weidong Yang, Xin Li, Ao Liang, Runnan Chen, Ben Fei, Tongliang Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Preprint; 10 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03690 2025-08-06 cs.CV cs.RO 57%

Veila: Panoramic LiDAR Generation from a Monocular RGB Image

Youquan Liu, Lingdong Kong, Weidong Yang, Ao Liang, Jianxiong Gao, Yang Wu, Xiang Xu, Xin Li, Linfeng Li, Runnan Chen, Ben Fei

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Preprint; 10 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03669 2025-08-06 cs.CV cs.RO 57%

OmniShape: Zero-Shot Multi-Hypothesis Shape and Pose Estimation in the Real World

Katherine Liu, Sergey Zakharov, Dian Chen, Takuya Ikeda, Greg Shakhnarovich, Adrien Gaidon, Rares Ambrus

机构 * Toyota Research Institute(丰田研究院) Woven by Toyota(丰田编织) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 8 pages, 5 figures. This version has typo fixes on top of the version published at ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01650 2025-08-05 cs.CV 57%

StrandDesigner: Towards Practical Strand Generation with Sketch Guidance

Na Zhang, Moran Li, Chengming Xu, Han Feng, Xiaobin Hu, Jiangning Zhang, Weijian Cao, Chengjie Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Tencent YouTu Lab(腾讯YouTu实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted to ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01152 2025-08-05 cs.CV 57%

LawDIS: Language-Window-based Controllable Dichotomous Image Segmentation

Xinyu Yan, Meijun Sun, Ge-Peng Ji, Fahad Shahbaz Khan, Salman Khan, Deng-Ping Fan

机构 * Tianjin University(天津大学) Tianjin Key Laboratory of Machine Learning(天津机器学习重点实验室) Australian National University(澳大利亚国立大学) Nankai Institute of Advanced Research (SHENZHEN FUTIAN)(南开先进研究院(深圳福田)) Nankai University(南开大学) MBZUAI

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 17 pages, 10 figures, ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23309 2025-08-05 cs.CV 57%

PriorFusion: Unified Integration of Priors for Robust Road Perception in Autonomous Driving

Xuewei Tang, Mengmeng Yang, Tuopu Wen, Peijin Jia, Le Cui, Mingshang Luo, Kehua Sheng, Bo Zhang, Diange Yang, Kun Jiang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00698 2025-08-05 cs.CV 57%

Rectifying Magnitude Neglect in Linear Attention

Qihang Fan, Huaibo Huang, Yuang Ai, Ran He

机构 * MAIS & NLPR, Institute of Automation, Chinese Academy of Sciences(自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ICCV2025, highlight paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06957 2025-08-05 cs.CV 57%

GAS: Generative Avatar Synthesis from a Single Image

Yixing Lu, Junting Dong, Youngjoong Kwon, Qin Zhao, Bo Dai, Fernando De la Torre

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai AI Laboratory(上海人工智能实验室) Stanford University(斯坦福大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025; Project Page: https://humansensinglab.github.io/GAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00299 2025-08-04 cs.CV cs.AI cs.RO 57%

Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence

Danzhen Fu, Jiagao Hu, Daiguo Zhou, Fei Wang, Zepeng Wang, Wenhua Liao

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments ICCV 2025 Workshop (HiGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23487 2025-08-01 cs.CV cs.RO 57%

Online Estimation of Table-Top Grown Strawberry Mass in Field Conditions with Occlusions

Jinshan Zhen, Yuanyue Ge, Tianxiao Zhu, Hui Zhao, Ya Xiong

机构 * The Intelligent Equipment Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农业林业科学研究院智能装备研究中心) The College of Electrical Engineering and Automation, Tianjin University of Technology(天津理工大学电气与自动化学院) The College of Mechatronic Engineering and Automation, Shanghai University(上海大学机电工程与自动化学院)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV 57%

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21371 2025-07-30 cs.CV 57%

Top2Pano: Learning to Generate Indoor Panoramas from Top-Down View

Zitong Zhang, Suranjan Gautam, Rui Yu

机构 * University of Louisville(路易斯维尔大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments ICCV 2025. Project page: https://top2pano.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21367 2025-07-30 cs.CV 57%

Exploring Probabilistic Modeling Beyond Domain Generalization for Semantic Segmentation

I-Hsiang Chen, Hua-En Chang, Wei-Ting Chen, Jenq-Neng Hwang, Sy-Yen Kuo

机构 * National Taiwan University(台湾大学) University of Washington(华盛顿大学) Microsoft(微软) Chang Gung University(长庚大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments Accepted by ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20855 2025-07-29 cs.CV 57%

Compositional Video Synthesis by Temporal Object-Centric Learning

Adil Kaan Akan, Yucel Yemez

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

Comments 12+21 pages, submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19950 2025-07-29 cs.CV cs.AI 57%

RARE: Refine Any Registration of Pairwise Point Clouds via Zero-Shot Learning

Chengyu Zheng, Jin Huang, Honghua Chen, Mingqiang Wei

机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Shenzhen Research Institute, Nanjing University of Aeronautics and Astronautics(南京航空航天大学深圳研究院) School of Data Science, Lingnan University(岭南大学数据科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21771 2025-07-29 cs.CV 57%

A Unified Image-Dense Annotation Generation Model for Underwater Scenes

Hongkai Lin, Dingkang Liang, Zhenghao Qi, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

Comments Accepted by CVPR 2025. The code is available at https://github.com/HongkLin/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏