arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4228 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4228 篇

2605.12624 2026-05-15 cs.RO cs.CV 57%

MindVLA-U1: VLA Beats VA with Unified Streaming Architecture for Autonomous Driving

MindVLA-U1:统一流架构使VLA超越VA用于自动驾驶

Yuzhou Huang, Benjin Zhu, Hengtong Lu, Victor Shea-Jay Huang, Haiming Zhang, Wei Chen, Jifeng Dai, Yan Xie, Hongsheng Li

机构 * CUHK MMLab(香港中文大学多模态实验室) Li Auto Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MindVLA-U1通过统一流架构实现自动驾驶中VLA超越VA,采用统一视觉语言模型骨干和流匹配连续动作轨迹,在保持各模态自然输出形式的同时,实现高效规划和低延迟。

Comments Work in progress. Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14935 2026-05-15 cs.CV 57%

Multi-scale Coarse-to-fine Modeling for Test-time Human Motion Control

多尺度粗到细建模用于测试时的人体运动控制

Nhat Le, Daochang Liu, Anh Nguyen, Ajmal Mian

机构 * The University of Western Australia(西澳大学) The University of Liverpool(利物浦大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出MSCoT模型,通过多尺度粗到细方法实现测试时的人体运动合成与控制,采用高效多尺度令牌引导策略提升控制精度与效率,实验显示其在运动质量和控制准确性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14815 2026-05-15 cs.CV 57%

Probing into Camera Control of Video Models

探究视频模型的摄像机控制

Chen Hou, Christian Rupprecht

机构 * Visual Geometry Group University of Oxford(视觉几何组牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通过几何引导而非隐式映射实现摄像机控制,有效提升视频生成模型的几何表现力,并揭示了基础模型的摄像机控制偏见与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14626 2026-05-15 cs.CV 57%

UniTriGen: Unified Triplet Generation of Aligned Visible-Infrared-Label for Few-Shot RGB-T Semantic Segmentation

UniTriGen: 一致的可见-红外-标签三元组生成用于少样本RGB-T语义分割

Ping Zhou, Haoyu Wang, Mengmeng Zheng, Lei Zhang, Wei Wei, Chen Ding, Fei Zhou

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) School of Computer Science & Technology, Xi’an University of Posts & Telecommunications(西安邮电大学计算机科学与技术学院) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTriGen提出统一三元组生成框架,通过共享潜在空间和扩散过程生成一致的可见-红外-标签三元组,解决少样本RGB-T语义分割中的对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09304 2026-05-15 cs.CV 57%

GeRM: A Generative Rendering Model From Physically Realistic to Photorealistic

GeRM:从物理真实到照片级的生成渲染模型

Jiayuan Lu, Rengan Xie, Xuancheng Jin, Zhizhen Wu, Qi Ye, Tian Xie, Hujun Bao, Rui Wang. Yuchi Huo

机构 * State Key Lab of CAD\&CG, Zhejiang University Zhejiang Lab China State Key Laboratory of Industrial Control Technology, Zhejiang University China Zhejiang University China Zhejiang Lab State Key Laboratory of Industrial Control Technology, Zhejiang University Zhejiang University

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 GeRM是首个多模态生成渲染模型,通过学习分布转移向量场实现从物理真实到照片级的过渡,结合控制网络和多代理框架提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14135 2026-05-15 cs.CV 57%

PanoPlane: Plane-Aware Panoramic Completion for Sparse-View Indoor 3D Gaussian Splatting

PanoPlane:基于平面感知的稀疏视角室内3D高斯散点完成

Adil Qureshi, Dongki Jung, Jaehoon Choi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PanoPlane通过全景场景完成重建封闭房间几何,利用360度全景完成条件生成过程,通过Layout Anchored Attention Steering机制引导扩散模型注意力至检测到的平面表面,实现基于几何一致性的表面外推,提升稀疏视角下的新型视图合成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04667 2026-05-14 cs.CV cs.LG cs.RO 57%

ZeD-MAP: Bundle Adjustment Guided Zero-Shot Depth Maps for Real-Time Aerial Imaging

ZeD-MAP:基于束调整的零样本深度图用于实时航拍成像

Selim Ahmet Iz, Francesco Nex, Norman Kerle, Henry Meissner, Ralf Berger

机构 * German Aerospace Center (DLR), Institute of Space Research(德国航空航天中心(DLR)空间研究所) Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(代尔夫特理工大学地理信息科学与地球观测学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ZeD-MAP框架,通过集成增量聚类束调整,将扩散深度模型转换为具有度量一致性的SLAM映射流程,实现高分辨率无人机影像的实时三维地图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12144 2026-05-13 cs.CV 57%

PoseCompass: Intelligent Synthetic Pose Selection for Visual Localization

PoseCompass: 用于视觉定位的智能合成姿态选择

Yanan Zhou, Zhaoyan Qian, Yanli Li, Nan Yang, Zhongliang Guo, Dong Yuan

机构 * The University of Sydney(悉尼大学) University of St Andrews(圣安德鲁大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoseCompass通过智能姿态选择提升基于3DGS的APR性能,减少适应时间并降低姿态误差,优于随机基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11276 2026-05-13 cs.CV cs.AI 57%

Generative AI for Visualizing Highway Construction Hazards Through Synthetic Images and Temporal Sequences

生成AI用于通过合成图像和时间序列可视化公路施工危险

Trevor Neece, Mason Smetana, Lev Khazanovich

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出利用生成AI从OSHA严重伤害报告中生成合成图像和时间序列,以可视化公路施工危险,通过CLIP检索和专家评估验证了其教育价值和真实性,为安全培训提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10523 2026-05-12 cs.CV 57%

Improving Human Image Animation via Semantic Representation Alignment

通过语义表示对齐提升人类图像动画

Chang Liu, Mengting Chen, Yixuan Huang, Haoning Wu, Chen Ju, Shuai Xiao, Jinsong Lan, Yanfeng Wang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。

Comments Accepted by CVPR 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08321 2026-05-12 cs.CV 57%

UM-Text: A Unified Multimodal Model for Image Understanding and Visual Text Editing

UM-Text: 一种统一的多模态模型用于图像理解和视觉文本编辑

Lichen Ma, Xiaolong Fu, Gaojing Zhou, Zipeng Guo, Ting Zhu, Yichun Liu, Yu Shi, Jason Li, Junshi Huang

机构 * Sun Yat-sen University(中山大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UM-Text模型,通过自然语言指令实现图像理解和视觉文本编辑,引入VLM处理指令和参考图像,结合UM-Encoder生成风格一致的文本图像,并提出区域一致性损失和三阶段训练策略,最终在多个基准上取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09429 2026-05-12 cs.CV cs.AI 57%

Evading Visual Aphasia: Contrastive Adaptive Semantic Token Pruning for Vision-Language Models

逃避视觉失语:面向视觉-语言模型的对比自适应语义令牌修剪

Jie Ma, Yihang Liu, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun

机构 * Xiamen University(厦门大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出COAST方法,通过对比自适应语义路由实现视觉-语言模型的高效令牌修剪,减少77.8%的视觉令牌并提升2.15倍的推理速度,同时保持98.64%的原始性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21581 2026-05-12 cs.CV 57%

MultiAnimate: Pose-Guided Image Animation Made Extensible

MultiAnimate:基于姿态的图像动画使其可扩展

Yingcheng Hu, Haowen Gong, Chuanguang Yang, Zhulin An, Yongjun Xu, Songhua Liu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) ShanghaiTech University(上海科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种可扩展的多人物图像动画框架,通过引入标识符分配器和标识符适配器,解决多人物场景中的身份混淆和不合理的遮挡问题,实现高质量多人物动画生成。

Comments CVPR2026 Accepted. Project page at https://hyc001.github.io/MultiAnimate/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09534 2026-05-12 cs.CV 57%

AUHead: Realistic Emotional Talking Head Generation via Action Units Control

AUHead: 通过动作单元控制实现逼真的情感谈话头生成

Jiayi Lyu, Leigang Qu, Wenjing Zhang, Hanyu Jiang, Kai Liu, Zhenglin Zhou, Xiaobo Xia, Jian Xue, Tat-Seng Chua

机构 * University of the Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日報網通信內容認知重點實驗室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AUHead方法,通过动作单元控制实现逼真的谈话头生成,解决现有方法在情感表达细腻度上的不足。

Comments https://openreview.net/forum?id=dmzlAUkulz&referrer=%5BAuthor%20Console%5D(%2Fgroup%3Fid%3DICLR.cc%2F2026%2FConference%2FAuthors%23your-submissions) Accepted at the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02169 2026-05-12 cs.CV cs.DC cs.LG 57%

Heterogeneous Model Fusion for Privacy-Aware Multi-Camera Surveillance via Synthetic Domain Adaptation

异构模型融合用于隐私保护多摄像头监控的合成领域适应

Peggy Joy Lu, Wei-Yu Chen, Yao-Tsung Huang, Vincent Shin-Mu Tseng

机构 * Department of Computer Science and Information Engineering, National Chung Cheng University(资讯工程系,国立 Chung Cheng 大学) Department of Computer Science, National Yang Ming Chiao Tung University(计算机科学系,国立阳明交通大学) National Center for High-Performance Computing(国家高速计算中心)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HeroCrystal框架,通过合成领域适应解决多摄像头目标检测中的隐私、类别不平衡和异构架构问题,提升定位精度并实现模型融合,实验表明其在多类别隐私保护设置下优于现有方法,mAP提升2.1%达33.4%。

Comments 42 pages, 13 figures. Published in Information Fusion (Elsevier). DOI: 10.1016/j.inffus.2026.104413

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06667 2026-05-08 cs.CV cs.AI cs.LG 57%

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam: 零样本联合摄像机和3D运动控制用于视频生成

Omar El Khalifi, Thomas Rossi, Oscar Fossey, Thibault Fouque, Ulysse Mizrahi, Philip Torr, Ivan Laptev, Fabio Pizzati, Baptiste Bellot-Gurlet

机构 * University of Oxford(牛津大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ActCam通过零样本方法实现视频生成中演员动作与摄像机轨迹的联合控制,通过几何一致的条件生成提升摄像机适应性和动作真实性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05377 2026-05-08 cs.CV 57%

Can Vision-Language Models Think from the Sky? Unifying UAV Reasoning and Generation

无人机视角下视觉语言模型能否思考?统一无人机推理与生成

Jintao Sun, Gangyi Ding, Donglin Di, Hu Zhang, Zhedong Zheng

机构 * Beijing Institute of Technology(北京理工大学) Harbin Institute of Technology(哈尔滨工业大学) CSIRO Data61(澳大利亚联邦科学与工业研究组织 Data61 分部) University of Macau(澳门大学)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出UAVReason数据集,用于研究无人机视角下的统一推理与生成,通过改进模型在高海拔场景下的表现,提升视觉语言模型在复杂环境中的能力。

Comments 21 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05781 2026-05-08 cs.CV cs.AI 57%

Steering Visual Generation in Unified Multimodal Models with Understanding Supervision

通过理解监督引导统一多模态模型的视觉生成

Zeyu Liu, Zanlin Ni, Yang Yue, Cheng Da, Huan Yang, Di Zhang, Kun Gai, Gao Huang

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手技术团队)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出UNO框架,通过将理解作为监督信号引导生成,提升多模态模型在图像生成与编辑中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05722 2026-05-08 cs.CV 57%

$\mathcal{B}^{3}$-Net: Controlled Posterior Bridge Learning for Multi-Task Dense Prediction

$\mathcal{B}^{3}$-Net:多任务密集预测中的受控后验桥学习

Meihua Zhou, Li Yang

机构 * Wannan Medical University(皖南医学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$\mathcal{B}^{3}$-Net,通过可靠性估计、后验桥构建和受限再分配机制,改进多任务密集预测中任务证据的显式建模,提升共享表征的可靠性。

Comments 14 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14209 2026-05-08 cs.CV cs.AI 57%

ChArtist: Generating Pictorial Charts with Unified Spatial and Subject Control

ChArtist:通过统一的空间和主题控制生成图像图表

Shishi Xiao, Tongyu Zhou, David Laidlaw, Gromit Yeuk-Yin Chan

机构 * Adobe Research(Adobe研究院) Brown University(布朗大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ChArtist通过统一的空间和主题控制生成图像图表,结合骨骼基空间控制和主题驱动控制,提升数据准确性与视觉美感。

Comments Project page: https://chartist-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00893 2026-05-05 cs.CV cs.AI cs.IR 57%

Retrieval-Guided Generation for Safer Histopathology Image Captioning

基于检索的生成用于更安全的病理科图像描述生成

Md. Enamul Hoq, Wataru Uegami, Saghir Alfasly, Ghazal Alabtah, Sahar Rahimi Malakshan, Armita Kazemi, Alex T. Schmitgen, Fred Prior, H. R. Tizhoosh

机构 * Kimia Lab, Department of Artificial Intelligence \& Informatics, Mayo Clinic, Rochester, MN, USA Department of Biomedical Informatics, University of Arkansas for Medical Sciences, Little Rock, AR, USA Lane Department of Computer Science Electrical Engineering, West Virginia University, Morgantown, WV, USA Department of Computer Science Engineering, Princeton University, Princeton, NJ, USA Department of Computer Sciences, University of Wisconsin--Madison, Madison, WI, USA

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出检索引导生成方法,通过总结相似病例的专家文本生成描述,提升病理图像描述的准确性与可靠性,实验表明其在语义对齐和诊断一致性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00605 2026-05-04 cs.CV 57%

Faithful Extreme Image Rescaling with Learnable Reversible Transformation and Semantic Priors

基于可学习可逆变换和语义先验的忠实极端图像放大

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Communications Engineering, Xi’an Jiaotong University(信息与通信工程学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FaithEIR框架,通过可学习可逆变换和语义先验提升极端图像放大的真实性与细节,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01955 2026-05-04 cs.CV cs.AI cs.LG 57%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28169 2026-05-01 cs.CV cs.AI cs.LG 57%

PhyCo: Learning Controllable Physical Priors for Generative Motion

PhyCo:学习可控制的物理先验以生成运动

Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) UC San Diego(圣地亚哥大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PhyCo通过整合物理可控的生成模型,实现了在视频生成中物理一致性和可控性的提升,无需模拟器或几何重建。

Comments CVPR 2026. Project Page: https://phyco-video.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13285 2026-04-30 cs.CV 57%

SkyReels-Text: Fine-Grained Font-Controllable Text Editing for Poster Design

SkyReels-Text: 精细可控字体文本编辑用于海报设计

Yunjie Yu, Jingchen Wu, Junchen Zhu, Chunze Lin, Guibin Chen

机构 * Skywork AI

专题命中 可控生成 :image editing(abstract);分类 cs.CV

AI总结 本文提出SkyReels-Text,一种可精细控制字体的文本编辑框架,支持多区域文本同时编辑,保留非编辑区域的视觉效果,无需字体标签或测试时微调,实现高质量字体控制。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23690 2026-04-29 cs.CV 57%

SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation

SynMotion: 语义-视觉适应用于运动定制视频生成

Shuai Tan, Biao Gong, Yujie Wei, Shiwei Zhang, Zhuoxin Liu, Ke Ma, Yan Wang, Kecheng Zheng, Xing Zhu, Yujun Shen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Ant Group(蚂蚁集团) Tongyi(通义) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Huazhong University of Science and Technology(华中科技大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMotion通过联合语义指导和视觉适应,解决视频生成中语义与视觉信息的平衡问题,提出双嵌入语义理解机制和参数高效运动适配器,提升运动细节和时间一致性。

Comments Project page: https://lucaria-academy.github.io/SynMotion/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06100 2026-04-29 cs.CV 57%

High-Precision Dichotomous Image Segmentation via Depth Integrity-Prior and Fine-Grained Patch Strategy

通过深度完整性先验和细粒度补丁策略实现高精度二元图像分割

Xianjie Liu, Keren Fu, Qijun Zhao

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) National Key Lab of Fundamental Science on Synthetic Vision, Sichuan University(合成视觉基础科学国家实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出PDFNet网络,结合深度完整性先验和细粒度补丁策略,通过融合RGB和伪深度特征提升二元图像分割精度,实现更高效的高精度分割效果。

Journal ref IEEE Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19019 2026-04-28 cs.CV 57%

TokenTrace: Multi-Concept Attribution through Watermarked Token Recovery

TokenTrace: 通过水印标记令牌恢复实现多概念归因

Li Zhang, Shruti Agarwal, John Collomosse, Pengtao Xie, Vishal Asnani

机构 * Adobe Research(Adobe研究院) University of California, San Diego(加州大学圣地亚哥分校) DECaDE, University of Surrey(Surrey大学DECaDE实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TokenTrace框架,通过在语义域中嵌入秘密签名,实现对生成图像中多个概念的鲁棒归因,实验表明其在单概念和多概念归因任务中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏