arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4229 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4229 篇

2603.25357 2026-03-27 cs.CV 57%

InstanceAnimator: Multi-Instance Sketch Video Colorization

Yinhan Zhang, Yue Ma, Bingyuan Wang, Kunyu Feng, Yeying Jin, Qifeng Chen, Anyi Rao, Zeyu Wang

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) NUS(新加坡国立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23381 2026-03-25 cs.CV 57%

FG-Portrait: 3D Flow Guided Editable Portrait Animation

FG-Portrait: 基于3D流的可编辑肖像动画

Yating Xu, Yunqi Miao, Evangelos Ververas, Jiankang Deng, Jifei Song

机构 * National University of Singapore(新加坡国立大学) University of Warwick(沃里克大学) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出FG-Portrait,通过3D流引导的方法实现高质量的肖像动画生成,结合3D几何信息和扩散模型,提升驱动运动与源肖像的对应精度,并支持用户对表情和头部姿态的编辑。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV 57%

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21786 2026-03-24 cs.CV eess.IV 57%

The Universal Normal Embedding

通用正态嵌入

Chen Tasker, Roy Betser, Eyal Gofer, Meir Yossef Levi, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出通用正态嵌入假设,通过实验验证编码器和生成模型共享的高斯潜在空间,展示其在属性预测和可控编辑中的应用。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01583 2026-03-24 cs.CV 57%

3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting

3DSceneEditor: 基于高斯散射的可控3D场景编辑

Ziyang Yan, Yihua Shao, Minwen Liao, Siyu Chen, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao, Fabio Remondino, Lei Li

机构 * D Optical Metrology unit, Fondazione Bruno Kessler(3D光学测绘单元,布鲁诺·凯斯勒基金会) Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出3DSceneEditor,通过高斯散射实现高效精准的3D场景编辑,整合实例分割模型与CLIP实现语义对齐,支持对象添加、重定位等操作,实验表明其在精度和效率上优于现有方法。

Comments Accepted by WACV 2026, Project Page: https://ziyangyan.github.io/3DSceneEditor

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21998 2026-03-24 cs.CV cs.RO 57%

Causal World Modeling for Robot Control

机器人控制中的因果世界建模

Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui Yu, Zelin Gao, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LingBot-VA框架,通过视频世界建模与视觉语言预训练结合,实现机器人学习的新基础。模型包含共享潜在空间、闭环回滚机制和异步推理流程,提升了长周期操作和数据效率。

Comments Project page: https://technology.robbyant.com/lingbot-va Code: https://github.com/robbyant/lingbot-va

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11474 2026-03-24 cs.CV 57%

HUG-VAS: A Hierarchical NURBS-Based Generative Model for Aortic Geometry Synthesis and Controllable Editing

HUG-VAS:一种基于层次NURBS的生成模型用于主动脉几何合成与可控编辑

Pan Du, Mingqi Xu, Xiaozhi Zhu, Jian-xun Wang

机构 * Department of Aerospace and Mechanical Engineering, University of Notre Dame(notre dame 大学航空航天与机械工程系) Sibley School of Mechanical and Aerospace Engineering, Cornell University(cornell 大学机械与航空航天工程学院) Department of Applied and Computational Mathematics and Statistics, University of Notre Dame(notre dame 大学应用与计算数学与统计学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 HUG-VAS通过结合NURBS参数化与层次扩散模型,实现主动脉几何的精细合成与可控编辑,支持零样本生成与临床应用。

Comments 64 pages, 9 figures, 6 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19795 2026-03-23 cs.CV 57%

Controllable Text-to-Motion Generation via Modular Body-Part Phase Control

通过模块化身体部位相控实现可控的文本到运动生成

Minyue Dai, Ke Fan, Anyi Rao, Jingbo Wang, Bo Dai

机构 * Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) HKUST(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出模块化身体部位相控方法,通过紧凑的标量相界面实现局部化编辑,保留运动整体一致性,提供可控的文本到运动生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19667 2026-03-23 cs.CV cs.AI 57%

Toward High-Fidelity Visual Reconstruction: From EEG-Based Conditioned Generation to Joint-Modal Guided Rebuilding

迈向高保真视觉重建:从基于EEG的条件生成到联合模态引导重建

Zhijian Gong, Tianren Yao, Wenjia Dong, Xueyuan Xu

机构 * Beijing University of Technology, Beijing(北京理工大学) Beijing Key Laboratory of Computational Intelligence and Intelligent System, Beijing(北京计算智能与智能系统重点实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出联合模态视觉重建框架,通过独立学习EEG和文本信息,提升EEG特征的重建能力,结合多尺度编码和图像增强,实现高保真视觉重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19547 2026-03-23 cs.CV 57%

SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification

SeeClear: 通过生成性消透明实现可靠的透明物体深度估计

Xiaoying Wang, Yumeng He, Jingkai Shi, Jiayin Lu, Yin Yang, Ying Jiang, Chenfanfu Jiang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SeeClear通过生成性消透明技术,将透明物体转换为几何一致的不透明图像,从而提升单目深度估计的稳定性与准确性。

Comments Project page: https://heyumeng.com/SeeClear-web/. 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18427 2026-03-20 cs.CV cs.AI 57%

R&D: Balancing Reliability and Diversity in Synthetic Data Augmentation for Semantic Segmentation

R&D: 在语义分割中平衡可靠性与多样性以合成数据增强

Huy Che, Dinh-Duy Phan, Duc-Khai Lam

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息科技学院) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一种整合可控扩散模型的合成数据增强方法,通过类感知提示和视觉先验融合提升图像质量,有效提升语义分割性能,尤其在数据稀缺场景中表现优异。

Journal ref Computational Collective Intelligence, ICCCI 2025, Lecture Notes in Computer Science 16139 (2026) 433-448

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16098 2026-03-20 cs.CV cs.AI 57%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 57%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16711 2026-03-19 cs.CV 57%

Search2Motion: Training-Free Object-Level Motion Control via Attention-Consensus Search

Search2Motion: 基于注意力-共识搜索的无训练物体级运动控制

Sainan Liu, Tz-Ying Wu, Hector A Valdez, Subarna Tripathi

机构 * Intel Corporation(英特尔公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Search2Motion通过注意力-共识搜索实现无训练的物体级运动编辑,利用首尾帧运动先验保持场景稳定性,引入ACE-Seed策略提升运动保真度,提出新的评估指标验证其优越性。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15026 2026-03-19 cs.CV cs.LG 57%

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

无需训练的生成视频检测方法:时空似然方法

Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17117 2026-03-19 cs.CV 57%

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

MosaicMem: 用于可控视频世界模型的混合空间记忆

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The University of Osaka(大阪大学) Georgia Institute of Technology(佐治亚理工学院) Mujin Inc.(Mujin公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) Taiyuan University of Technology(太原本科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。

Comments Project Page: https://mosaicmem.github.io/mosaicmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI 57%

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16871 2026-03-18 cs.CV 57%

WorldCam: Interactive Autoregressive 3D Gaming Worlds with Camera Pose as a Unifying Geometric Representation

WorldCam: 交互式自回归3D游戏世界与相机姿态作为统一的几何表示

Jisu Nam, Yicong Hong, Chun-Hao Paul Huang, Feng Liu, JoungBin Lee, Jiyoung Kim, Siyoon Jin, Yunsung Lee, Jaeyoon Jung, Suhwan Choi, Seungryong Kim, Yang Zhou

机构 * Adobe Research(Adobe研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出WorldCam,通过将相机姿态作为统一的几何表示,解决交互式游戏世界中动作控制与长时序3D一致性问题,结合物理连续动作空间和全局相机姿态索引提升导航与视觉质量。

Comments Project page is available at https://cvlab-kaist.github.io/WorldCam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16373 2026-03-18 cs.CV 57%

Semantic One-Dimensional Tokenizer for Image Reconstruction and Generation

语义一维分词器用于图像重建与生成

Yunpeng Qu, Kaidong Zhang, Yukang Ding, Ying Chen, Jian Wang

机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。

Comments 18 pages,12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16362 2026-03-18 cs.CV cs.AI 57%

$D^3$-RSMDE: 40$\times$ Faster and High-Fidelity Remote Sensing Monocular Depth Estimation

$D^3$-RSMDE:40倍更快且高保真度的遥感单目深度估计

Ruizhi Wang, Weihan Li, Zunlei Feng, Haofei Zhang, Mingli Song, Jiayu Wang, Jie Song, Li Sun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出$D^3$-RSMDE框架,结合ViT快速生成初步深度图并利用轻量级U-Net进行细节优化,实现高效高保真度的遥感单目深度估计,比现有方法快40倍且LPIPS指标降低11.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16188 2026-03-18 cs.CV 57%

ECHO: Edge-Cloud Humanoid Orchestration for Language-to-Motion Control

ECHO:边缘-云计算人形机器人语言到动作控制

Haozhe Jia, Jianfei Song, Yuan Zhang, Honglei Jin, Youcheng Fan, Wenshuo Chen, Wei Zhang, Yutao Yue

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LimX Dynamics Technology Co., Ltd.(LimX动力技术有限公司) Shandong University(山东大学) Institute of Deep Perception Technology, Jiangsu Industrial Technology Research Institute (JITRI)(江苏工业技术研究院深度感知技术研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ECHO提出边缘-云计算框架,通过云端扩散模型生成自然语言指令对应动作,边缘设备通过强化学习跟踪执行,采用紧凑的机器人本征动作表示实现高效控制,实现实时动作生成与安全执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16169 2026-03-18 cs.CV 57%

Gaze-guided Hand-Object Interaction Synthesis: Dataset and Method

引导注视的手-物体交互合成:数据集与方法

Jie Tian, Ran Ji, Lingxiao Yang, Suting Ni, Yuexin Ma, Lan Xu, Jingyi Yu, Ye Shi, Jingya Wang

机构 * School of Information Science and Technology, ShanghaiTech University(信息科学与技术学院,上海科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出 gaze-guided 手-物体交互合成任务,引入首个捕捉 gaze、手和物体交互的 GazeHOI 数据集,并提出 GHO-Diffusion 模型以解决高一致性与物理合理性问题。

Comments Accepted by IEEE Transactions on Multimedia (TMM), 2026. Project Page: https://takiee.github.io/gaze-hoi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15555 2026-03-17 cs.CV 57%

Learning Latent Proxies for Controllable Single-Image Relighting

学习可控的单图像照明代理

Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li, Xiaogang Xu, Harry Yang

机构 * HKUST(香港科技大学) HKPolyU(香港理工大学) CUHK(香港中文大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出LightCtrl,通过物理先验和稀疏提示实现可控单图像照明,利用DPO优化和ScaLight数据集提升光照控制精度与PSNR表现。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18333 2026-03-17 cs.CV 57%

ConsistCompose: Unified Multimodal Layout Control for Image Composition

ConsistCompose:统一的多模态布局控制用于图像合成

Xuanke Shi, Boxuan Li, Xiaoyang Han, Zhongang Cai, Lei Yang, Quan Wang, Dahua Lin

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ConsistCompose通过将布局坐标直接嵌入语言提示,实现布局可控的多实例图像生成,并构建了3.4M的多实例生成数据集,提升了布局控制的精度和多模态理解能力。

Comments Accepted to CVPR 2026; 23 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14151 2026-03-17 cs.CV 57%

Seeing Through the PRISM: Compound & Controllable Restoration of Scientific Images

通过PRISM:科学图像的复合与可控恢复

Rupa Kurinchi-Vendhan, Pratyusha Sharma, Antonio Torralba, Sara Beery

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PRISM通过结合复合感知监督和加权对比度解纠缠目标,实现科学图像中复杂退化的同时恢复,支持通过自然语言提示选择性修复,提升下游科学准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏