arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-03 至 2026-03-03 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2509.05285 2026-03-03 cs.GR cs.CV 81%

Improved 3D Scene Stylization via Text-Guided Generative Image Editing with Region-Based Control

通过文本引导的生成图像编辑与基于区域的控制改进3D场景风格化

Haruo Fujiwara, Yusuke Mukuta, Tatsuya Harada

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所)

专题命中 可控生成 :image editing(title);inpainting(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种改进的3D场景风格化方法,通过文本引导和基于区域的控制,提升风格一致性和视图一致性。

Comments Project Page: https://haruolabs.github.io/improved-gs-style-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01553 2026-03-03 cs.AI cs.LG 78%

State-Action Inpainting Diffuser for Continuous Control with Delay

具有延迟的连续控制状态-动作修复扩散器

Dongqi Han, Wei Wang, Enze Zhang, Dongsheng Li

机构 * University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiaotong University(上海交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 可控生成 :inpainting(title,abstract)

AI总结 SAID通过结合动力学学习和策略优化,提出了一种具有延迟的连续控制新方法,实现了最先进的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01478 2026-03-03 cs.NI 78%

Regularized Diffusion-based Contract Model for Covert Semantic Entropy Control in LAENets

基于正则化扩散的合同模型用于LAENets中的隐秘语义熵控制

Yansheng Liu, Jinbo Wen, Kun Zhu, Yang Zhang, Jiawen Kang

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文提出基于正则化扩散的合同模型,用于LAENets中的隐秘语义熵控制,通过调整语义抽象级别提升任务信息传输可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10061 2026-03-03 cs.GR cs.CV 62%

EchoMimicV2: Towards Striking, Simplified, and Semi-Body Human Animation

EchoMimicV2: 向更具冲击力、简化和半身的人体动画迈进

Rang Meng, Xingyu Zhang, Yuming Li, Chenguang Ma

机构 * Terminal Technology Department, Alipay, Ant Group(蚂蚁集团支付宝终端技术部)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 EchoMimicV2通过简化条件和引入新的Audio-Pose动态和谐化策略,实现了具有冲击力的半身人体动画,并提出了新的评估基准。

Comments CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14207 2026-03-03 cs.GR cs.CV 62%

Copy-Trasform-Paste: Zero-Shot Object-Object Alignment Guided by Vision-Language and Geometric Constraints

复制-变换-粘贴:由视觉-语言和几何约束引导的零样本物体-物体对齐

Rotem Gatenyo, Ohad Fried

机构 * Reichman University(雷查曼大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于视觉-语言和几何约束的零样本物体-物体对齐方法,通过可微分渲染器优化相对姿态,实现语义忠实且物理合理的3D对齐。

Comments GitHub Page: https://rotemgat.github.io/CopyTransformPaste/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02129 2026-03-03 cs.CV cs.AI 57%

LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation

LiftAvatar:基于运动空间的表达控制3D高斯人偶动画

Hualiang Wei, Shunran Jia, Jialun Liu, Wenhui Li

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01950 2026-03-03 cs.LG cs.CL cs.CV 57%

Semantic Similarity is a Spurious Measure of Comic Understanding: Lessons Learned from Hallucinations in a Benchmarking Experiment

语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训

Christopher Driggers-Ellis, Nachiketh Tibrewal, Rohit Bogulla, Harsh Khanna, Sangpil Youm, Christan Grant, Bonnie Dorr

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。

Comments 8 pages, 2 figures, 3 tables. Includes link to code

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25976 2026-03-03 cs.CV cs.AI q-bio.NC 57%

Brain-IT: Image Reconstruction from fMRI via Brain-Interaction Transformer

通过脑交互变换器从fMRI中进行图像重建

Roman Beliy, Amit Zalcher, Jonathan Kogman, Navve Wasserman, Michal Irani

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Brain-IT通过脑交互变换器从fMRI中实现高保真图像重建,结合高层语义和低层结构特征,提升重建精度与效率。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24365 2026-03-03 cs.CV cs.AI 57%

Uni-X: Mitigating Modality Conflict with a Two-End-Separated Architecture for Unified Multimodal Models

Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型

Jitai Hao, Hao Liu, Xinyan Xiao, Qiang Huang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Baidu Inc.(百度公司)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00443 2026-03-03 cs.CV 57%

SesaHand: Enhancing 3D Hand Reconstruction via Controllable Generation with Semantic and Structural Alignment

SesaHand: 通过语义和结构对齐可控生成增强3D手重建

Zhuoran Zhao, Xianghao Kong, Linlin Yang, Zheng Wei, Pan Hui, Anyi Rao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) Communication University of China(中国通信大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12811 2026-03-03 cs.CV cs.AI cs.LG 57%

Next Visual Granularity Generation

下一步视觉粒度生成

Yikai Wang, Zhouxia Wang, Zhonghua Wu, Qingyi Tao, Kang Liao, Chen Change Loy

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) SenseTime Research(商汤科技研究院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏