arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-10 至 2026-02-10 共收录 11 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2503.15147 2026-02-10 cs.GR 88%

PBR-Inspired Controllable Diffusion for Image Generation

受PBR启发的可控扩散用于图像生成

Bowen Xue, Giuseppe Claudio Guarnera, Shuang Zhao, Zahra Montazeri

专题命中 可控生成 :image generation(title,abstract);diffusion(title);text-to-image(abstract);分类 cs.GR

AI总结 本研究提出了一种受PBR启发的可控扩散方法,通过生成G-buffer实现对图像生成中几何布局和材质属性的精细控制,通过用户研究验证了其在文本引导图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08725 2026-02-10 cs.CV 79%

FusionEdit: Semantic Fusion and Attention Modulation for Training-Free Image Editing

FusionEdit: 基于语义融合与注意力调节的无训练图像编辑

Yongwen Lai, Chaoqun Wang, Shaobo Min

机构 * School of Artificial Intelligence, South China Normal University(人工智能学院,华南师范大学) University of Science and Technology of China(中国科学技术大学)

专题命中 可控生成 :image editing(title,abstract);分类 cs.CV

AI总结 FusionEdit通过语义融合与注意力调节实现无训练图像编辑,提升编辑精度与可控性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13786 2026-02-10 cs.SD cs.AI 78%

DegDiT: Controllable Audio Generation with Dynamic Event Graph Guided Diffusion Transformer

DegDiT:基于动态事件图引导的扩散变换器的可控音频生成

Yisu Liu, Chenxing Li, Wanqian Zhang, Wenfu Wang, Meng Yu, Ruibo Fu, Zheng Lin, Weiping Wang, Dong Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Tencent, AI Lab(腾讯AI实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 DegDiT通过动态事件图引导的扩散变换器框架,实现了开放式词汇可控音频生成,提升了生成音频的准确性和多样性。

Journal ref IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06159 2026-02-10 cs.CV 57%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Jianan He, Yanfeng Zhang, Mingwei Sun, Zengmao Wang, Zhen Dong, Xiaoxiao Long, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Project website https://albertchen98.github.io/DwD-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08068 2026-02-10 cs.CV 57%

ReRoPE: Repurposing RoPE for Relative Camera Control

ReRoPE:将RoPE用于相对相机控制

Chunyang Li, Yuanbo Yang, Jiahao Shao, Hongyu Zhou, Katja Schwarz, Yiyi Liao

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究者)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReRoPE通过将RoPE用于相对相机控制,实现可控视频生成,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09009 2026-02-10 cs.LG cs.AI 50%

ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling

ANCRe: 适应性神经连接重新分配用于高效的深度扩展

Yilang Zhang, Bingcong Li, Niao He, Georgios B. Giannakis

机构 * University of Minnesota(明尼苏达大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ANCRe通过适应性神经连接重新分配,有效提升深度扩展效率,加速收敛并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08830 2026-02-10 cs.HC 50%

Enhancing Generative AI Image Refinement with Scribbles and Annotations: A Comparative Study of Multimodal Prompts

通过草图和注释增强生成式AI图像细化:多模态提示的比较研究

Hyerim Park, Phuong Thao Tran, Andre Luckow, Ceenu George, Michael Sedlmair, Malin Eiband

专题命中 可控生成 :inpainting(abstract)

AI总结 本研究通过比较多模态提示,探讨草图和注释如何提升生成式AI图像细化,提出原型并揭示设计师在多模态策略中的偏好。

Comments 22 pages, 14 figures. Preprint of an accepted IUI '26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08012 2026-02-10 cs.LG 50%

A Unified Density Operator View of Flow Control and Merging

流控与融合的统一密度算子视角

Riccardo De Santi, Malte Franke, Ya-Ping Hsieh, Andreas Krause

机构 * ETH Zürich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种统一的概率空间框架,通过奖励引导的流融合方法,实现流控与融合的统一处理,并在分子设计和构象生成中展示了其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07525 2026-02-10 cs.IR 50%

IGMiRAG: Intuition-Guided Retrieval-Augmented Generation with Adaptive Mining of In-Depth Memory

IGMiRAG: 基于直觉引导的检索增强生成与深度记忆适应性挖掘

Xingliang Hou, Yuyan Liu, Qi Sun, haoxiu wang, Hao Hu, Shaoyi Du, Zhiqiang Tian

专题命中 可控生成 :diffusion(abstract)

AI总结 IGMiRAG通过直觉引导的检索增强生成框架,结合超图和演绎路径,提升多粒度知识对齐和深度记忆挖掘,实现更高效有效的生成性能。

Comments 29 pages, Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07439 2026-02-10 cs.RO cs.AI 50%

TextOp: Real-time Interactive Text-Driven Humanoid Robot Motion Generation and Control

TextOp: 人形机器人实时交互文本驱动动作生成与控制

Weiji Xie, Jiakun Zheng, Jinrui Han, Jiyuan Shi, Weinan Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 TextOp通过实时文本驱动框架实现人形机器人灵活的动作生成与控制,支持流式指令和即时修改,实现实时交互与自主性平衡。

Comments Project Page: https://text-op.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23154 2026-02-10 math.OC 50%

Control of the Fisher-Stefan system

Fisher-Stefan系统的控制

Idriss Boutaayamou, Fouad Et-tahri, Lahcen Maniar, Francisco Periago

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过将Fisher-Stefan问题转化为非线性系统的局部零可控性,利用Lyusternik-Graves定理实现了轨迹的局部精确可控性,并通过PINNs方法进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏