arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-10 至 2026-02-10 共收录 145 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 11 篇

2602.06159 2026-02-10 cs.CV 57%

Driving with DINO: Vision Foundation Features as a Unified Bridge for Sim-to-Real Generation in Autonomous Driving

驾驶用DINO:作为自动驾驶仿真到现实生成的统一桥梁的视觉基础特征

Xuyang Chen, Conglang Zhang, Chuanheng Fu, Zihao Yang, Kaixuan Zhou, Yizhi Zhang, Jianan He, Yanfeng Zhang, Mingwei Sun, Zengmao Wang, Zhen Dong, Xiaoxiao Long, Liqiu Meng

机构 * Technical University of Munich(慕尼黑技术大学) Huawei Hilbert Research Center(华为希利伯特研究中心) Huawei Riemann Lab(华为里曼实验室) Wuhan University(武汉大学) University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DwD通过利用视觉基础模块特征作为统一桥梁,解决自动驾驶仿真到现实生成中的现实性与真实性困境,提升控制精度与时间稳定性。

Comments Project website https://albertchen98.github.io/DwD-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08068 2026-02-10 cs.CV 57%

ReRoPE: Repurposing RoPE for Relative Camera Control

ReRoPE:将RoPE用于相对相机控制

Chunyang Li, Yuanbo Yang, Jiahao Shao, Hongyu Zhou, Katja Schwarz, Yiyi Liao

机构 * Zhejiang University(浙江大学) Independent Researcher(独立研究者)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 ReRoPE通过将RoPE用于相对相机控制,实现可控视频生成,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09009 2026-02-10 cs.LG cs.AI 50%

ANCRe: Adaptive Neural Connection Reassignment for Efficient Depth Scaling

ANCRe: 适应性神经连接重新分配用于高效的深度扩展

Yilang Zhang, Bingcong Li, Niao He, Georgios B. Giannakis

机构 * University of Minnesota(明尼苏达大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ANCRe通过适应性神经连接重新分配,有效提升深度扩展效率,加速收敛并提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08830 2026-02-10 cs.HC 50%

Enhancing Generative AI Image Refinement with Scribbles and Annotations: A Comparative Study of Multimodal Prompts

通过草图和注释增强生成式AI图像细化:多模态提示的比较研究

Hyerim Park, Phuong Thao Tran, Andre Luckow, Ceenu George, Michael Sedlmair, Malin Eiband

专题命中 可控生成 :inpainting(abstract)

AI总结 本研究通过比较多模态提示,探讨草图和注释如何提升生成式AI图像细化,提出原型并揭示设计师在多模态策略中的偏好。

Comments 22 pages, 14 figures. Preprint of an accepted IUI '26 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08012 2026-02-10 cs.LG 50%

A Unified Density Operator View of Flow Control and Merging

流控与融合的统一密度算子视角

Riccardo De Santi, Malte Franke, Ya-Ping Hsieh, Andreas Krause

机构 * ETH Zürich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种统一的概率空间框架,通过奖励引导的流融合方法,实现流控与融合的统一处理,并在分子设计和构象生成中展示了其应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07525 2026-02-10 cs.IR 50%

IGMiRAG: Intuition-Guided Retrieval-Augmented Generation with Adaptive Mining of In-Depth Memory

IGMiRAG: 基于直觉引导的检索增强生成与深度记忆适应性挖掘

Xingliang Hou, Yuyan Liu, Qi Sun, haoxiu wang, Hao Hu, Shaoyi Du, Zhiqiang Tian

专题命中 可控生成 :diffusion(abstract)

AI总结 IGMiRAG通过直觉引导的检索增强生成框架,结合超图和演绎路径,提升多粒度知识对齐和深度记忆挖掘,实现更高效有效的生成性能。

Comments 29 pages, Information Retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07439 2026-02-10 cs.RO cs.AI 50%

TextOp: Real-time Interactive Text-Driven Humanoid Robot Motion Generation and Control

TextOp: 人形机器人实时交互文本驱动动作生成与控制

Weiji Xie, Jiakun Zheng, Jinrui Han, Jiyuan Shi, Weinan Zhang, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) Shanghai Jiao Tong University(上海交通大学) East China University of Science and Technology(东华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 TextOp通过实时文本驱动框架实现人形机器人灵活的动作生成与控制,支持流式指令和即时修改,实现实时交互与自主性平衡。

Comments Project Page: https://text-op.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23154 2026-02-10 math.OC 50%

Control of the Fisher-Stefan system

Fisher-Stefan系统的控制

Idriss Boutaayamou, Fouad Et-tahri, Lahcen Maniar, Francisco Periago

专题命中 可控生成 :diffusion(abstract)

AI总结 本文通过将Fisher-Stefan问题转化为非线性系统的局部零可控性,利用Lyusternik-Graves定理实现了轨迹的局部精确可控性,并通过PINNs方法进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2409.06714 2026-02-10 eess.IV cs.CV 88%

FCDM: A Physics-Guided Bidirectional Frequency Aware Convolution and Diffusion-Based Model for Sinogram Inpainting

FCDM:一种基于物理的双向频率感知卷积和扩散模型用于sinogram修复

Jiaze E, Srutarshi Banerjee, Tekin Bicer, Guannan Wang, Yanfu Zhang, Bin Ren

机构 * Argonne National Laboratory, USA(阿贡国家实验室)

专题命中 图像修复 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 FCDM是一种基于物理的双向频率感知卷积和扩散模型,用于修复sinogram,通过结合双向频率推理、角感知掩码和物理引导正则化,提升全局结构和物理合理性的保持能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08395 2026-02-10 cs.CV 57%

D$^2$-VR: Degradation-Robust and Distilled Video Restoration with Synergistic Optimization Strategy

D$^2$-VR: 降质鲁棒且蒸馏的视频修复与协同优化策略

Jianfeng Liang, Shaocheng Shen, Botao Xu, Qiang Hu, Xiaoyun Zhang

机构 * Shanghai Jiaotong University(上海交通大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 D$^2$-VR通过降质鲁棒流对齐和对抗蒸馏技术,实现低步推理的视频修复,提升修复质量和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08538 2026-02-10 eess.IV cs.LG 50%

Trajectory Stitching for Solving Inverse Problems with Flow-Based Models

轨迹拼接用于基于流模型的逆问题求解

Alexander Denker, Moshe Eliasof, Zeljko Kereta, Carola-Bibiane Schönlieb

机构 * University College London(伦敦大学学院) University of Cambridge(剑桥大学)

专题命中 图像修复 :inpainting(abstract)

AI总结 MS-Flow通过轨迹拼接方法优化逆问题求解,减少内存消耗并提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 4 篇

2602.07554 2026-02-10 cs.CV 89%

FlexID: Training-Free Flexible Identity Injection via Intent-Aware Modulation for Text-to-Image Generation

FlexID: 无训练灵活身份注入 via 意图感知调制 for 文本到图像生成

Guandong Li, Yijun Ding

机构 * iFLYTEK

专题命中 个性化与一致性 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 FlexID通过意图感知调制实现无训练灵活身份注入,提升文本到图像生成中身份保真度与文本适应性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08775 2026-02-10 cs.CV cs.CG 57%

VedicTHG: Symbolic Vedic Computation for Low-Resource Talking-Head Generation in Educational Avatars

VedicTHG: 用于教育拟人化角色中低资源语音生成的符号吠陀计算

Vineet Kumar Rakesh, Ahana Bhattacharjee, Soumya Mazumdar, Tapas Samanta, Hemendra Kumar Pandey, Amitabha Das, Sarbajit Pal

机构 * Engineering Sciences, Homi Bhabha National Institute Training School Complex(工程科学,霍米·巴哈瓦国家研究所培训学校复杂区) Computer and Informatics Group, Variable Energy Cyclotron Centre(计算机与信息组,变能回旋加速器中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 VedicTHG通过符号吠陀计算在CPU上实现低资源谈话头生成,减少计算负载和延迟,提升教育拟人化角色的实用性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07564 2026-02-10 cs.CV 57%

SIGMA: Selective-Interleaved Generation with Multi-Attribute Tokens

SIGMA: 带多属性标记的选择性交错生成

Xiaoyan Zhang, Zechen Bai, Haofan Wang, Yiren Song

机构 * Creatly AI University of Michigan(密歇根大学) Lovart AI National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 SIGMA通过引入多属性标记实现多条件生成,提升可控性、一致性和视觉质量,优于Bagel在组合任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07498 2026-02-10 cs.CV 57%

IM-Animation: An Implicit Motion Representation for Identity-decoupled Character Animation

IM-Animation: 一种隐式运动表示用于身份解耦的角色动画

Zhufeng Xu, Xuan Gao, Feng-Lin Liu, Haoxian Zhang, Zhixue Fang, Yu-Kun Lai, Xiaoqiang Liu, Pengfei Wan, Lin Gao

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Cardiff University(卡迪夫大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 IM-Animation通过隐式运动表示和时间一致的遮罩令牌重定向模块,实现身份解耦的角色动画生成,提升动画质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2602.07814 2026-02-10 cs.CV cs.AI 57%

How well are open sourced AI-generated image detection models out-of-the-box: A comprehensive benchmark study

开源生成图像检测模型的即插即用性能如何:一项全面的基准研究

Simiao Ren, Yuchen Zhou, Xingyu Shen, Kidus Zewde, Tommy Duong, George Huang, Hatsanai, Tiangratanakul, Tsang, Ng, En Wei, Jiayu Xue

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文评估了16种最新图像检测模型的即插即用性能,发现无统一最佳模型,训练数据对齐影响显著,现代生成器性能优异,揭示了跨数据集泛化中的系统性故障模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01666 2026-02-10 cs.CV 57%

Moonworks Lunara Aesthetic II: An Image Variation Dataset

月光作品 Lunara 美学 II:一个图像变化数据集

Yan Wang, Partho Hassan, Samiha Sadeka, Nada Soliman, Sayeef Abdullah, Sabit Hassan

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Lunara Aesthetic II 是一个用于评估图像生成和编辑系统中上下文一致性的公开数据集,通过保持身份的上下文变换提供监督信号,具有高美学评分和稳定的身份特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02115 2026-02-10 eess.AS 50%

Pronunciation Editing for Finnish Speech using Phonetic Posteriorgrams

使用音素后验图进行芬兰语语音编辑

Zirui Li, Lauri Juvela, Mikko Kurimo

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出PPG2Speech模型,通过音素后验图编辑生成接近二语语音,适用于资源有限语言如芬兰语的语音合成与编辑。

Comments Accepted by Proceeding of 13th edition of the Speech Synthesis Workshop; 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 7 篇

2602.09014 2026-02-10 cs.CV cs.AI 86%

ArcFlow: Unleashing 2-Step Text-to-Image Generation via High-Precision Non-Linear Flow Distillation

ArcFlow:通过高精度非线性流蒸馏实现两步文本到图像生成

Zihan Yang, Shuyuan Tu, Licheng Zhang, Qi Dai, Yu-Gang Jiang, Zuxuan Wu

机构 * Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 效率与蒸馏 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 ArcFlow通过高精度非线性流蒸馏实现两步文本到图像生成,提升生成速度并保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09024 2026-02-10 cs.CV 76%

Autoregressive Image Generation with Masked Bit Modeling

基于掩码位建模的自回归图像生成

Qihang Yu, Qihao Liu, Ju He, Xinyang Zhang, Yang Liu, Liang-Chieh Chen, Xi Chen

机构 * Amazon FAR (Frontier AI \& Robotics)

专题命中 效率与蒸馏 :image generation(title);分类 cs.CV;diffusion(comments)

AI总结 本文提出基于掩码位建模的自回归框架,通过扩大代码本大小有效缩小离散与连续方法的性能差距,实现更高效的图像生成。

Comments SOTA discrete visual generation defeats diffusion models with 0.99 FID score, project page is available at https://bar-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03442 2026-02-10 cs.CV 70%

MAMBO-G: Magnitude-Aware Mitigation for Boosted Guidance

MAMBO-G:基于幅度的提升引导抑制

Shangwen Zhu, Qianyu Peng, Zhilei Shu, Yuting Hu, Zhantao Yang, Han Zhang, Zhao Pu, Andy Zheng, Xinyu Cui, Jian Zhao, Ruili Feng, Fan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) University of Waterloo(滑铁卢大学) Chinese Academy of Sciences(中国科学院) Zhongguancun Academy(中关村学院)

专题命中 效率与蒸馏 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 MAMBO-G通过动态优化引导幅度,显著降低计算成本,实现视频生成任务的高效加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07056 2026-02-10 eess.IV cs.AI cs.CV 57%

MTS-CSNet: Multiscale Tensor Factorization for Deep Compressive Sensing on RGB Images

MTS-CSNet: 多尺度张量分解用于RGB图像的深度压缩感知

Mehmet Yamac, Lei Xu, Serkan Kiranyaz, Moncef Gabbouj

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 MTS-CSNet通过多尺度张量分解实现高效RGB图像压缩感知,提供更优的重建性能和更快的推理速度。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11236 2026-02-10 cs.DS cs.LG math.PR stat.ML 50%

Improved sampling algorithms and functional inequalities for non-log-concave distributions

改进的采样算法与非对数凹分布的函数不等式

Yuchen He, Zhehan Lei, Jianan Shao, Chihao Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文改进了非对数凹分布采样算法,通过加强假设获得更优的查询复杂度和Poincaré常数界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07873 2026-02-10 cs.LG cs.AI 50%

Direct Soft-Policy Sampling via Langevin Dynamics

通过 Langevin 动力学实现直接软策略采样

Donghyeon Ki, Hee-Jun Ahn, Kyungyoon Kim, Byung-Jun Lee

机构 * Department of Artificial Intelligence, Korea University, Seoul, Republic of Korea(韩国大学人工智能系) Gauss Labs Inc(Gauss实验室)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 通过引入噪声条件化的 Langevin 动力学,NC-LQL 实现了高效的软策略采样,提升了在线强化学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21608 2026-02-10 cs.LG 50%

Generalised Flow Maps for Few-Step Generative Modelling on Riemannian Manifolds

广义流映射用于黎曼流形上的少步生成建模

Oscar Davis, Michael S. Albergo, Nicholas M. Boffi, Michael M. Bronstein, Avishek Joey Bose

机构 * University of Oxford(牛津大学) Harvard University(哈佛大学) Kempner Institute(凯普纳研究所) Institute for Artificial Intelligence and Fundamental Interactions, MIT(人工智能与基本相互作用研究所,MIT) Carnegie Mellon University(卡内基梅隆大学) AITHYRA(AITHYRA研究所) Mila(Mila研究所) Imperial College London(伦敦帝国学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出广义流映射(GFM)用于黎曼流形上的少步生成建模,通过自蒸馏方法提升现有生成模型性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏