arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-25 至 2026-02-25 共收录 65 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2602.20672 2026-02-25 cs.CV 79%

BBQ-to-Image: Numeric Bounding Box and Qolor Control in Large-Scale Text-to-Image Models

BBQ-to-Image: 数字边界框与颜色控制在大规模文本到图像模型中

Eliran Kachlon, Alexander Visheratin, Nimrod Sarid, Tal Hacham, Eyal Gutflaish, Saar Huberman, Hezi Zisman, David Ruppin, Ron Mokady

机构 * BRIA AI(BRIA人工智能)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 BBQ-to-Image通过引入数字边界框和RGB三元组的直接条件生成,实现了对文本到图像模型中物体位置、大小和颜色的精确控制,提升了生成图像的准确性和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25774 2026-02-25 cs.CV cs.AI cs.LG 79%

PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models

PCPO:比例信用政策优化用于对齐图像生成模型

Jeongjae Lee, Jong Chul Ye

机构 * KAIST(韩国科学技术院)

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 PCPO通过稳定的目标重构和时间步重新加权,解决图像生成模型训练中的不稳定性问题,从而提升收敛速度和图像质量。

Comments 35 pages, 20 figures. ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17028 2026-02-25 cs.LG cs.AI 67%

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

通过Cauchy-Schwarz散度进行分布式视觉语言对齐

Wenzhe Yin, Zehao Xiao, Pan Zhou, Shujian Yu, Jiayi Shen, Jan-Jakob Sonke, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) The Arctic University of Norway(挪威北极大学) Singapore Management University(新加坡管理大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 本文提出CS-Aligner框架,通过整合Cauchy-Schwarz散度与互信息,实现更紧密的视觉语言分布对齐,提升跨模态生成与检索性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 49 篇

2602.20680 2026-02-25 cs.CR 88%

Vanishing Watermarks: Diffusion-Based Image Editing Undermines Robust Invisible Watermarking

消失的水印:基于扩散的图像编辑削弱了鲁棒的隐形水印

Fan Guo, Jiyu Kang, Qi Ming, Emily Davis, Finn Carter

专题命中 扩散模型 :diffusion(title,abstract);image editing(title);image generation(abstract)

AI总结 本文揭示基于扩散模型的图像编辑可有效消除鲁棒隐形水印,挑战现有水印技术的鲁棒性,需发展新策略应对生成模型带来的威胁。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16156 2026-02-25 cs.CV 83%

Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

可插拔剪枝与连续层蒸馏用于扩散变换器

Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20193 2026-02-25 cs.CR cs.AI 82%

When Backdoors Go Beyond Triggers: Semantic Drift in Diffusion Models Under Encoder Attacks

当后门超越触发器:在编码器攻击下扩散模型的语义漂移

Shenyang Chen, Liuwan Zhu

机构 * Google(谷歌) Electrical and Computer Engineering Department University of Hawai‘i at Mānoa(电气与计算机工程系,夏威夷大学马诺阿分校)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 研究揭示了在编码器攻击下扩散模型的语义漂移问题,提出SEMAX框架用于量化结构退化,强调几何审计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20752 2026-02-25 cs.CV cs.AI 79%

OrthoDiffusion: A Generalizable Multi-Task Diffusion Foundation Model for Musculoskeletal MRI Interpretation

OrthoDiffusion:一种通用的多任务扩散基础模型用于骨科MRI解释

Tian Lan, Lei Xu, Zimu Yuan, Shanggui Liu, Jiajun Liu, Jiaxin Liu, Weilai Xiang, Hongyu Yang, Dong Jiang, Jianxin Yin, Dingyu Wang

机构 * Center for Applied Statistics and School of Statistics(应用统计中心和统计学院) Renmin University of China(中国人民大学) Institute of Sports Medicine of Peking University(北京大学运动医学研究所) Beijing Key Laboratory of Research and Translation for Drugs and Medical Devices in Precision Diagnosis and Treatment of Sports Injuries(北京体育损伤精准诊断与治疗药物与医疗设备研究翻译重点实验室) State Key Laboratory of Virtual Reality Technology and Systems(虚拟现实技术与系统国家重点实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OrthoDiffusion是一种基于扩散的多任务基础模型,通过自监督学习在膝关节MRI上预训练,实现11种结构分割和8种异常检测,具有跨关节的高泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20583 2026-02-25 cs.CV 79%

PropFly: Learning to Propagate via On-the-Fly Supervision from Pre-trained Video Diffusion Models

PropFly: 通过预训练视频扩散模型的实时监督学习进行传播

Wonyong Seo, Jaeho Moon, Jaehyup Lee, Soo Ye Kim, Munchurl Kim

机构 * KAIST(韩国科学技术院) Kyungpook National University(庆北国立大学) Adobe Research(Adobe研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PropFly通过预训练视频扩散模型的实时监督学习,实现基于传播的视频编辑,无需配对数据集,提升编辑质量和一致性。

Comments The first two authors contributed equally to this work (equal contribution)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20577 2026-02-25 cs.CV 79%

Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion

高效的端到端自动驾驶:通过掩码视觉-语言-动作扩散

Jiaru Zhang, Manav Gagvani, Can Cui, Juntong Peng, Ruqi Zhang, Ziran Wang

机构 * Institute for Physical Artificial Intelligence (IPAI), Purdue University(物理人工智能研究所(IPAI)、普渡大学) College of Engineering, Purdue University(工程学院、普渡大学) Department of Computer Science, Purdue University(计算机科学系、普渡大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MVLAD-AD通过掩码视觉-语言-动作扩散模型,提升自动驾驶的效率与规划精度,实现高效且可解释的端到端自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21148 2026-02-25 cs.RO cs.MA 78%

A Micro-Macro Model of Encounter-Driven Information Diffusion in Robot Swarms

机器人群中基于相遇的信息扩散微宏模型

Davis S. Catherman, Carlo Pinciroli

机构 * Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种机器人群中基于相遇的信息扩散模型,通过微宏层次结构分析信息扩散动态,并通过模拟验证模型的有效性。

Comments 10 pages, 5 figures, published at ANTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20914 2026-02-25 physics.flu-dyn 78%

Advection-modulated gaseous diffusion through an orifice

通过孔口的气态扩散受对流调节

Mario Sánchez Sanz, Antonio L. Sánchez

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了通过孔口的气态扩散,考虑了对流和扩散的耦合效应,通过解析解和数值方法分析了不同Schmidt和Péclet数下的质量传输和压力分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15280 2026-02-25 math.OC 78%

Gradient Mittag-Leffler and strong stabilizability of time fractional diffusion processes

分数扩散过程的梯度Mittag-Leffler性和强可控性

Hanaa Zitane, Delfim F. M. Torres

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出了一种基于谱性质的直接方法,用于分数扩散过程的梯度稳定性分析,并通过算法实现状态梯度稳定,通过数值示例验证了方法的有效性。

Comments This is a preprint of a paper whose final and definite form is published in 'Journal of Mathematical Sciences' [https://link.springer.com/journal/10958]

Journal ref J. Math. Sci. (N.Y.) 290 (2025), no. 6 809--820

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20528 2026-02-25 cs.CL cs.LG 78%

Stop-Think-AutoRegress: Language Modeling with Latent Diffusion Planning

停止-思考-自动回归:结合潜在扩散规划的语言建模

Justin Lovelace, Christian Belardi, Sofian Zalouk, Adhitya Polavaram, Srivatsa Kundurthy, Kilian Q. Weinberger

机构 * Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 STAR-LDM通过引入思考阶段的潜在扩散规划,实现了更高效的全局规划和生成,显著提升了语言理解和叙事连贯性任务的表现。

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20473 2026-02-25 math.AP 78%

Global Existence for Reaction-diffusion Equations with State-Dependent Delay and Fast-growing Nonlinearities

具有状态依赖延迟和快速增长非线性项的反应扩散方程的全局存在性

Ruijing Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究了具有状态依赖延迟和快速增长非线性项的反应扩散方程的全局存在性,通过放松延迟函数的连续性假设,建立了在适当耗散型结构条件下问题的解的存在性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20422 2026-02-25 cs.AI cs.LG 78%

Diffusion Modulation via Environment Mechanism Modeling for Planning

通过环境机制建模进行扩散调制用于规划

Hanping Zhang, Yuhong Guo

机构 * School of Computer Science, Carleton University(计算机科学学院,卡尔顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过环境机制建模的扩散调制方法提升了离线强化学习中轨迹生成的准确性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20209 2026-02-25 q-bio.QM cs.LG 78%

Regressor-guided Diffusion Model for De Novo Peptide Sequencing with Explicit Mass Control

基于回归器的扩散模型用于从头肽序列生成与显式质量控制

Shaorong Chen, Jingbo Zhou, Jun Xia

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiffuNovo通过回归器引导的扩散模型实现从头肽序列生成,提供显式质量控制,提升DNPS的准确性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15796 2026-02-25 cs.LG cs.AI q-bio.BM 78%

Monte Carlo Tree Diffusion with Multiple Experts for Protein Design

结合多专家的蒙特卡洛树扩散用于蛋白质设计

Xuefeng Liu, Mingxuan Cao, Songhao Jiang, Xiao Luo, Xiaotian Duan, Mengdi Wang, Tobin R. Sosnick, Jinbo Xu, Rick Stevens

机构 * University of Chicago(芝加哥大学) Data Science Institute(数据科学研究所) Department of Biochemistry and Molecular Biology(生物化学与分子生物学系) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Argonne National Laboratory(阿贡国家实验室) Princeton University(普林斯顿大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 MCTD-ME通过结合多专家的蒙特卡洛树扩散方法,提升蛋白质设计任务的性能,特别是在反向折叠、折叠和条件设计挑战中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08435 2026-02-25 cs.RO 78%

PegasusFlow: Parallel Rolling-Denoising Score Sampling for Robot Diffusion Planner Flow Matching

PegasusFlow: 并行滚动去噪分数采样用于机器人扩散规划流程匹配

Lei Ye, Haibo Gao, Peng Xu, Zhelin Zhang, Junqi Shan, Ao Zhang, Wei Zhang, Ruyi Zhou, Zongquan Deng, Liang Ding

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人系统国家重点实验室,哈尔滨工业大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 PegasusFlow通过并行滚动去噪分数采样方法,实现了无需专家数据的机器人轨迹规划,显著提升了复杂地形中的导航性能。

Comments 8 pages, 7 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13904 2026-02-25 cs.LG 78%

One-Step Flow Q-Learning: Addressing the Diffusion Policy Bottleneck in Offline Reinforcement Learning

一步流Q学习:解决离线强化学习中扩散策略瓶颈

Thanh Nguyen, Chang D. Yoo

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 OFQL通过一步流匹配范式,无需辅助模块或蒸馏,实现高效的一步动作生成,提升离线强化学习的训练速度和鲁棒性。

Comments 10 pages, ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12007 2026-02-25 cs.IR cs.AI 78%

Diffusion Generative Recommendation with Continuous Tokens

基于连续令牌的扩散生成推荐

Haohao Qu, Shanru Lin, Yujuan Ding, Yiqi Wang, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) City University of Hong Kong(香港城市大学) National University of Defense Technology(国防科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 ContRec通过整合连续令牌和扩散模型,提升基于LLM的推荐系统性能。

Comments Accepted by The ACM Web Conference (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14719 2026-02-25 cs.RO 78%

DiSPo: Diffusion-SSM based Policy Learning for Coarse-to-Fine Action Discretization

DiSPo:基于扩散-状态空间模型的策略学习用于粗到细动作离散化

Nayoung Oh, Jaehyeong Jang, Moonkyeong Jung, Daehyung Park

机构 * Korea Advanced Institute of Science and Technology(韩国高级科学研究院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 DiSPo通过结合扩散-状态空间模型和步骤缩放方法,实现了高效且灵活的粗到细动作离散化学习,显著提升了成功率和推理效率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21097 2026-02-25 math-ph math.MP 71%

Anomalous diffusion properties of stochastic transport by heavy-tailed jump processes

由重尾跳跃过程引起的随机输运的异常扩散特性

Paolo Cifani, Franco Flandoli, Lorenzo Marino

专题命中 扩散模型 :diffusion(title)

AI总结 研究重尾跳跃过程对被动标量输运的影响,发现其尾部行为决定输运是超扩散还是经典扩散。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20923 2026-02-25 cs.RO 71%

ParkDiffusion++: Ego Intention Conditioned Joint Multi-Agent Trajectory Prediction for Automated Parking using Diffusion Models

ParkDiffusion++: 基于扩散模型的多智能体轨迹预测用于自动化停车的自我意图条件联合预测

Jiarong Wei, Anna Rehr, Christian Feist, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) CARIAD SE

专题命中 扩散模型 :diffusion(title)

AI总结 ParkDiffusion++通过联合学习多智能体轨迹预测与自我意图预测,实现自动化停车中的高效假设决策与安全预测。

Comments ICRA 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20699 2026-02-25 math.AP math.DS 71%

Global self-similar solutions for Hardy-Hénon equations with linear and quasilinear diffusion

Hardy-Hénon方程中具有线性和拟线性扩散的全局自相似解

Razvan Gabriel Iagar, Ariel Sánchez, Erik Sarrion-Pedralva

专题命中 扩散模型 :diffusion(title)

AI总结 研究Hardy-Hénon方程中具有线性和拟线性扩散的全局自相似解的分类及存在性,揭示了临界指数对解结构的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11675 2026-02-25 cs.CV cs.AI 70%

Generating metamers of human scene understanding

生成人类场景理解的元物

Ritik Raina, Abe Leite, Alexandros Graikos, Seoyoung Ahn, Dimitris Samaras, Gregory J. Zelinsky

机构 * Stony Brook University(史泰文布魯克大學) UC Berkeley(加州大學伯克利分校)

专题命中 扩散模型 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出MetamerGen,一种结合外围和注视信息生成与人类场景理解一致的图像的潜在扩散模型,通过双流表示实现视网膜输入的图像合成,并通过行为实验验证其对潜在场景表示的感知一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20666 2026-02-25 cs.CV 70%

BoxSplitGen: A Generative Model for 3D Part Bounding Boxes in Varying Granularity

BoxSplitGen:一种用于不同粒度3D部件边界框的生成模型

Juil Koo, Wei-Tung Lin, Chanho Park, Chanhyeok Park, Minhyuk Sung

机构 * KAIST(韩国科学技术院) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 BoxSplitGen通过迭代分割边界框生成不同粒度的3D部件边界框,提升3D创作中从粗到细的生成效果。

Comments Project page: https://boxsplitgen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20417 2026-02-25 cs.CV 70%

gQIR: Generative Quanta Image Reconstruction

gQIR:生成式量子图像重建

Aryan Garg, Sizhuo Ma, Mohit Gupta

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Snap Inc.(Snap公司)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 gQIR通过适应大型生成模型到量子爆发成像领域,实现了在低光条件下高质量图像重建。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20161 2026-02-25 cs.CV 57%

Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device

Mobile-O: 移动设备上的统一多模态理解和生成

Abdelrahman Shaker, Ahmed Heakl, Jaseel Muhammad, Ritesh Thawkar, Omkar Thawakar, Senmao Li, Hisham Cholakkal, Ian Reid, Eric P. Xing, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Linköping University(利尔贝里大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 Mobile-O是一款在移动设备上实现统一多模态理解和生成的高效模型,通过紧凑架构和创新训练方法,在性能和速度上均优于现有模型。

Comments Project page: https://amshaker.github.io/Mobile-O/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08114 2026-02-25 eess.IV cs.CV 57%

Learned Regularization for Microwave Tomography

学习正则化用于微波断层成像

Bowen Tong, Hao Chen, Shaorui Guo, Dong Liu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种融合扩散模型的学习正则化方法,用于解决微波断层成像中的病态问题,通过改进精度、稳定性和鲁棒性提升重建效果。

Journal ref IEEE Trans. Antennas Propag., 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21147 2026-02-25 astro-ph.HE 50%

RAMSES-MCR: A consistent multi-group treatment of cosmic rays physics in momentum-space with the RAMSES code

RAMSES-MCR:在动量空间中使用RAMSES代码实现一致的多组处理以处理宇宙射线物理

Nimatou-Seydi Diallo, Yohan Dubois, Alexandre Marcowith, Joki Rosdahl, Benoît Commerçon

专题命中 扩散模型 :diffusion(abstract)

AI总结 RAMSES-MCR通过多组方法在动量空间中建模宇宙射线物理,用于研究其对气体动力学和观测特征的影响。

Comments 21 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏