arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-03 至 2025-12-03 共收录 55 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2512.02794 2025-12-03 cs.CV 88%

PhyCustom: Towards Realistic Physical Customization in Text-to-Image Generation

PhyCustom: 向文本到图像生成中的真实物理定制迈进

Fan Wu, Cheng Chen, Zhoujie Fu, Jiacheng Wei, Yi Xu, Deheng Ye, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) Goertek Alpha Labs(歌尔声学Alpha实验室) Tencent(腾讯)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 PhyCustom通过引入两个新正则化损失,提升文本到图像生成中对物理概念的真实定制能力。

Comments codes:https://github.com/wufan-cse/PhyCustom

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02161 2025-12-03 cs.CV 83%

FineGRAIN: Evaluating Failure Modes of Text-to-Image Models with Vision Language Model Judges

FineGRAIN:通过视觉语言模型法官评估文本到图像模型的故障模式

Kevin David Hayes, Micah Goldblum, Vikash Sehwag, Gowthami Somepalli, Ashwinee Panda, Tom Goldstein

机构 * University of Maryland(马里兰大学) Columbia University(哥伦比亚大学) Sony AI(索尼人工智能)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 FineGRAIN通过视觉语言模型评估文本到图像模型的故障模式,揭示属性保真度和物体表示的系统性错误,强调了针对性基准测试对生成模型可靠性的重要性。

Comments Accepted to NeurIPS 2025 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2512.03046 2025-12-03 cs.CV 83%

MagicQuillV2: Precise and Interactive Image Editing with Layered Visual Cues

MagicQuillV2: 基于分层视觉提示的精确交互式图像编辑

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Shuailei Ma, Ka Leong Cheng, Wen Wang, Qingyan Bai, Yuxuan Zhang, Yanhong Zeng, Yixuan Li, Xing Zhu, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) NEU(南京大学) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 MagicQuillV2通过分层视觉提示实现精确交互式图像编辑,解决传统生成模型与图形软件间的控制与语义平衡问题。

Comments Code and demo available at https://magicquill.art/v2/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 36 篇

2406.17636 2025-12-03 cs.CV cs.AI 83%

Aligning Diffusion Models with Noise-Conditioned Perception

对扩散模型进行噪声条件感知对齐

Alexander Gambashidze, Anton Kulikov, Yuriy Sosnin, Ilya Makarov

机构 * Artificial Intelligence Research Institute (AIRI)(人工智能研究 institute(AIRI)) Skolkovo Institute of Science and Technology(斯克尔科沃科学与技术研究所) HSE University(俄罗斯高等经济学院) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究中心,信息与通信技术研究院) ISP RAS(信息与通信技术研究院)

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究提出在扩散模型的U-Net嵌入空间中使用感知目标,以提升人类偏好对齐的效率和质量,并减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03045 2025-12-03 cs.CV 79%

CAMEO: Correspondence-Attention Alignment for Multi-View Diffusion Models

CAMEO:多视图扩散模型中的对应-注意力对齐

Minkyung Kwon, Jinhyeok Choi, Jiho Park, Seonghu Jeon, Jinhyuk Jang, Junyoung Seo, Minseop Kwak, Jin-Hwa Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能研究中心) NAVER AI Lab(NAVER人工智能实验室) SNU AIIS(延世大学人工智能研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 CAMEO通过几何对应监督注意力图,提升多视图扩散模型的训练效率和生成质量。

Comments Project page: https://cvlab-kaist.github.io/CAMEO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02681 2025-12-03 cs.CV 79%

PGP-DiffSR: Phase-Guided Progressive Pruning for Efficient Diffusion-based Image Super-Resolution

PGP-DiffSR: 基于相位引导的渐进剪枝用于高效的扩散式图像超分辨率

Zhongbao Yang, Jiangxin Dong, Yazhou Yao, Jinhui Tang, Jinshan Pan

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(计算机科学与工程学院,南京理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 PGP-DiffSR通过基于相位信息的渐进剪枝和相位交换适配器模块,实现高效的扩散式图像超分辨率,减少计算和内存消耗同时保持高质量恢复。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV 79%

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02339 2025-12-03 cs.CV cs.AI 79%

Video Diffusion Models Excel at Tracking Similar-Looking Objects Without Supervision

视频扩散模型在无监督情况下能有效追踪相似外观的对象

Chenshuang Zhang, Kang Zhang, Joon Son Chung, In So Kweon, Junmo Kim, Chengzhi Mao

机构 * KAIST(韩国科学技术院) Rutgers University(罗格斯大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出利用预训练视频扩散模型的运动表示能力,实现无监督环境下对视觉相似对象的高效追踪,提升了追踪性能并克服了现有方法的局限。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02088 2025-12-03 eess.IV cs.AI cs.CV cs.LG 79%

Comparing Baseline and Day-1 Diffusion MRI Using Multimodal Deep Embeddings for Stroke Outcome Prediction

比较基线和第1天扩散磁共振成像用于中风预后预测的多模态深度嵌入

Sina Raeisadigh, Myles Joshua Toledo Tan, Henning Müller, Abderrahmane Hedjoudje

机构 * 1 Department of Computer Science, University of Geneva, Switzerland 2 Department of Electrical \& Computer Engineering, University of Florida, FL, USA 3 Service of Medical Informatics, University Hospital of Geneva, Switzerland 4 Department of Imaging Medical Informatics, University of Geneva, Switzerland

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究通过多模态深度嵌入方法,利用基线和治疗后1天的扩散MRI数据,结合临床特征和病变体积,预测急性缺血性中风患者3个月的功能预后。

Comments 5 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04979 2025-12-03 cs.CV 79%

Steering One-Step Diffusion Model with Fidelity-Rich Decoder for Fast Image Compression

通过高保真解码器引导单步扩散模型实现快速图像压缩

Zheng Chen, Mingde Zhou, Jinpei Guo, Jiale Yuan, Yifei Ji, Yulun Zhang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 SODEC通过单步扩散模型和高保真解码器实现快速图像压缩,显著提升压缩效率和保真度

Comments Accepted to AAAI 2026. Code is available at: https://github.com/zhengchen1999/SODEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02892 2025-12-03 cs.CL 78%

Fast-Decoding Diffusion Language Models via Progress-Aware Confidence Schedules

通过进度感知置信度调度实现扩散语言模型的快速解码

Amr Mohamed, Yang Zhang, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎高等理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 SchED通过进度感知置信度调度实现扩散语言模型的快速解码,显著提升解码效率并保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02782 2025-12-03 gr-qc physics.optics 78%

Universality and Falsifiability of Quantum Spacetime Decoherence: A Gauge-Invariant Framework for Gravitational-Wave Phase Diffusion

量子时空退相干的普遍性与可证伪性:一种广义协变框架用于引力波相位扩散

Hu Cang, Yuan Wang

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出一个广义协变框架,用于研究引力波在量子时空中的相位扩散,通过普遍性定理揭示相位方差随距离线性增长的特性,并提出利用LIGO等设备测量该效应的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02776 2025-12-03 physics.chem-ph cond-mat.soft 78%

Enhanced particle diffusion in fluctuating binary environments

增强的二元波动环境中粒子扩散

Fivos Perakis, Takeshi Kawasaki, Shinji Saito

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究探讨了在波动二元环境中粒子扩散的增强机制,揭示了摩擦切换速率对扩散行为的影响,并展示了动态异质性与扩散系数解耦的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16755 2025-12-03 cs.LG cs.AI 78%

Diffusion model for relational inference

关系推断的扩散模型

Shuhan Zheng, Ziqiang Li, Kantaro Fujiwara, Gouhei Tanaka

机构 * International Research Center for Neurointelligence (IRCN)(国际神经智能研究中心) The University of Tokyo(东京大学) Graduate School of Engineering, Nagoya Institute of Technology(名古屋技术大学工学院) Hitachi, Ltd.(日立株式会社)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出DiffRI模型,通过条件扩散建模推断复杂系统组件间的相互作用关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02370 2025-12-03 cs.NI 78%

Diffusion-Model-enhanced Multiobjective Optimization for Improving Forest Monitoring Efficiency in UAV-enabled Internet-of-Things

基于扩散模型的多目标优化用于提升无人机赋能物联网中的森林监测效率

Hongyang Pan, Bin Lin, Yanheng Liu, Shuang Liang, Chau Yuen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出基于扩散模型的改进多目标灰狼优化器,用于提升无人机赋能物联网中森林监测的效率与资源管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02044 2025-12-03 cs.CL 78%

Beyond Confidence: Adaptive and Coherent Decoding for Diffusion Language Models

超越置信度:用于扩散语言模型的自适应与一致解码

Kecheng Chen, Ziru Liu, Xijia Tao, Hui Liu, Xinyu Fu, Suiyun Zhang, Dandan Tu, Lingpeng Kong, Rui Liu, Haoliang Li

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究) The University of Hong Kong(香港大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出Coherent Contextual Decoding方法,通过自适应解码策略提升扩散语言模型的生成质量和采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23846 2025-12-03 cs.LG cs.AI 78%

Adversarial Diffusion for Robust Reinforcement Learning

对抗扩散用于鲁棒强化学习

Daniele Foffano, Alessio Russo, Alexandre Proutiere

机构 * Division of Decision and Control Systems KTH, Royal Institute of Technology(决策与控制系统系 瑞典皇家理工学院) Faculty of Computing and Data Sciences(计算与数据科学学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出AD-RRL,通过对抗扩散方法提升强化学习在环境动态不确定性下的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01846 2025-12-03 cs.CV 70%

UVGS: Reimagining Unstructured 3D Gaussian Splatting using UV Mapping

UVGS: 重新构想使用UV映射的无结构3D高斯点撒技术

Aashish Rai, Dilin Wang, Mihir Jain, Nikolaos Sarafianos, Kefan Chen, Srinath Sridhar, Aayush Prakash

机构 * Brown University(布朗大学) Meta Reality Labs(Meta现实实验室)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 本文提出UVGS,通过UV映射将无结构3D高斯点撒转化为结构化2D表示,利用现有2D模型高效建模3D数据,并实现可扩展的生成应用。

Comments https://ivl.cs.brown.edu/uvgs

Journal ref CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03004 2025-12-03 cs.CV 57%

DGGT: Feedforward 4D Reconstruction of Dynamic Driving Scenes using Unposed Images

DGGT:利用未定位图像实现动态驾驶场景的前馈4D重建

Xiaoxue Chen, Ziyi Xiong, Yuantao Chen, Gen Li, Nan Wang, Hongcheng Luo, Long Chen, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Hongyang Li, Ya-Qin Zhang, Hao Zhao

机构 * AIR, Tsinghua University(清华人工智能研究院) Xiaomi EV(小米电动车) The University of Hong Kong(香港大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 DGGT通过前馈方法实现无姿态动态驾驶场景的4D重建,结合3D高斯地图和轻量级动态头,提升重建速度与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02993 2025-12-03 cs.CV 57%

TEXTRIX: Latent Attribute Grid for Native Texture Generation and Beyond

TEXTRIX:用于原生纹理生成及更广泛领域的潜在属性网格

Yifei Zeng, Yajie Bao, Jiachen Qian, Shuang Wu, Youtian Lin, Hao Zhu, Buyu Li, Feihu Zhang, Xun Cao, Yao Yao

机构 * Nanjing University(南京大学) DreamTech HKU(香港大学) OriginArk

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 TEXTRIX通过构建潜在3D属性网格和稀疏注意力扩散变换器,实现高保真纹理合成及精确3D分割。

Comments Project Page: https://www.neural4d.com/research-page/textrix

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02870 2025-12-03 cs.CV 57%

Taming Camera-Controlled Video Generation with Verifiable Geometry Reward

驯服受控摄像机视频生成的可验证几何奖励

Zhaoqing Wang, Xiaobo Xia, Zhuolin Bie, Jinlin Liu, Dongdong Yu, Jia-Wang Bian, Changhu Wang

机构 * AIsphere National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种在线强化学习框架,通过可验证的几何奖励提升摄像机控制的视频生成精度与一致性。

Comments 11 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02780 2025-12-03 cs.CV 57%

Rethinking Surgical Smoke: A Smoke-Type-Aware Laparoscopic Video Desmoking Method and Dataset

重新思考手术烟雾:一种基于烟雾类型意识的腹腔镜视频去烟方法和数据集

Qifan Liang, Junlin Li, Zhen Han, Xihao Wang, Zhongyuan Wang, Bin Mei

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种基于烟雾类型意识的腹腔镜视频去烟方法,通过引入两种烟雾类型和解纠缠模块,提升了去烟效果和泛化能力。

Comments 12 pages, 15 figures. Accepted to AAAI-26 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02576 2025-12-03 cs.CV 57%

Co-speech Gesture Video Generation via Motion-Based Graph Retrieval

通过基于运动的图检索生成同步语音手势视频

Yafei Song, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于运动图检索和扩散模型生成同步语音手势视频,通过提取音频特征和运动分布提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02492 2025-12-03 cs.CV 57%

YingVideo-MV: Music-Driven Multi-Stage Video Generation

YingVideo-MV: 基于音乐的多阶段视频生成

Jiahui Chen, Weida Wang, Runhua Shi, Huan Yang, Chaofan Ding, Zihao Chen

机构 * AI Lab, GiantNetwork(人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 YingVideo-MV通过整合音频语义分析、时间感知扩散模型和摄像机运动控制模块,实现了基于音乐的高质量视频生成。

Comments 18 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01629 2025-12-03 cs.CV cs.RO 57%

SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge

SPARK: 面向模拟的关节化重建与VLK知识

Yumeng He, Ying Jiang, Jiayin Lu, Yin Yang, Chenfanfu Jiang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SPARK通过结合VLK和生成扩散模型,实现从单张图像中生成物理一致的关节化3D物体,提升机器人操作和交互建模的应用效果。

Comments Project page: https://heyumeng.com/SPARK/index.html. 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02834 2025-12-03 cs.RO cs.AI 50%

Steering Vision-Language-Action Models as Anti-Exploration: A Test-Time Scaling Approach

引导视觉-语言-动作模型作为反探索:一种测试时间缩放方法

Siyuan Yang, Yang Zhang, Haoran He, Ling Pan, Xiu Li, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom(中国电信人工智能研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出TACO框架,通过测试时间缩放方法在视觉-语言-动作模型中引入反探索机制,提升推理稳定性和任务成功率。

Comments The first two authors contributed equally. Yang Zhang leads the whole project

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02811 2025-12-03 q-bio.QM cs.ET 50%

Vessel Network Topology in Molecular Communication: Insights from Experiments and Theory

血管网络拓扑在分子通信中的应用:来自实验和理论的见解

Timo Jakumeit, Lukas Brand, Jens Kirchner, Robert Schober, Sebastian Lotter

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种用于复杂血管网络拓扑中分子通信的信道模型,通过实验验证了分子延迟和多路径扩展指标,以评估血管网络结构对信号质量的影响。

Comments 29 pages, 10 figures; This paper has been submitted to IEEE Transactions on Molecular, Biological, and Multi-Scale Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02695 2025-12-03 physics.optics cs.SY eess.SY 50%

Double-Helix based Real-Time Single Particle Tracking

基于双螺旋的实时单粒子追踪

Md Faysal Hossain, Sean B. Andersson

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出基于双螺旋PSF的实时单粒子追踪方法,通过PSF工程技术消除出焦平面测量需求,实现对高速移动粒子的高效追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02667 2025-12-03 cs.LG cs.AI 50%

Graph VQ-Transformer (GVT): Fast and Accurate Molecular Generation via High-Fidelity Discrete Latents

图VQ-Transformer(GVT):通过高保真离散潜在表示实现快速准确的分子生成

Haozhuo Zheng, Cheng Wang, Yang Liu

专题命中 扩散模型 :diffusion(abstract)

AI总结 GVT通过高保真离散潜在表示实现快速准确的分子生成,结合图Transformer与RCM节点排序和RoPE,提升分子生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02618 2025-12-03 cs.LG cond-mat.mtrl-sci 50%

Modeling and Inverse Identification of Interfacial Heat Conduction in Finite Layer and Semi-Infinite Substrate Systems via a Physics-Guided Neural Framework

基于物理引导神经框架的有限层和半无限基底系统界面热传导建模与反向识别

Wenhao Sha, Tienchong Chang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出HeatTransFormer,一种物理引导的Transformer架构,用于解决界面主导的热扩散问题,实现对有限层和半无限基底系统中界面热传导的高效建模与反向识别。

详情

展开后加载摘要…

URL PDF HTML 收藏