arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-21 至 2026-01-21 共收录 134 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 4 篇

2601.11635 2026-01-21 cs.CV 57%

Now You See Me, Now You Don't: A Unified Framework for Expression Consistent Anonymization in Talking Head Videos

现在你看见了,现在你又看不见:一种用于说话头视频中表达一致匿名化的统一框架

Anil Egin, Andrea Tangherloni, Antitza Dantcheva

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Anon-NET通过基于扩散的生成模型和视频驱动动画,实现说话头视频中表达一致的匿名化,同时保留视觉真实性和时间一致性。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) Workshops, IEEE/CVF, Oct 2025, Hawaii-Honolulu, United States. pp.5925-5934

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 4 篇

2401.10061 2026-01-21 cs.CV cs.AI 83%

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 图像生成评测 :image generation(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16899 2026-01-21 cs.CL cs.CV 70%

Multimodal RewardBench 2: Evaluating Omni Reward Models for Interleaved Text and Image

多模态奖励基准2:评估多模态奖励模型用于交错文本和图像

Yushi Hu, Reyhane Askari-Hemmat, Melissa Hall, Emily Dinan, Luke Zettlemoyer, Marjan Ghazvininejad

机构 * FAIR at Meta Superintelligence Labs(Meta超智能实验室的FAIR)

专题命中 图像生成评测 :text-to-image(abstract);image editing(abstract);分类 cs.CV

AI总结 多模态奖励基准2评估多模态奖励模型在交错文本和图像任务中的性能,通过专家标注数据和先进模型对比,揭示了不同模型在多模态理解与生成任务中的准确率差异。

Comments Code and data available at https://github.com/facebookresearch/MMRB2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14241 2026-01-21 cs.LG cs.AI physics.soc-ph 50%

Beyond MMD: Evaluating Graph Generative Models with Geometric Deep Learning

超越MMD:利用几何深度学习评估图生成模型

Salvatore Romano, Marco Grassia, Giuseppe Mangioni

机构 * Dipartimento di Ingegneria Elettrica, Elettronica e Informatica University of Catania, Italy(电子工程与信息学院 巴勒莫大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出RGM方法,利用几何深度学习评估图生成模型,发现MMD评估不足,指出两种模型在结构特征保留上的局限性。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12628 2026-01-21 cs.SI 50%

Constructing a Dataset to Support Agent-Based Modeling of Online Interactions: Users, Topics, and Interaction Networks

构建支持在线交互 agent-based 模型的数据集:用户、话题和交互网络

Abdul Sittar, Miha Cesnovar, Alenka Gucek, Marko Grobelnik

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文通过构建基于 Reddit 的大规模数据集,支持 agent-based 模型研究用户、话题和交互网络的现实性与验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 8 篇

2505.08142 2026-01-21 eess.IV 78%

Highly Undersampled MRI Reconstruction via a Single Posterior Sampling of Diffusion Models

通过扩散模型单步后采样实现高 undersampling 的 MRI 重建

Jin Liu, Qing Lin, Zhuang Xiong, Shanshan Shan, Chunyi Liu, Min Li, Feng Liu, G. Bruce Pike, Hongfu Sun, Yang Gao

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出SSDM-MRI方法,通过单步扩散模型和迭代选择性蒸馏算法实现高效MRI重建,具有快速重建时间和优异的图像质量。

Journal ref 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11743 2026-01-21 cs.OS cs.DC 75%

Nixie: Efficient, Transparent Temporal Multiplexing for Consumer GPUs

Nixie:面向消费级显卡的高效透明时间复用

Yechen Xu, Yifei Wang, Nathanael Ren, Yiran Chen, Danyang Zhuo

专题命中 效率与蒸馏 :image generation(abstract);text-to-image(abstract);image editing(abstract)

AI总结 Nixie通过高效透明的时间复用技术提升消费级GPU的交互任务性能,减少CPU pinned内存使用,提高响应速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14256 2026-01-21 cs.CV 57%

Implicit Neural Representation Facilitates Unified Universal Vision Encoding

隐式神经表示促进统一的通用视觉编码

Matthew Gwilliam, Xiao Wang, Xuefeng Hu, Zhenheng Yang

机构 * TikTok

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出一种首创的隐式神经表示超网络,统一图像识别与生成任务,通过知识蒸馏提升泛化能力,并在多种视觉任务中表现优异。

Comments 18 pages, 16 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11630 2026-01-21 cs.CV 57%

A one-step generation model with a Single-Layer Transformer: Layer number re-distillation of FreeFlow

基于单层Transformer的一步生成模型:FreeFlow的层数再蒸馏

Haonan Wei, Linyuan Wang, Nuolin Sun, Zhizhong Zheng, Lei Li, Bin Yan

机构 * Information Engineering University(信息工程大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出单层Transformer模型SLT,通过蒸馏压缩FreeFlow的28层结构,提升生成图像质量与采样效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10211 2026-01-21 cs.LG 50%

Transport-Coupled Bayesian Flows for Molecular Graph Generation

耦合贝叶斯流的分子图生成

Yida Xiong, Jiameng Chen, Kun Li, Hongzhi Zhang, Xiantao Cai, Jia Wu, Wenbin Hu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Department of Computing, Macquarie University(麦考瑞大学计算系) Wuhan University Shenzhen Research Institute(武汉大学深圳研究院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 TopBF通过连续参数分布和准瓦瑟斯坦最优传输耦合,实现分子图生成的高效可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12277 2026-01-21 cs.RO 50%

An Efficient and Multi-Modal Navigation System with One-Step World Model

一种高效且多模态的导航系统与一步世界模型

Wangtian Shen, Ziyang Meng, Jinming Ma, Mingliang Zhou, Diyun Xiang

机构 * Tsinghua University(清华大学) Xiaomi (China)(小米(中国))

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种高效多模态导航系统,通过一步世界模型和3D U-Net骨干网络,提升导航效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12223 2026-01-21 cond-mat.str-el 50%

${\bf \frac{h}{e}}$ flux quantization in metals due to Berry phase coherence

${\f \ rac{h}{e}}$ 通量量子化在金属中的现象源于 Berry 阶段相干

Chandra M. Varma

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究揭示了 Berry 阶段相干如何在金属中通过 chiral 一维态与本征态的相互作用导致宏观尺度的通量量子化现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15939 2026-01-21 cond-mat.dis-nn 50%

Noise-induced resonant acceleration of a charge in an intermittent magnetic field: an exact solution for ergodic and non-ergodic fluctuations

噪声诱导的磁场所致电荷共振加速:对 ergodic 和非 ergodic 振荡的精确解

Gerardo Aquino, Mauro Bologna

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究噪声诱导共振加速机制,揭示其在非 ergodic 情况下的精确解析解及高效电荷加速特性。

Comments 13 pages, 6 figures

Journal ref Chaos, Solitons and Fractals 203,117670 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他图像生成 1 篇

2601.11952 2026-01-21 cs.CV 57%

Decoder Gradient Shields: A Family of Provable and High-Fidelity Methods Against Gradient-Based Box-Free Watermark Removal

解码器梯度防护:一种可证明且高保真的对抗梯度基于的框外水印移除方法

Haonan An, Guang Hua, Wei Du, Hangcheng Cao, Yihang Tao, Guowen Xu, Susanto Rahardja, Yuguang Fang

机构 * Hong Kong JC STEM Lab of Smart City and Department of Computer Science, City University of Hong Kong(香港JC STEM实验室及城市大学计算机科学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡理工学院信息通信技术集群) College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科学与技术大学计算机科学与工程学院) Department of Electronic and Electrical Engineering, University College London(伦敦大学学院电子与电气工程系)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出了解码器梯度防护(DGSs)方法,通过防止梯度传播来增强对抗框外水印移除的鲁棒性,有效保护模型知识产权。

详情

展开后加载摘要…

URL PDF HTML 收藏