arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-23 至 2026-01-23 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 32 篇

2512.07290 2026-01-23 astro-ph.HE 50%

Diagnosing Interstellar Magnetic Turbulence with TeV Pulsar Halos

用太勒电子伏脉冲星晕诊断星际磁湍流

Chao-Ming Li, Ruo-Yu Liu, Huirong Yan

专题命中 扩散模型 :diffusion(abstract)

AI总结 利用太勒电子伏脉冲星晕形态研究星际磁场的各向异性扩散特性及阿列夫数等参数。

Comments 9 pages, 6 figures, accepted by Phys. Rev. D

Journal ref Phys. Rev. D 113, L021303 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05766 2026-01-23 cs.CR 50%

New Insights into Involutory and Orthogonal MDS Matrices

对可逆和正交MDS矩阵的新见解

Yogesh Kumar, Susanta Samanta, Atul Gaur

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了可逆和正交MDS矩阵的结构关系,推导了半可逆与可逆、半正交与正交矩阵之间的联系,并给出了3×3 MDS矩阵计数的显式公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05742 2026-01-23 math.AP 50%

High-friction limit for bipolar Euler-Riesz systems

双极欧拉-里斯系统中的高摩擦极限

Nuno J. Alves, Jan Haskovec

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究通过相对熵方法,证明了双极欧拉-里斯系统在高摩擦极限下的收敛性,并扩展了之前关于双极欧拉-泊松系统的研究到更一般的相互作用模型中。

Journal ref Journal of Mathematical Analysis and Applications 555(2), 130188 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07385 2026-01-23 cond-mat.stat-mech 50%

Physical Signatures of Supercritical Fluid Boundaries

超临界流体边界的真实特征

Sha Jin, Xinyang Li, Xue Fan, Matteo Baggioli, Yuliang Jin

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过分子动力学模拟和实验验证,揭示了超临界流体在跨越L±边界时的结构、传输和动态行为特征,为超临界区域的相图提供了新的物理基础。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04174 2026-01-23 cs.SI cs.AI 50%

Cohesive Group Discovery in Interaction Graphs under Explicit Density Constraints

在显式密度约束下交互图中的凝聚组发现

Yu Zhang, Yilong Luo, Mingyuan Ma, Yao Chen, Enqiang Zhu, Jin Xu, Chanjuan Liu

机构 * Peking University(北京大学) Beijing Capital International Airport Co., Ltd.(北京首都国际机场有限公司) Guangzhou University(广州大学) Dalian University of Technology(大连理工大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出EDQC框架,在显式密度约束下有效发现交互图中的凝聚组,通过能量扩散过程优化候选区域并确保密度要求,实验表明其在识别最大γ-准团方面表现优异。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11108 2026-01-23 cond-mat.mes-hall 50%

Near transform-limited single photons from rapid-thermal annealed quantum dots

近变换限制的单光子来自快速热退火的量子点

Hendrik Mannel, Fabio Rimek, Marcel Zoellner, Nico Schwarz, Andreas D. Wieck, Nikolai Bart, Arne Ludwig, Martin Geller

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过快速热退火优化量子点发射特性,实现近变换限制的单光子发射,提升量子通信性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19373 2026-01-23 stat.ML cs.LG 50%

Beyond Fixed Horizons: A Theoretical Framework for Adaptive Denoising Diffusions

超越固定时间范围:自适应去噪扩散的理论框架

Sören Christensen, Jan Kallsen, Claudia Strauch, Lukas Trottner

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种自适应去噪扩散模型,通过时间齐结构和h-变换实现步骤数自适应调整,适用于低维数据生成和多种下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15095 2026-01-23 math.AP 50%

Sobolev estimates for the Keller-Segel system and applications to the JKO scheme

Keller-Segel系统中的Sobolev估计及其在JKO方案中的应用

Charles Elbar

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过证明Keller-Segel系统中的Sobolev估计,扩展了JKO方案在Fokker-Planck方程中的收敛性结果。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 2 篇

2601.15698 2026-01-23 cs.CV cs.AI 74%

Beyond Visual Safety: Jailbreaking Multimodal Large Language Models for Harmful Image Generation via Semantic-Agnostic Inputs

超越视觉安全:通过语义无关输入对多模态大语言模型进行有害图像生成的劫持

Mingyu Yu, Lana Liu, Zhehao Zhao, Wei Wang, Sujuan Qin

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) School of Cyberspace Security, Beijing University of Posts and Telecommunications(网络安全学院,北京邮电大学)

专题命中 可控生成 :image generation(title);分类 cs.CV

AI总结 本文提出BVS框架,通过语义无关输入对多模态大语言模型进行有害图像生成的劫持,揭示其视觉安全边界的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09822 2026-01-23 cs.RO 50%

Multi-Layered Reasoning from a Single Viewpoint for Learning See-Through Grasping

从单一视角进行多层推理以学习透视抓取

Fang Wan, Chaoyang Song

机构 * Southern University of Science and Technology(南方科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 可控生成 :inpainting(abstract)

AI总结 本研究提出了一种基于视觉的透视感知架构,通过单一视觉输入实现多模态感知,无需外部摄像头或力传感器即可学习反应抓取。

Comments 39 pages, 13 figures, 2 tables, for supplementary videos, see https://bionicdl.ancorasir.com/?p=1658, for opensourced codes, see https://github.com/ancorasir/SeeThruFinger

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2601.15560 2026-01-23 cs.CV 70%

Relative Classification Accuracy: A Calibrated Metric for Identity Consistency in Fine-Grained K-pop Face Generation

相对分类准确率:一种用于细粒度K-pop人脸生成中身份一致性的校准度量

Sylvey Lin, Eranki Vasistha

机构 * UIUC(伊利诺伊大学香槟分校)

专题命中 个性化与一致性 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出相对分类准确率(RCA)作为评估细粒度K-pop人脸生成中身份一致性的校准度量,揭示了高视觉质量与严重语义模式崩溃之间的关键权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15681 2026-01-23 cs.CV 57%

Consistency-Regularized GAN for Few-Shot SAR Target Recognition

一致性正则化的GAN用于少样本SAR目标识别

Yikui Zhai, Shikuang Liu, Wenlve Zhou, Hongsheng Zhang, Zhiheng Zhou, Xiaolin Tian, C. L. Philip Chen

机构 * College of Electronics and Information Engineering, Wuyi University(威夷大学电子与信息工程学院) College of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院) Department of Geography, The University of Hong Kong(香港大学地理系) Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院) Faculty of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 Cr-GAN通过引入双分支判别器和双域循环一致性机制,在数据稀缺条件下提升少样本SAR目标识别性能,实现71.21%的高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2601.16125 2026-01-23 cs.CV cs.CL cs.IR 79%

Rethinking Composed Image Retrieval Evaluation: A Fine-Grained Benchmark from Image Editing

重新思考组合图像检索评估:从图像编辑中获得的细粒度基准

Tingyu Song, Yanzhao Zhang, Mingxin Li, Zhuoning Guo, Dingkun Long, Pengjun Xie, Siyue Zhang, Yilun Zhao, Shu Wu

机构 * CASIA(中国科学院自动化研究所) Tongyi Lab, Alibaba Group(阿里云实验室) UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) NTU(国立新加坡大学) Yale(耶鲁大学)

专题命中 图像生成评测 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出EDIR细粒度CIR基准,通过图像编辑技术生成多样化查询,揭示现有模型在多模态任务中的能力差距与局限性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20879 2026-01-23 cs.CV 79%

MultiHuman-Testbench: Benchmarking Image Generation for Multiple Humans

MultiHuman-Testbench: 多人图像生成的基准测试

Shubhankar Borse, Seokeon Choi, Sunghyun Park, Jeongho Kim, Shreya Kadambi, Risheek Garrepalli, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通AI研究)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 MultiHuman-Testbench提出了一种多人类图像生成的基准测试,通过多指标评估提升ID相似性,为研究提供标准化工具。

Comments Accepted at the NeurIPS 2025 D&B Track

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2601.16214 2026-01-23 cs.CV 79%

CamPilot: Improving Camera Control in Video Diffusion Model with Efficient Camera Reward Feedback

CamPilot: 通过高效的相机奖励反馈提升视频扩散模型的相机控制

Wenhang Ge, Guibao Shen, Jiawei Feng, Luozhou Wang, Hao Lu, Xingye Tian, Xin Tao, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 CamPilot通过高效的3D解码器和奖励机制提升视频扩散模型的相机控制能力

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16047 2026-01-23 physics.chem-ph 50%

Enhanced Representation-Based Sampling for the Efficient Generation of Datasets for Machine-Learned Interatomic Potentials

增强的基于表示的采样:用于机器学习相互原子势高效数据集生成的方法

Moritz René Schäfer, Johannes Kästner

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出ERBS方法,通过增强采样生成高效数据集,提升机器学习相互原子势的训练效果和自扩散系数模拟精度。

详情

展开后加载摘要…

URL PDF HTML 收藏