arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-16 至 2026-01-16 共收录 51 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 36 篇

2601.10022 2026-01-16 cond-mat.stat-mech physics.chem-ph 50%

Rotational Memory Function of SPC/E water

SPC/E水的旋转记忆函数

Dilipkumar N. Asthagiri, Dmitry V. Matyushov

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过计算SPC/E水单偶极子旋转和整体偶极矩的记忆函数,验证了介电光谱理论中单粒子和集体弛豫时间的关联,并表明短记忆时间支持旋转扩散模型用于描述水分子偶极矩动力学。

Comments 7 pp, 5 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09907 2026-01-16 cond-mat.stat-mech 50%

It Takes Two to Make a Thing Go Right: Boosting Current in Coupled Motors

两人协作才能让事情顺利进行:提升耦合电机的电流

Geyao Gu, Drew Alvarez, John Strahan, Alex Albaugh, Emanuele Penocchio, Todd R. Gingrich

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过机械耦合多个催化驱动分子电机,可提升电流并恢复偏倚,从而提高整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09889 2026-01-16 cond-mat.supr-con cond-mat.mes-hall 50%

Multiple Andreev Reflection Effects in Asymmetric STM Josephson Junctions

非对称扫描隧道显微镜约瑟夫森结中的多重安德鲁效应

Wan-Ting Liao, S. K. Dutta, R. E. Butera, C. J. Lobb, F. C. Wellstood, M. Dreyer

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究非对称STM约瑟夫森结中多重安德鲁效应的特性及影响因素,提出适用于此类结构的定量模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09861 2026-01-16 cond-mat.stat-mech cond-mat.soft 50%

Barrier-crossing and energy relaxation dynamics of non-Markovian inertial systems connected via analytical Green-Fokker-Planck approach

非马尔可夫惯性系统通过解析格林-福克-普朗克方法连接的势垒穿越和能量弛豫动力学

Roland R. Netz

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过解析格林-福克-普朗克方法,推导出非马尔可夫惯性系统的势垒穿越时间解析表达式,揭示了记忆效应与质量效应的相互作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11650 2026-01-16 cond-mat.mtrl-sci 50%

Influence of Exchange-Correlation Functionals and Neural Network Architectures on Li$^+$-Ion Conductivity in Solid-State Electrolyte from Molecular Dynamics Simulations with Machine-Learning Force Fields

交换关联泛函与神经网络架构对固态电解质中Li+离子导电性的影响:基于分子动力学模拟与机器学习力场

Zicun Li, Huanjing Gong, Ruijuan Xiao, Xinguo Ren

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了交换关联泛函和神经网络架构对固态电解质中Li+离子导电性的影响,发现不同泛函和网络架构对MLFF预测结果有显著影响,需建立标准化协议以减少模型依赖性偏倚。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00738 2026-01-16 astro-ph.IM astro-ph.SR hep-ex physics.ins-det 50%

First-principles response simulation of wide-gap CdTe-DSDs for the FOXSI solar sounding rocket experiment

宽能隙CdTe双面条带探测器的原理响应模拟用于FOXSI太阳 sounding火箭实验

Shunsaku Nagasawa, Takahiro Minami, Tadayuki Takahashi, Shin Watanabe

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种原理模拟框架,用于建模宽能隙CdTe双面条带探测器的响应,以解释FOXSI实验的观测结果并优化探测器设计。

Comments 21 pages, 13 figures, SPIE Optics + Photonics 2025 Proceeding Paper 13625-36

Journal ref Proc. SPIE 13625, UV, X-Ray, and Gamma-Ray Space Instrumentation for Astronomy XXIV; 136250Z (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10926 2026-01-16 quant-ph 50%

Quantum algorithm for solving McKean-Vlasov stochastic differential equations

求解麦克·沃斯随机微分方程的量子算法

Koichi Miyamoto

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种求解麦克·沃斯随机微分方程的量子算法,利用量子蒙特卡罗积分和高阶时间离散化方法,实现比经典粒子方法更高的计算效率。

Comments 36 pages, 8 figures

Journal ref EPJ Quantum Technology 13, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08457 2026-01-16 cs.SD eess.AS 50%

Audio Generation Through Score-Based Generative Modeling: Design Principles and Implementation

通过基于分数的生成模型进行音频生成:设计原则与实现

Ge Zhu, Yutong Wen, Zhiyao Duan

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文通过基于分数的生成模型设计原则和实现,探讨了音频生成、语音增强和文本到语音合成的应用,并提供了一个开源代码库以促进研究和开发。

Comments Accepted by Foundations and Trends in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05310 2026-01-16 cs.LG 50%

Learning normalized image densities via dual score matching

通过双分数匹配学习归一化图像密度

Florentin Guth, Zahra Kadkhodaie, Eero P Simoncelli

机构 * Center for Data Science, New York University(纽约大学数据科学中心) Flatiron Institute, Simons Foundation(Flatiron研究所,Simons基金会) New York University(纽约大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出通过双分数匹配学习归一化图像密度模型,实现能量的一致性和归一化,并在ImageNet64上取得与当前最佳相当的性能。

Journal ref The Thirty-Ninth Annual Conference on Neural Information Processing Systems, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
1608.01600 2026-01-16 cond-mat.str-el 50%

Transport and Optical Conductivity in the Hubbard Model: A High-Temperature Expansion Perspective

Hubbard模型中的输运与光学电导:高温度展开视角

Edward Perepelitsky, Andrew Galatas, Jernej Mravlje, Rok Žitko, Ehsan Khatami, B Sriram Shastry, Antoine Georges

专题命中 扩散模型 :diffusion(abstract)

AI总结 Hubbard模型中,通过高温度展开方法研究输运与光学电导,发现电阻率随温度线性增加,而散射时间饱和,热电功率遵循Heikes公式,洛伦兹数随温度平方倒数消失。

Comments 38 pages, 16 figures

Journal ref Phys. Rev. B 94, 235115 (2016)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 4 篇

2509.14981 2026-01-16 cs.CV 61%

SPATIALGEN: Layout-guided 3D Indoor Scene Generation

SPATIALGEN: 布局引导的3D室内场景生成

Chuan Fang, Heng Li, Yixun Liang, Jia Zheng, Yongsen Mao, Yuan Liu, Rui Tang, Zihan Zhou, Ping Tan

机构 * Hong Kong University of Science and Technology(香港科技大学) Manycore Tech Inc(Manycore科技公司)

专题命中 可控生成 :diffusion(abstract,comments);分类 cs.CV

AI总结 SPATIALGEN通过布局引导的多视角多模态扩散模型生成高质量3D室内场景,解决现有方法在视觉质量、多样性及语义一致性方面的不足。

Comments 3D scene generation; diffusion model; Scene reconstruction and understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10117 2026-01-16 cs.CV 57%

Beyond Single Prompts: Synergistic Fusion and Arrangement for VICL

超越单一提示:协同融合与排列用于VICL

Wenwen Liao, Jianbo Yu, Yuansong Wang, Shifu Yan, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Microelectronics, Fudan University(微电子学院,复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ByteDance Ltd.(字节跳动有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出一种端到端的VICL框架,通过自适应融合模块和排列特定MLP,解决单一提示选择和结构信息利用的问题,提升跨任务的修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09961 2026-01-16 cs.GT 50%

A Control Theoretic Approach to Decentralized AI Economy Stabilization via Dynamic Buyback-and-Burn Mechanisms

通过动态买回-烧毁机制实现去中心化人工智能经济稳定性的控制论方法

Zehua Cheng, Wei Dai, Zhipeng Wang, Rui Sun, Nick Wen, Jiahao Sun

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出动态控制买回机制,通过控制论框架降低去中心化人工智能经济的波动性与操作员流失率,提升系统稳定性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2601.10103 2026-01-16 cs.CV cs.AI 57%

FlowAct-R1: Towards Interactive Humanoid Video Generation

FlowAct-R1: 向交互式人形视频生成迈进

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu Hu, Shiyang Qin, Mingshuang Luo, Jiaxu Zhang, Xin Chen, Yulong Wang, Zerong Zheng, Jianwen Jiang, Chao Liang, Weifeng Chen, Xing Wang, Yuan Zhang, Mingyuan Gao

机构 * ByteDance Intelligent Creation(字节跳动智能创作)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FlowAct-R1通过分块扩散策略和高效优化,实现了实时交互式人形视频生成,具备高保真和低延迟的视频合成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08516 2026-01-16 cs.CV 57%

High-Quality 3D Head Reconstruction from Any Single Portrait Image

从任意单张肖像图像中高质量重建3D头像

Jianfu Zhang, Yujie Gao, Jiahui Zhan, Wentao Wang, Yiyi Zhang, Haohua Zhao, Liqing Zhang

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出一种从单张肖像图像生成高质量3D头像的方法,通过整合身份和表情信息提升重建精度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2502.05066 2026-01-16 cs.CV 70%

Beautiful Images, Toxic Words: Understanding and Addressing Offensive Text in Generated Images

美丽的图像,有毒的词语:理解并解决生成图像中的冒犯性文本

Aditya Kumar, Tom Blanchard, Adam Dziedzic, Franziska Boenisch

专题命中 图像生成评测 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种针对生成图像中冒犯性文本的微调策略,并发布了ToxicBench基准,用于评估和改进文本到图像模型的安全性。

Comments Accepted at AAAI 2026 (AI Alignment Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09084 2026-01-16 cs.CL cs.LG 50%

How Many Human Judgments Are Enough? Feasibility Limits of Human Preference Evaluation

需要多少人判断?人类偏好评估的可行性极限

Wilson Y. Lee

机构 * Independent Researcher(独立研究者)

专题命中 图像生成评测 :image generation(abstract)

AI总结 研究发现人类偏好评估中,当偏好信号分散时,比例分配是最佳策略,而精心设计的基准测试能通过减少方差提高检测性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2601.10200 2026-01-16 cs.CV 57%

ELITE: Efficient Gaussian Head Avatar from a Monocular Video via Learned Initialization and TEst-time Generative Adaptation

ELITE: 通过学习初始化和测试时生成适应从单目视频高效生成高斯头人偶

Kim Youwang, Lee Hyoseok, Subin Park, Gerard Pons-Moll, Tae-Hyun Oh

机构 * Dept. of Electrical Engineering, POSTECH(POSTECH电子工程系) School of Computing, KAIST(韩国科学技术院计算机学院) UNIST(全南大学) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 ELITE通过学习初始化和测试时生成适应,高效生成高斯头人偶,实现高保真和强野外泛化,合成速度比2D方法快60倍。

Comments Project page: https://kim-youwang.github.io/elite

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10708 2026-01-16 cs.LG math.ST stat.TH 50%

High-accuracy and dimension-free sampling with diffusions

高精度和无维度的扩散采样

Khashayar Gatmiry, Sitan Chen, Adil Salim

机构 * UC Berkeley(伯克利大学) Harvard University(哈佛大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于低次近似与插值方法的扩散模型求解器,实现了高精度采样且不依赖环境维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09882 2026-01-16 math.NA cs.NA math-ph math.MP 50%

An efficient probabilistic scheme for the exit time probability of $α$-stable Lévy process

一种高效的概率方案用于α-稳定莱维过程的退出时间概率

Minglei Yang, Diego del-Castillo-Negrete, Guannan Zhang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种高效方法,通过结合布朗运动与复合泊松过程,计算α-稳定莱维过程的退出时间概率,提升异常传输问题的计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏