arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-09 至 2026-01-09 共收录 51 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 35 篇

2411.16092 2026-01-09 cond-mat.mtrl-sci physics.app-ph physics.ins-det 50%

Electronic Trap Detection with Carrier-Resolved Photo-Hall Effect

利用载流子分辨的光电Hall效应检测电子陷阱

Oki Gunawan, Chaeyoun Kim, Bonfilio Nainggolan, Minyeul Lee, Jonghwa Shin, Dong Suk Kim, Yimhyun Jo, Minjin Kim, Julie Euvrard, Douglas Bishop, Frank Libsch, Teodor Todorov, Yunna Kim, Byungha Shin

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究提出了一种基于光电Hall效应的新方法,用于检测和表征半导体中的电子陷阱状态,同时提取载流子属性,通过分析光电Hall电导与电导率的关系,揭示了电荷输运和陷阱占据的详细信息。

Comments Main manuscript (15 pages, 3 figures) and Supplementary information (27 pages, 7 figures, 4 tables)

Journal ref Science Advances 12, eadz0460 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09179 2026-01-09 q-fin.RM q-fin.MF 50%

Credit Spreads' Term Structure: Stochastic Modeling with CIR++ Intensity

信用利差的期限结构:基于CIR++强度的随机建模

Mohamed Ben Alaya, Ahmed Kebaier, Djibril Sarr

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出基于CIR++模型的信用利差随机建模方法,填补了信用利差期限结构建模的空白,通过校准方法实现对信用利差的准确预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.08893 2026-01-09 cond-mat.dis-nn cond-mat.str-el 50%

Stark-Many body localization in interacting infinite dimensional systems

强场多体局域化在相互作用的无限维系统中

Hristiana Atanasova, André Erpenbeck, Emanuel Gull, Yevgeny Bar Lev, Guy Cohen

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了强场多体局域化在无限维相互作用系统中的输运特性,发现电场强度与相互作用强度的关系影响输运行为,从正常扩散到亚扩散再到超扩散,最终出现局域化。

Journal ref Phys. Rev. Lett. 132, 166301 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04746 2026-01-09 math.DS 50%

Dynamics of Interfaces in the Two-Dimensional Wave-Pinning Model

二维波固定模型中界面的动力学

Shunsuke Kobayashi, Koya Sakakibara, Taikei Uechi

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究揭示了二维波固定模型中界面在三个不同时间尺度上的动力学行为:快速传播、慢速曲率驱动演化和边界移动。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04396 2026-01-09 cs.CE 50%

Inference in the presence of model-form uncertainties: Leveraging a prediction-oriented approach to improve uncertainty characterization

在模型形式不确定性下进行推断:利用以预测为导向的方法改进不确定性表征

Rebekah White, Rileigh Bandy, Teresa Portone

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出以预测为导向的推断方法,用于改进模型形式不确定性下的不确定性表征,通过多项式模型和污染物传输问题验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04386 2026-01-09 physics.flu-dyn 50%

Numerical Investigation of the Effect of a Magnetic Field on the Transport of Oxygen in Air

磁场对空气中氧运输影响的数值研究

Alexander C. Kruse, Pavlos G. Aleiferis, Andrea Giusti

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究通过数值模拟探讨了磁场对空气氧运输的影响,发现磁化力导致物种分离和增强运输,压力降低会增强该效应,且混合物组成梯度可优化流场以实现定向混合。

Comments Submitted to Physics of Fluids

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04238 2026-01-09 cs.CY 50%

Generative AI for Social Impact

生成式AI用于社会影响

Lingkai Kong, Cheol Woo Kim, Davin Choo, Milind Tambe

专题命中 扩散模型 :diffusion(abstract)

AI总结 生成式AI通过LLM代理和扩散模型解决社会影响中的部署瓶颈,实现可扩展且人类对齐的资源优化系统。

Comments To appear in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04112 2026-01-09 math.NA cs.NA 50%

Algebraic Multigrid with Overlapping Schwarz Smoothers and Local Spectral Coarse Grids for Least Squares Problems

具有重叠Schwarz平滑器和局部频谱粗网格的代数多重网格法用于最小二乘问题

Ben S. Southworth, Hussam Al Daas, Golo A. Wimmer, Ed Threlfall

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于代数多重网格和域分解的最小二乘问题求解方法,通过局部频谱粗空间和重叠Schwarz平滑器实现高效鲁棒收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.13863 2026-01-09 cond-mat.stat-mech 50%

Anisotropic Landau-Lifshitz Model in Discrete Space-Time

各向异性Landau-Lifshitz模型在离散时空中的应用

Žiga Krajnik, Enej Ilievski, Tomaž Prosen, Vincent Pasquier

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究提出了一种离散时空中的各向异性Landau-Lifshitz模型,用于计算自旋Drude重量和扩散常数,并揭示了不同各向异性区域下的行为差异及向自旋超扩散的过渡。

Comments 20 pages, 9 figures; V2: typos corrected, a few DOIs added; V3: mistake in Eq. (2.20) corrected, V4: Corrected typo in Eq. (2.43) - primes in (2, 2) matrix element swapped

Journal ref SciPost Phys. 11, 051 (2021)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 5 篇

2403.04279 2026-01-09 cs.CV 89%

Controllable Generation with Text-to-Image Diffusion Models: A Survey

基于文本到图像扩散模型的可控生成:综述

Pu Cao, Feng Zhou, Qing Song, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本文综述了基于文本到图像扩散模型的可控生成方法,分析了不同条件下的生成机制及分类。

Comments TPAMI 2025; A collection of resources on controllable generation with text-to-image diffusion models: https://github.com/PRIV-Creation/Awesome-Controllable-T2I-Diffusion-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05124 2026-01-09 cs.CV 79%

Re-Align: Structured Reasoning-guided Alignment for In-Context Image Generation and Editing

Re-Align:基于结构化推理的对齐方法用于上下文图像生成与编辑

Runze He, Yiji Cheng, Tiankai Hang, Zhimin Li, Yu Xu, Zijin Yin, Shiyi Zhang, Wenxun Dai, Penghui Du, Ao Ma, Chunyu Wang, Qinglin Lu, Jizhong Han, Jiao Dai

机构 * Hunyuan, Tencent(腾讯文库) IIE, CAS(中国科学院信息工程研究所) UCAS Project Page(中国科学技术大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 Re-Align通过结构化推理引导的对齐方法,提升上下文图像生成与编辑任务的性能。

Comments 13 pages, 9 figures, project page: https://github.com/hrz2000/realign

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05246 2026-01-09 cs.CV 57%

Pixel-Perfect Visual Geometry Estimation

像素级视觉几何估计

Gangwei Xu, Haotong Lin, Hongcheng Luo, Haiyang Sun, Bing Wang, Guang Chen, Sida Peng, Hangjun Ye, Xin Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Xiaomi EV(小米电动车)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。

Comments Code: https://github.com/gangweix/pixel-perfect-depth

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10688 2026-01-09 cs.CV 57%

Novel View Synthesis using DDIM Inversion

基于DDIM反向的新型视图合成

Sehajdeep Singh, A V Subramanyam, Aditya Gupta, Sahil Gupta

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔大学信息科技学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于DDIM反向的轻量级视图合成方法,利用预训练扩散模型生成高质量新视角重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15338 2026-01-09 econ.TH math.OC 50%

Network-Based Optimal Control of Pollution Growth

基于网络的污染增长最优控制

Fausto Gozzi, Marta Leocata, Giulia Pucci

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种基于网络结构的污染扩散最优控制模型,通过分析绿色与非绿色技术的权衡,解决了线性污染成本下的最优控制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 2 篇

2601.05241 2026-01-09 cs.CV cs.AI cs.RO 57%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05036 2026-01-09 quant-ph cs.AI cs.LG 50%

Exponential capacity scaling of classical GANs compared to hybrid latent style-based quantum GANs

经典GAN的指数容量扩展与混合潜在风格量子GAN的比较

Milan Liepelt, Julien Baglio

机构 * Center for Quantum Computing(量子计算中心) Quantum Coherence (QC2), University of Basel(量子相干性(QC2),巴塞尔大学)

专题命中 个性化与一致性 :image generation(abstract)

AI总结 本文研究了混合潜在风格量子GAN在图像生成中的指数容量优势,发现经典GAN与量子GAN在参数规模上呈指数级增长关系。

Comments 34 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2601.04300 2026-01-09 cs.CV 79%

Beyond Binary Preference: Aligning Diffusion Models to Fine-grained Criteria by Decoupling Attributes

超越二元偏好:通过解耦属性对齐扩散模型以实现细粒度标准

Chenye Meng, Zejian Li, Zhongni Liu, Yize Li, Changle Xie, Kaixin Jia, Ling Yang, Huanghuang Deng, Shiying Ding, Shengyuan Zhang, Jiayi Li, Lingyun Sun

机构 * Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Nottingham Ningbo China(诺丁汉大学宁波分校)

专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出CPO方法,通过解耦属性实现扩散模型对细粒度标准的对齐,提升生成质量与专业对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11041 2026-01-09 cs.CV 57%

Beyond Fixed Topologies: Unregistered Training and Comprehensive Evaluation Metrics for 3D Talking Heads

超越固定拓扑:用于3D说话人脸的无注册训练和综合评估指标

Federico Nocentini, Thomas Besnier, Claudio Ferrari, Sylvain Arguillere, Mohamed Daoudi, Stefano Berretti

机构 * MICC, University of Florence(佛罗伦萨大学MICC) CRIStAL, University of Lille, CNRS, Centrale Lille(里尔大学CRIStAL) IMT Nord Europe, University of Lille(里尔大学IMT Nord Europe) Dept. of Information Engineering and Mathematics, University of Siena(锡耶纳大学信息工程与数学系) Laboratoire Paul Painlevé, University of Lille, CNRS(里尔大学Paul Painlevé实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种能够处理任意拓扑的3D说话人脸生成方法,通过热扩散预测鲁棒特征,并引入新的评估指标以提升唇同步效果。

Comments https://fedenoce.github.io/scantalk/

Journal ref International Journal of Computer Vision 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2505.21400 2026-01-09 cs.LG cs.IT math.IT math.ST stat.ML stat.TH 78%

Breaking AR's Sampling Bottleneck: Provable Acceleration via Diffusion Language Models

突破生成模型的采样瓶颈:通过扩散语言模型实现可证明的加速

Gen Li, Changxiao Cai

机构 * Department of Statistics and Data Science, Chinese University of Hong Kong, Hong Kong(统计与数据科学系,香港中文大学) Department of Industrial and Operations Engineering, University of Michigan, Ann Arbor, USA(工业与运营管理系,密歇根大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文从信息论角度为扩散语言模型提供收敛保证,证明采样误差随迭代次数减少而降低,从而突破自回归模型所需的L步瓶颈,为生成高质量样本提供理论支持。

Comments This is the full version of a paper published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04792 2026-01-09 cs.CV 57%

PyramidalWan: On Making Pretrained Video Model Pyramidal for Efficient Inference

PyramidalWan: 关于使预训练视频模型金字塔化以实现高效推理

Denis Korzhenkov, Adil Karjauv, Animesh Karnewar, Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 PyramidalWan通过低成本微调将预训练扩散模型转换为金字塔模型,提升视频推理效率并保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2601.04785 2026-01-09 cs.CV cs.AI 57%

SRU-Pix2Pix: A Fusion-Driven Generator Network for Medical Image Translation with Few-Shot Learning

SRU-Pix2Pix:一种融合驱动的生成器网络用于医学图像翻译的少样本学习

Xihe Qiu, Yang Dai, Xiaoyu Tan, Sijia Li, Fenghao Sun, Lu Gan, Liang Liu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子电气工程学院) Department of Thoracic Surgery, Zhongshan Hospital of Fudan University(复旦大学中山医院胸外科) Clinical Research Unit, Institute of Clinical Science, Zhongshan Hospital of Fudan University(复旦大学中山医院临床科研部) Department of Medical Oncology, Cancer Center, and Fudan Zhangjiang Institute, Zhongshan Hospital of Fudan University(复旦大学中山医院医学肿瘤科、癌症中心及复旦张江研究院)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 SRU-Pix2Pix通过整合SEResNet和U-Net++提升医学图像翻译的生成质量与结构保真度,实现少样本下的高效翻译

详情

展开后加载摘要…

URL PDF HTML 收藏