arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-04 至 2026-02-04 共收录 88 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 68 篇

2602.02971 2026-02-04 physics.flu-dyn 50%

Nonlinear electrohydrodynamics of a surfactant-laden leaky dielectric drop

含表面活性剂的泄漏电介质液滴的非线性电液动力学

Michael A. McDougall, Stephen K. Wilson, Debasish Das

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了含表面活性剂的泄漏电介质液滴在电场下的非线性电液动力学行为,揭示了表面活性剂扩散对临界电场和Quincke旋转的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02900 2026-02-04 cs.LG cs.AI 50%

Manifold-Constrained Energy-Based Transition Models for Offline Reinforcement Learning

基于流形约束的能量过渡模型的离线强化学习

Zeyu Fang, Zuyuan Zhang, Mahdi Imani, Tian Lan

机构 * Department of Electrical and Computer Engineering, George Washington University(乔治华盛顿大学电气与计算机工程系) Department of Electrical and Computer Engineering, Northeastern University(东北大学电气与计算机工程系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 MC-ETM通过流形约束能量模型提升离线强化学习在分布偏移下的鲁棒性,通过能量景观优化和悲观惩罚稳定策略优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02677 2026-02-04 astro-ph.HE 50%

Lightcurve Modelling of 2,205 ZTF DR2 Type~Ia Supernovae: Implications for SN Ia Physics and Cosmology

2205颗ZTF DR2型Ia超新星光变曲线建模:对Ia型超新星物理和宇宙学的启示

Nikhil Sarin, Ellen Lindsjö, Lisa Kelsey, Matthew Grayling, Jesper Sollerman, Steve Schulze, Adam Miller, Madeleine Ginolin, Erin Hayes, Conor Omand, Kaisey Mandel, Aaron Do, Suhail Dhawan, Joel Johansson

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过建模2205颗Ia型超新星光变曲线,揭示了宿主质量对抛射物质量及镍产量的影响,为Ia型超新星标准化提供了物理基础,并量化了其多样性及环境依赖性。

Comments Submitted. 24 pages 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16340 2026-02-04 stat.AP 50%

Matrix-Response Generalized Linear Mixed Model with Applications to Longitudinal Brain Images

矩阵-响应广义线性混合模型及其在纵向脑影像中的应用

Zhentao Yu, Jiaqi Ding, Guorong Wu, Quefeng Li

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种矩阵-响应广义线性混合模型,用于分析纵向脑网络,并通过DTI和fMRI数据验证了其在高维影像数据中的应用效果。

Comments This research was supported by the National Institutes of Health under grant R01-AG073259

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14096 2026-02-04 cs.AI 50%

Remapping and navigation of an embedding space via error minimization: a fundamental organizational principle of cognition in natural and artificial systems

通过误差最小化重新映射和导航嵌入空间:认知在自然和人工系统中的基本组织原则

Benedikt Hartl, Léo Pio-Lopez, Chris Fields, Michael Levin

机构 * Allen Discovery Center at Tufts University(塔夫茨大学阿伦发现中心) Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学生物启发工程研究所)

专题命中 扩散模型 :diffusion(abstract)

AI总结 通过误差最小化重新映射和导航嵌入空间,揭示认知在自然和人工系统中的基本组织原则。

Comments 41 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09875 2026-02-04 cond-mat.mes-hall 50%

Hopper-Like Growth of Higher-Order Topological Insulators

类似跳跃的高阶拓扑绝缘体生长

Yutaro Tanaka, Shuai Zhang, Tiantian Zhang, Shuichi Murakami

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过拓扑电子态揭示高阶拓扑绝缘体呈现跳跃状晶体形态的机制,通过分形维度分析展示其与晶体生长的关系。

Comments 9+9 pages, 7+5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07899 2026-02-04 cond-mat.mes-hall cond-mat.str-el 50%

Unprecedented Spin-Lifetime of Itinerant Electrons in Natural Graphite Crystals

自然石墨晶体中它inerant电子前所未有的自旋寿命

Bence G. Márkus, Dávid Beke, Lili Vajtai, András Jánossy, László Forró, Ferenc Simon

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究在自然石墨晶体中观测到室温下超长自旋寿命,揭示了自旋弛豫的各向异性及扩散机制,为自旋电子学应用提供了新机遇。

Journal ref Adv. Funct. Mater. e16953 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08841 2026-02-04 cs.SI cs.CY 50%

Audit of takedown delays across social media reveals failure to reduce exposure to illegal content

对社交媒体下架延迟的审计揭示未能减少非法内容的曝光

Bao Tran Truong, Sangyeon Kim, Gianluca Nogara, Enrico Verdolotti, Erfan Samieyan Sahneh, Florian Saurwein, Natascha Just, Luca Luceri, Silvia Giordano, Filippo Menczer

专题命中 扩散模型 :diffusion(abstract)

AI总结 本研究通过分析社交媒体下架延迟,发现快速删除能显著减少非法内容的传播,而延迟删除效果有限,强调加快内容删除的重要性。

Comments 19 pages, 9 figures, 2 tables, 42 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.06860 2026-02-04 math.NA cs.NA 50%

Error estimates for completely discrete FEM in energy-type and weaker norms

能量型及更弱规范下完全离散有限元法的误差估计

Lutz Angermann, Peter Knabner, Andreas Rupp

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了完全离散有限元法在能量型及更弱规范下的误差估计,通过两种稳定离散化方法获得最优误差估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 6 篇

2602.03126 2026-02-04 cs.CV 79%

Flexible Geometric Guidance for Probabilistic Human Pose Estimation with Diffusion Models

基于扩散模型的灵活几何引导用于概率人体姿态估计

Francis Snelgar, Ming Xu, Stephen Gould, Liang Zheng, Akshay Asthana

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院) Seeing Machines

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出了一种基于扩散模型的灵活几何引导方法,用于概率人体姿态估计,通过引导框架实现从2D图像中生成一致的3D姿态,无需配对数据训练,展示了在多个数据集上的高性能和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03826 2026-02-04 cs.CV cs.GR 62%

Continuous Control of Editing Models via Adaptive-Origin Guidance

通过自适应起源引导实现编辑模型的连续控制

Alon Wolf, Chen Katzir, Kfir Aberman, Or Patashnik

机构 * Tel Aviv University, Decart.ai(特拉维夫大学,Decart.ai) Tel Aviv University(特拉维夫大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 本文提出AdaOr方法,通过自适应调整指导起源实现编辑模型的连续强度控制,提升编辑过程的平滑性和一致性。

Comments Project page at https://adaor-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03339 2026-02-04 cs.CV 57%

Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability

可组合的视觉标记生成器:无生成器诊断的可学习性

Bingchen Zhao, Qiushan Guo, Ye Wang, Yixuan Huang, Zhonghua Zhai, Yu Tian

机构 * University of Edinburgh(爱丁堡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CompTok通过训练可组合的视觉标记生成器,提升图像生成的组合性和语义编辑能力,同时引入两个度量标准评估标记空间的可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03314 2026-02-04 cs.CV 57%

PQTNet: Pixel-wise Quantitative Thermography Neural Network for Estimating Defect Depth in Polylactic Acid Parts by Additive Manufacturing

PQTNet:用于通过增材制造估计聚乳酸部件缺陷深度的像素级定量热成像神经网络

Lei Deng, Wenhao Huang, Chao Yang, Haoyuan Zheng, Yinbin Tian, Yue Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PQTNet通过像素级定量热成像神经网络,实现了对增材制造聚乳酸部件缺陷深度的高精度估计,具有高精度和鲁棒性的定量缺陷表征能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03105 2026-02-04 cs.CV 57%

Gromov Wasserstein Optimal Transport for Semantic Correspondences

Gromov Wasserstein最优传输用于语义对应关系

Francis Snelgar, Stephen Gould, Ming Xu, Liang Zheng, Akshay Asthana

机构 * Seeing Machines

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出使用 Gromov Wasserstein 最优传输算法替代传统方法,提升语义对应关系任务的性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13264 2026-02-04 physics.optics physics.atom-ph quant-ph 50%

High-Precision Phase Control of an Optical Lattice with up to 50 dB Noise Suppression

光学晶格高精度相位控制及50dB噪声抑制

Kendall Mehling, Murray Holland, Catie LeDesma

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出了一种高精度光学晶格相位控制方法,通过双频差锁技术实现50dB噪声抑制,支持高带宽调制,用于原子干涉仪的复杂相位操控。

Comments 8 pages, 4 figures

Journal ref Phys. Rev. Applied 25, 024008 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2602.03013 2026-02-04 cs.CV 79%

Thinking inside the Convolution for Image Inpainting: Reconstructing Texture via Structure under Global and Local Side

在卷积中思考图像修复:通过结构下采样重建纹理

Haipeng Liu, Yang Wang, Biao Qian, Yong Rui, Meng Wang

机构 * School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Lenovo Research(联想研究院)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出通过结构和纹理特征图的统计归一化和去归一化策略,缓解卷积下采样中的信息损失,提升图像修复的高质量输出。

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2602.02033 2026-02-04 cs.CV cs.AI cs.MM 81%

One Size, Many Fits: Aligning Diverse Group-Wise Click Preferences in Large-Scale Advertising Image Generation

一个尺寸,多种适配:在大规模广告图像生成中对多样化群体点击偏好进行对齐

Shuo Lu, Haohan Wang, Wei Feng, Weizhen Wang, Shen Zhang, Yaoyu Li, Ao Ma, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Bing Zhan, Yuan Xu, Huizai Yao, Yongcan Yu, Chenyang Si, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院长春光学精密机械与物理研究所 & 中国科学院自动化所) School of AI, UCAS(中国科学院大学人工智能学院) HKUST(gz)(香港科技大学) PRLab, NJU(南京大学PRLab)

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出OSMF框架,通过自适应分组和群组感知多模态模型,解决广告图像生成中用户群体点击偏好多样性的优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 57%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 图像生成评测 :image synthesis(abstract);分类 cs.CV

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02955 2026-02-04 cs.SD cs.AI cs.LG 50%

Synthetic Data Augmentation for Medical Audio Classification: A Preliminary Evaluation

医学音频分类中的合成数据增强:初步评估

David McShannon, Anthony Mella, Nicholas Dietrich

机构 * Independent Researcher(独立研究者) University of Toronto(多伦多大学)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本研究评估了合成数据增强在医学音频分类中的效果,发现仅在模型集合中应用增强时,F1分数有所提升,但标准CNN分类器未见明显性能提升。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 9 篇

2602.03182 2026-02-04 cs.CV 79%

LSGQuant: Layer-Sensitivity Guided Quantization for One-Step Diffusion Real-World Video Super-Resolution

LSGQuant: 层敏感性引导的量化方法用于一步扩散现实视频超分辨率

Tianxing Wu, Zheng Chen, Cirou Xu, Bowen Chai, Yong Guo, Yutong Liu, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei(华为)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 LSGQuant 通过动态范围自适应量化器和层敏感性引导策略,实现了一步扩散现实视频超分辨率的高效量化方法,显著提升了模型压缩效果。

Comments Code is available at: https://github.com/zhengchen1999/LSGQuant

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03627 2026-02-04 cs.LG 78%

Ultra Fast PDE Solving via Physics Guided Few-step Diffusion

通过物理引导的少步扩散实现超快PDE求解

Cindy Xiangrui Kong, Yueqi Wang, Haoyang Zheng, Weijian Luo, Guang Lin

机构 * Purdue University(普渡大学) hi-Lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 Phys-Instruct通过物理引导的蒸馏框架,实现PDE求解的高效与高物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03208 2026-02-04 cs.LG cs.CV 74%

Spectral Evolution Search: Efficient Inference-Time Scaling for Reward-Aligned Image Generation

谱演化搜索:用于奖励对齐图像生成的高效推理时缩放

Jinyan Ye, Zhongjie Duan, Zhiwen Li, Cen Chen, Daoyuan Chen, Yaliang Li, Yingda Chen

机构 * School of Data Science and Engineering, East China Normal University, Shanghai, China(数据科学与工程学院,东华大学,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)

专题命中 效率与蒸馏 :image generation(title);分类 cs.CV

AI总结 本文提出谱演化搜索(SES),通过在低频子空间内执行梯度自由演化搜索,提升奖励对齐图像生成的效率和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02571 2026-02-04 cs.LG cs.AI cs.CV 70%

Trajectory Consistency for One-Step Generation on Euler Mean Flows

Euler均流用于欧拉步生成的轨迹一致性

Zhiqi Li, Yuchen Sun, Duowen Chen, Jinjin He, Bo Zhu

机构 * College of Computing, Georgia Tech, Location, Country(计算学院,佐治亚理工学院)

专题命中 效率与蒸馏 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出Euler均流框架,通过线性替代物实现长时间轨迹一致性,提升生成稳定性与效率,减少训练时间和内存消耗。

Comments 40 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02820 2026-02-04 cs.LG cs.AI cs.CV 57%

From Tokens to Numbers: Continuous Number Modeling for SVG Generation

从标记到数字:用于SVG生成的连续数字建模

Michael Ogezi, Martin Bell, Freda Shi, Ethan Smith

机构 * Cheriton School of Computer Science, University of Waterloo, Waterloo, ON, Canada(滑铁卢大学计算机科学学院) Vector Institute(向量研究所)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 本文提出连续数字建模(CNM)方法,通过直接建模连续数值提升SVG生成的效率与质量,实现训练速度提升30%及更高的视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03789 2026-02-04 stat.ML cs.AI cs.LG 50%

Fast Sampling for Flows and Diffusions with Lazy and Point Mass Stochastic Interpolants

流与扩散的快速采样:懒惰与点质量随机插值法

Gabriel Damsholt, Jes Frellsen, Susanne Ditlevsen

机构 * University of Copenhagen(哥本哈根大学) Technical University of Denmark(丹麦技术大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于懒惰和点质量随机插值法的快速采样方法,用于流和扩散模型,通过转换插值计划和扩散系数,提升生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02945 2026-02-04 stat.CO cs.NA math.NA 50%

Bayesian Methods for the Navier-Stokes Equations

贝叶斯方法用于纳维-斯托克斯方程

Nicholas Polson, Vadim Sokolov

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种贝叶斯方法用于求解具有不确定性的纳维-斯托克斯方程,通过粒子学习和随机表示提升计算稳定性与不确定性传播效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02811 2026-02-04 cs.CE 50%

Efficient Counterfactual Estimation of Conditional Greeks via Malliavin-based Weak Derivatives

通过马尔可夫算子弱导数高效估计条件希腊值

Vikram Krishnamurthy, Luke Snow

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于马尔可夫算子弱导数的高效方法,用于估计稀有事件下的条件希腊值,通过两阶段无核技术提升反事实梯度估计的效率和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02735 2026-02-04 cs.LG 50%

TabPFN for Zero-shot Parametric Engineering Design Generation

基于TabPFN的零样本参数化工程设计生成

Ke Wang, Yifan Tang, Nguyen Gia Hien Vu, Faez Ahmed, G. Gary Wang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 基于TabPFN的零样本生成方法,通过少量参考样本实现高效参数化工程设计生成,减少计算和数据需求,提升设计灵活性和实用性。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏