arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-30 至 2026-01-30 共收录 84 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 65 篇

2506.13551 2026-01-30 math.AP q-bio.PE 50%

Kinetic formulation of compartmental epidemic models

人口 compartmental 感染模型的动力学表述

Carolina Strecht-Fernandes, Fabio A. C. C. Chalub

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种将人口运动与病原体动态耦合的动力学模型,证明其与SIRS模型的兼容性,并探讨了其在流行病学中的应用。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07319 2026-01-30 cond-mat.mtrl-sci 50%

GPR_calculator: An On-the-Fly Surrogate Model to Accelerate Massive Nudged Elastic Band Calculations

GPR_calculator:一种用于加速大规模受迫弹性带计算的实时替代模型

Isaac Onyango, Byungkyun Kang, Qiang Zhu

专题命中 扩散模型 :diffusion(abstract)

AI总结 GPR_calculator通过高斯过程回归实时构建替代模型,加速受迫弹性带计算中的电子结构模拟,实现3-10倍的计算效率提升。

Comments 12 pages, 7 figures

Journal ref Comput. Phys. Commun., 2025, 316, 109781

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19229 2026-01-30 physics.flu-dyn cond-mat.soft 50%

Nonlinear dynamics of air invasion in one-dimensional compliant fluid networks

一维顺应性流体网络中空气侵入的非线性动力学

Ludovic Jami, François-Xavier Gauci, Céline Cohen, Xavier Noblin, Ludovic Keiser

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究一维顺应性流体网络中空气侵入的非线性动力学,揭示网络顺应性与粘性耗散的相互作用,以及压力扩散与质子渗透时间尺度的竞争对复杂行为的影响。

Comments 19 pages, 8 figures

Journal ref Phys. Rev. E 113, 015103 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05194 2026-01-30 astro-ph.CO 50%

Press-Schechter Formalism and The PBH Mass Distributions

压强-谢切伯理论与PBH质量分布

Owais Farooq, Romana Zahoor, Balungi Francis

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文基于压强-谢切伯理论和逃逸集构造,推导了原初黑洞的质量分布,并通过辐射时期传输和视界进入缩放,计算了现今PBH暗物质分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08226 2026-01-30 math.AP 50%

The Cauchy Problem For Quasi-Linear Parabolic Systems Revisited

对准线性抛物型系统Cauchy问题的重新审视

Isabelle Gallagher, Ayman Moussa

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文重新审视了准线性抛物型系统Cauchy问题的局部适定性,探讨了Sobolev和Besov空间中的解的存在性,并在SKT系统中验证了非负强解的存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.15462 2026-01-30 physics.med-ph 50%

DeLTA-BIT: an open-source probabilistic tractography-based deep learning framework for thalamic targeting in functional neurological disorders

DeLTA-BIT:一种基于概率束管图的深度学习框架,用于功能性神经疾病中的丘脑靶向

Mattia Romeo, Cesare Gagliardo, Grazia Cottone, Giorgio Collura, Enrico Maggio, Claudio Runfola, Eleonora Bruno, Maria Cristina D'Oca, Massimo Midiri, Francesca Lizzi, Ian Postuma, Marco D'Amelio, Alessandro Lascialfari, Alessandra Retico, Maurizio Marrale

专题命中 扩散模型 :diffusion(abstract)

AI总结 DeLTA-BIT通过基于概率束管图的深度学习框架,快速预测功能性神经疾病中丘脑的靶向位置,提升临床应用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2601.21498 2026-01-30 cs.CV cs.AI 83%

SimGraph: A Unified Framework for Scene Graph-Based Image Generation and Editing

SimGraph:基于场景图的图像生成与编辑统一框架

Thanh-Nhan Vo, Trong-Thuan Nguyen, Tam V. Nguyen, Minh-Triet Tran

机构 * University of Science, VNU-HCM(越南国家大学胡志明市分校) Vietnam National University(越南国家大学) University of Dayton(戴维森大学)

专题命中 可控生成 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 SimGraph通过整合基于场景图的生成与编辑,实现了对物体关系和空间布局的精准控制,提升图像生成与编辑的一致性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21633 2026-01-30 cs.CV 79%

A Tilted Seesaw: Revisiting Autoencoder Trade-off for Controllable Diffusion

倾斜的锯齿:重新审视自动编码器在可控扩散中的权衡

Pu Cao, Yiyang Ma, Feng Zhou, Xuedan Yin, Qing Song, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文研究了自动编码器在可控扩散中的权衡问题,发现gFID指标在可控性评估中表现不佳,而重建导向的指标更能反映可控性,提出了更可靠的评估方法。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06279 2026-01-30 cs.CV cs.AI cs.GR cs.MA 62%

NoiseNCA: Noisy Seed Improves Spatio-Temporal Continuity of Neural Cellular Automata

NoiseNCA: 噪声种子提升神经细胞自动机的时空连续性

Ehsan Pajouheshgar, Yitao Xu, Sabine Süsstrunk

机构 * School of Computer and Communication Sciences, EPFL, Switzerland(计算机与通信科学学院,瑞士联邦理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 NoiseNCA通过引入噪声种子提升神经细胞自动机的时空连续性,实现对模式形成速度和尺度的连续控制,拓展了NCA在动态系统中的应用。

Comments 9 pages, 12 figures

Journal ref ALIFE 2024: Proceedings of the 2024 Artificial Life Conference July 22-26, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22522 2026-01-30 cs.LG cs.CV 57%

JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation

JointDiff: 在多智能体轨迹生成中弥合连续与离散

Guillem Capellera, Luis Ferraz, Antonio Rubio, Alexandre Alahi, Antonio Agudo

机构 * Kognia Sports Intelligence(Kognia体育智能) Visual Intelligence for Transportation, EPFL(交通视觉智能,EPFL) Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息工业研究所,CSIC-UPC)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 JointDiff通过联合生成连续和离散事件,提升多智能体轨迹生成的可控性和真实性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21899 2026-01-30 cs.LG 50%

Breaking the Regional Barrier: Inductive Semantic Topology Learning for Worldwide Air Quality Forecasting

突破区域壁垒:为全球空气质量预测的归纳语义拓扑学习

Zhiqing Cui, Siru Zhong, Ming Jin, Shirui Pan, Qingsong Wen, Yuxuan Liang

机构 * The Hong Kong University of Science(香港科学与技术大学) Griffith University, Australia(格里菲斯大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 OmniAir通过语义拓扑学习框架提升全球空气质量预测的泛化能力,实现高效准确的预测并弥补数据稀疏区域的监测缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16740 2026-01-30 cs.HC 50%

Evaluating Generative AI in the Lab: Methodological Challenges and Guidelines

在实验室中评估生成式AI:方法学挑战与指南

Hyerim Park, Khanh Huynh, Malin Eiband, Jeremy Dillmann, Sven Mayer, Michael Sedlmair

专题命中 可控生成 :image generation(abstract)

AI总结 本文探讨了在实验室环境中评估生成式AI的方法学挑战,提出了五个指南和十八项建议,以帮助研究人员设计更透明和稳健的评估研究。

Comments 18 pages, 3 figures, IUI '26 (the 31st International Conference on Intelligent User Interfaces)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03147 2026-01-30 cs.HC cs.CL cs.LG cs.SD eess.AS 50%

A conversational gesture synthesis system based on emotions and semantics

基于情感和语义的对话手势合成系统

Thanh Hoang-Minh

机构 * Department of Information Technology, VNUHCM -- University of Science(越南科学大学信息科技系)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出DeepGesture,一种基于扩散的 gesture 合成系统,通过多模态信号生成具有情感和语义条件的手势,提升数字人类的自然表达能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2601.20911 2026-01-30 cs.CV cs.AI 79%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23515 2026-01-30 cs.CV 70%

FreeFuse: Multi-Subject LoRA Fusion via Adaptive Token-Level Routing at Test Time

FreeFuse: 通过测试时自适应的token级路由实现多主体LoRA融合

Yaoli Liu, Yao-Xiang Ding, Kun Zhou

机构 * State Key Laboratory of CAD&CG(计算机辅助设计与图形学国家重点实验室)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 FreeFuse通过测试时自适应token级路由实现多主体LoRA融合,无需额外训练或模型修改,仅需主体激活词即可实现无缝图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17323 2026-01-30 cs.CV 70%

SkyReels-V3 Technique Report

SkyReels-V3 技术报告

Debang Li, Zhengcong Fei, Tuanhui Li, Yikun Dou, Zheng Chen, Jiangping Yang, Mingyuan Fan, Jingtao Xu, Jiahua Wang, Baoxuan Gu, Mingshan Chang, Wenjing Cai, Yuqiang Xie, Binjie Mao, Youqiang Zhang, Nuo Pang, Hao Zhang, Yuzhe Jin, Zhiheng Xu, Dixuan Lin, Guibin Chen, Yahui Zhou

机构 * SkyReels Team(SkyReels 团队)

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 SkyReels-V3 提出三种视频生成范式,通过多模态上下文学习框架实现高质量视频生成,涵盖图像到视频、视频扩展和音频引导生成,达到接近闭源系统的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 1 篇

2601.04589 2026-01-30 cs.CV 57%

MiLDEdit: Reasoning-Based Multi-Layer Design Document Editing

MiLDEdit: 基于推理的多层设计文档编辑

Zihao Lin, Wanrong Zhu, Jiuxiang Gu, Jihyung Kil, Christopher Tensmeyer, Lin Zhang, Shilong Liu, Ruiyi Zhang, Lifu Huang, Vlad I. Morariu, Tong Sun

机构 * University of California, Davis(加州大学戴维斯分校) Adobe(Adobe公司) UW-Madison(威斯康星大学麦迪逊分校) Princeton University(普林斯顿大学)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 MiLDEdit通过引入基于推理的多层文档编辑代理,实现了对多层设计文档的精准编辑,显著超越现有方法,建立了该领域的首个强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2601.21238 2026-01-30 cs.CV cs.AI 57%

PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models

PTQ4ARVG:后训练量化用于自回归视觉生成模型

Xuewen Liu, Zhikai Li, Jing Zhang, Mengjuan Chen, Qingyi Gu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 PTQ4ARVG提出一种无需训练的后训练量化框架,解决ARVG模型在通道、令牌和样本层面的量化难题,实现8位和6位高效量化。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08742 2026-01-30 cs.CV 57%

Efficient4D: Fast Dynamic 3D Object Generation from a Single-view Video

Efficient4D: 从单视角视频快速生成动态3D对象

Zijie Pan, Zeyu Yang, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Surrey(Surrey大学)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 Efficient4D通过高效框架实现从单视角视频快速生成动态3D对象,提升速度10倍并保持高质量

Comments IJCV version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20973 2026-01-30 math.OC 50%

Thompson Sampling Algorithm for Stochastic Games

带有随机成本的随机博弈的汤普森采样算法

Asaf Cohen, Ruolan He, Yuqiong Wang

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出了一种基于汤普森采样的算法,用于解决具有随机成本的随机博弈问题,证明该算法在时间范围内具有渐近零的平均遗憾,并达到纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16597 2026-01-30 stat.ML cs.LG math.ST stat.TH 50%

Efficient Learning of Stationary Diffusions with Stein-type Discrepancies

高效学习平稳扩散的Stein型不一致度

Fabian Bleile, Sarah Lumpp, Mathias Drton

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出Stein型KDS方法,用于高效学习平稳扩散,通过凸优化减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01021 2026-01-30 cs.LG 50%

Expanding the Chaos: Neural Operator for Stochastic (Partial) Differential Equations

扩展混沌:用于随机(偏)微分方程的神经算子

Dai Shi, Lequan Lin, Andi Han, Luke Thompson, José Miguel Hernández-Lobato, Zhiyong Wang, Junbin Gao

机构 * University of Cambridge(剑桥大学) University of Sydney(悉尼大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出基于Wiener-chaos展开的神经算子,用于高效求解随机微分方程和随机偏微分方程,通过参数化混沌系数实现快速轨迹重建,并在多个任务中展示了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05844 2026-01-30 cs.LG cs.AI 50%

NEAT: Neighborhood-Guided, Efficient, Autoregressive Set Transformer for 3D Molecular Generation

NEAT:基于邻域指导、高效、自回归的集合变换器用于3D分子生成

Daniel Rose, Roxane Axel Jacob, Johannes Kirchmair, Thierry Langer

机构 * Department of Pharmaceutical Sciences, University of Vienna(维也纳大学药学系) Christian Doppler Laboratory for Molecular Informatics in the Biosciences(生物医学分子信息学克里斯蒂安·多普勒实验室) Vienna Doctoral School of Pharmaceutical, Nutritional and Sport Sciences(维也纳药学、营养学和运动科学博士学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 NEAT是一种基于邻域指导、高效、自回归的集合变换器,用于3D分子生成,通过不依赖顺序的分布学习实现原子排列不变性,提升生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2601.22093 2026-01-30 cs.CY cs.AI 50%

Investigating Associational Biases in Inter-Model Communication of Large Generative Models

研究大生成模型跨模型通信中的关联偏差

Fethiye Irmak Dogan, Yuval Weiss, Kajal Patel, Jiaee Cheong, Hatice Gunes

机构 * University of Cambridge(剑桥大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 其他图像生成 :image generation(abstract)

AI总结 本研究探讨大生成模型跨模型通信中的关联偏差,通过数据集分析发现人口分布漂移,并提出缓解策略以减少不平等影响。

详情

展开后加载摘要…

URL PDF HTML 收藏