arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-11 至 2025-12-11 共收录 51 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 33 篇

2512.09224 2025-12-11 q-fin.PM stat.ML 50%

Exploratory Mean-Variance with Jumps: An Equilibrium Approach

探索性均值-方差与跳跃:一种均衡方法

Yuling Max Chen, Bin Li, David Saunders

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出一种基于强化学习的探索性均值-方差投资策略,通过跳跃扩散过程和时间不一致控制方法,在实际市场数据中证明了其有效性。

Comments This work has been accepted and published at a commemorative book for Rudi Zagst

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09168 2025-12-11 physics.plasm-ph physics.space-ph 50%

The skin effect in anomalous transport of charged particles in plasma with a microturbulent magnetic field. I. Isotropic plasma

等离子体中异常带电粒子输运的皮肤效应。I.各向同性等离子体

N. A. Emelyanov, Vl. V. Kocharovsky

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究了各向同性等离子体中电磁皮肤效应对其异常带电粒子输运的影响,推导了有效迁移率和电导率的解析公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09141 2025-12-11 physics.bio-ph cond-mat.soft 50%

Binding Kinetics Oppositely Regulates type II Topoisomerase Relaxation and Decatenation Activities

结合动力学相反调节II型拓扑异构酶松弛和解联活动

Cleis Battaglia, Filippo Conforto, Yair Augusto Gutierrez Fosado, Matt Newton, Erin Cutts, Davide Michieletto, Antonio Valdes

专题命中 扩散模型 :diffusion(abstract)

AI总结 研究揭示II型拓扑异构酶结合动力学调节拓扑简化活动的机制,通过单分子测量和分子动力学模拟发现其解联与松弛活性的相反调节作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07877 2025-12-11 cs.LG cs.AI 50%

Artificial Intelligence-Driven Network-on-Chip Design Space Exploration: Neural Network Architectures for Design

基于人工智能的片上网络设计空间探索:用于设计的神经网络架构

Amogh Anshu N, Harish BP

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出利用神经网络架构优化片上网络设计空间探索,通过条件扩散模型提升预测精度,显著缩短设计探索时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07828 2025-12-11 cs.LG econ.GN q-fin.EC 50%

The Adoption and Usage of AI Agents: Early Evidence from Perplexity

AI代理的采用与使用:来自困惑度的早期证据

Jeremy Yang, Noah Yonack, Kate Zyskowski, Denis Yarats, Johnny Ho, Jerry Ma

机构 * Perplexity

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究了AI代理在开放网络环境中的采用情况,揭示了不同用户群体在使用强度和用途上的差异,并提出了分层的代理使用分类法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08608 2025-12-11 math.NA cs.NA 50%

Discretization Error Analysis of a High Order Unfitted Space-Time Method for moving domain problems

高阶非适应空间-时间方法在移动域问题中的离散误差分析

Fabian Heimann, Christoph Lehrenfeld, Janosch Preuß

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文分析了高阶非适应空间-时间有限元方法在移动域问题中的离散误差,证明了方法的稳定性和精度,考虑了几何近似的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10221 2025-12-11 stat.ME stat.CO 50%

bayesCureRateModel: Bayesian Cure Rate Modeling for Time to Event Data in R

bayesCureRateModel: 基于R的贝叶斯治愈率建模用于时间到事件数据

Panagiotis Papastamoulis, Fotios Milienos

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种基于R的贝叶斯方法,用于估计存在协变量的通用治愈率模型,支持多种促进时间分布选项,并通过MCMC算法进行后验推断。

Comments revised version

Journal ref Journal of Statistical Software, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 7 篇

2503.10287 2025-12-11 cs.SD cs.CV cs.GR eess.AS 81%

MACS: Multi-source Audio-to-image Generation with Contextual Significance and Semantic Alignment

MACS:基于上下文意义和语义对齐的多源音频到图像生成

Hao Zhou, Xiaobao Guo, Yuzhe Zhu, Adams Wai-Kin Kong

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV、cs.GR

AI总结 MACS通过分离多源音频并利用语义对齐提升音频到图像生成的质量和表现。

Comments Accepted at AAAI 2026. Code available at https://github.com/alxzzhou/MACS

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09095 2025-12-11 cs.CV 79%

Food Image Generation on Multi-Noun Categories

多名词类别的食物图像生成

Xinyue Pan, Yuhao Chen, Jiangpeng He, Fengqing Zhu

机构 * Purdue University(普渡大学) University of Waterloo(滑铁卢大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出FoCULR方法,通过整合食品领域知识和早期引入核心概念,解决多名词类别食物图像生成中的语义误解和布局错误问题。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.21070 2025-12-11 math.NA cs.NA 78%

Numerical analysis of a stabilized scheme for an optimal control problem governed by a parabolic convection--diffusion equation

对由抛物型对流-扩散方程所支配的最优控制问题的稳定化方案的数值分析

Christos Pervolianakis

专题命中 可控生成 :diffusion(title,abstract)

AI总结 本文研究了由抛物型对流-扩散方程支配的最优控制问题,提出稳定化方案并推导了误差估计,通过数值实验验证了其收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09406 2025-12-11 cs.RO cs.AI cs.CV 70%

H2R-Grounder: A Paired-Data-Free Paradigm for Translating Human Interaction Videos into Physically Grounded Robot Videos

H2R-Grounder:一种无需配对数据的视频到物理 grounded 机器人视频翻译范式

Hai Ci, Xiaokang Liu, Pei Yang, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学显示实验室)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 H2R-Grounder通过无需配对数据的方法,将人类交互视频转换为物理 grounded 的机器人视频,提升机器人学习的现实感和扩展性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09740 2025-12-11 physics.optics 50%

Mode Control and Dynamic Population Gratings in Quantum-Dot Lasers

量子点激光器中的模式控制与动态人口光栅

Xiangpeng Ou, Artem Prokoshin, Hongyan Yu, Xin Yao, Ying Shi, William He, Zhican Zhou, Yating Wan

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出利用动态人口光栅实现量子点激光器的单模操作,展示了其在高调谐范围和抗反馈性能上的优势,为片上光子系统提供了新的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09504 2025-12-11 cs.SD 50%

DMP-TTS: Disentangled multi-modal Prompting for Controllable Text-to-Speech with Chained Guidance

DMP-TTS: 解耦多模态提示的可控文本到语音系统 with 链式引导

Kang Yin, Chunyu Qiang, Sirui Zhao, Xiaopeng Wang, Yuzhe Liang, Pengfei Cai, Tong Xu, Chen Zhang, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 DMP-TTS通过解耦多模态提示和链式引导技术,实现了更强的文本到语音风格可控性,同时保持良好的可懂度和自然度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09126 2025-12-11 math.OC 50%

Second-Order $Λ$-Sets and Extensions to Non-Smooth, Hybrid, and Stochastic Optimal Control

二阶Λ集及其在非光滑、混合及随机最优控制中的扩展

Mohammad H. M Rashid

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出二阶Λ集框架,用于非光滑、混合及随机最优控制问题,结合几何方法与变分方法,提供新的最优性条件和应用实例。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像修复 1 篇

2512.09282 2025-12-11 cs.CV 57%

FoundIR-v2: Optimizing Pre-Training Data Mixtures for Image Restoration Foundation Model

FoundIR-v2:优化图像修复基础模型的预训练数据混合

Xiang Chen, Jinshan Pan, Jiangxin Dong, Jian Yang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 FoundIR-v2通过优化预训练数据混合比例,提升图像修复基础模型在多种任务中的泛化能力和性能。

Comments Project page: https://lowlevelcv.com/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 3 篇

2512.08294 2025-12-11 cs.CV 85%

OpenSubject: Leveraging Video-Derived Identity and Diversity Priors for Subject-driven Image Generation and Manipulation

OpenSubject: 利用视频衍生的身份和多样性先验进行主体驱动的图像生成与操纵

Yexin Liu, Manyuan Zhang, Yueze Wang, Hongyu Li, Dian Zheng, Weiming Zhang, Changsheng Lu, Xunliang Cai, Yan Feng, Peng Pei, Harry Yang

机构 * HKUST(香港科技大学) Meituan(美团) HKUST(GZ)(香港科技大学(广州))

专题命中 个性化与一致性 :image generation(title,abstract);inpainting(abstract);image synthesis(abstract);分类 cs.CV

AI总结 OpenSubject通过视频衍生的大规模数据集提升主体驱动图像生成与操纵的性能,尤其在复杂场景中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09417 2025-12-11 cs.CV 70%

DirectSwap: Mask-Free Cross-Identity Training and Benchmarking for Expression-Consistent Video Head Swapping

DirectSwap: 无掩码跨身份训练与基准测试用于表情一致的视频头部交换

Yanan Wang, Shengcai Liao, Panwen Hu, Xin Li, Fan Yang, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) UAEU(阿拉伯联合酋长国大学) AIQ(人工智能量子研究所) SYSU(南方大学)

专题命中 个性化与一致性 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 DirectSwap通过无掩码直接视频头部交换框架,结合运动和表情感知重建损失,实现了跨身份视频头部交换的高质量和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09617 2025-12-11 cs.CV 57%

FROMAT: Multiview Material Appearance Transfer via Few-Shot Self-Attention Adaptation

FROMAT: 通过少样本自注意力适应实现多视图材料外观迁移

Hubert Kompanowski, Varun Jampani, Aaryaman Vasishta, Binh-Son Hua

机构 * Trinity College Dublin(都柏林三一学院) Arcade AI AMD

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FROMAT通过少样本自注意力适应实现多视图材料外观迁移,提供了一种简单有效的生成方法,提升多视图内容创作的外观多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2512.09663 2025-12-11 cs.CV 57%

IF-Bench: Benchmarking and Enhancing MLLMs for Infrared Images with Generative Visual Prompting

IF-Bench:基于生成视觉提示的多模态大语言模型在红外图像上的基准测试与增强

Tao Zhang, Yuyang Hong, Yang Xia, Kun Ding, Zeyu Zhang, Ying Wang, Shiming Xiang, Chunhong Pan

机构 * MAIS, Institute of Automation(自动化研究所信息处理中心) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Research Center of Aerospace Information, Institute of Automation(自动化研究所航空信息研究中心)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 IF-Bench通过生成视觉提示方法提升多模态大语言模型对红外图像的理解能力,提供首个高质量基准测试及实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19366 2025-12-11 cs.LG cs.AI 50%

Grounding the Ungrounded: A Spectral-Graph Framework for Quantifying Hallucinations in Multimodal LLMs

未接地的接地:一种基于谱-图框架的多模态大语言模型幻觉量化方法

Supratik Sarkar, Swagatam Das

机构 * Morgan Stanley(摩根士丹利) Indian Statistical Institute (Kolkata)(印度统计研究所(加尔各答))

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文提出了一种基于谱-图框架的多模态大语言模型幻觉量化方法,通过谱分解和RKHS本征模式,提供可解释的语义失真度量。

Comments 49 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 效率与蒸馏 1 篇

2509.20427 2025-12-11 cs.CV 87%

Seedream 4.0: Toward Next-generation Multimodal Image Generation

Seedream 4.0:迈向下一代多模态图像生成

Team Seedream, :, Yunpeng Chen, Yu Gao, Lixue Gong, Meng Guo, Qiushan Guo, Zhiyao Guo, Xiaoxia Hou, Weilin Huang, Yixuan Huang, Xiaowen Jian, Huafeng Kuang, Zhichao Lai, Fanshi Li, Liang Li, Xiaochen Lian, Chao Liao, Liyang Liu, Wei Liu, Yanzuo Lu, Zhengxiong Luo, Tongtong Ou, Guang Shi, Yichun Shi, Shiqi Sun, Yu Tian, Zhi Tian, Peng Wang, Rui Wang, Xun Wang, Ye Wang, Guofeng Wu, Jie Wu, Wenxu Wu, Yonghui Wu, Xin Xia, Xuefeng Xiao, Shuang Xu, Xin Yan, Ceyuan Yang, Jianchao Yang, Zhonghua Zhai, Chenlin Zhang, Heng Zhang, Qi Zhang, Xinyu Zhang, Yuwei Zhang, Shijia Zhao, Wenliang Zhao, Wenjia Zhu

机构 * ByteDance(字节跳动)

专题命中 效率与蒸馏 :image generation(title,abstract);text-to-image(abstract);diffusion(abstract);image editing(abstract)

AI总结 Seedream 4.0通过高效多模态框架实现文本到图像生成、图像编辑和多图像组合,展示卓越的多模态能力与高效推理性能。

Comments Seedream 4.0/4.5 Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏