arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2025-12-23 至 2025-12-23 共收录 111 信号源:cs.CV, cs.GR, cs.MM

1. 扩散模型 84 篇

2509.16908 2025-12-23 q-bio.QM q-bio.NC 50%

Discrete Heat Kernels on Simplicial Complexes and Its Application to Functional Brain Networks

离散热核在单纯复形上的应用及其在功能脑网络中的应用

Sixtus Dakurah

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文提出了一种在单纯复形上进行热核平滑的方法,用于增强功能脑网络的信号质量并揭示解剖学结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10322 2025-12-23 q-bio.NC 50%

Fairness, not Emotion, Drives Socioeconomic Decision Making

公平,而非情绪,驱动社会经济决策

Rudra Mukhopadhyay, Sourin Chatterjee, Koel Das

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究发现经济公平对社会经济决策有显著影响,通过ERP分析揭示了情绪与公平性在决策中的相互作用及认知策略差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 可控生成 8 篇

2512.18772 2025-12-23 cs.CV 79%

In-Context Audio Control of Video Diffusion Transformers

上下文音频控制视频扩散变换器

Wenze Liu, Weicai Ye, Minghong Cai, Quande Liu, Xintao Wang, Xiangyu Yue

机构 * MMLab, The Chinese University of Hong Kong(香港中文大学MMLab) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ICAC框架,通过三维注意力机制实现音频驱动的视频生成,解决时间同步信号在视频扩散模型中的整合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19020 2025-12-23 cs.CV cs.LG 70%

CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization

CETCAM: 通过一致且可扩展的分词实现相机可控的视频生成

Zelin Zhao, Xinyu Gong, Bangya Liu, Ziyang Song, Jun Zhang, Suhui Wu, Yongxin Chen, Hao Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) ByteDance(字节跳动) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) The Hong Kong Polytechnic University(香港理工大学)

专题命中 可控生成 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 CETCAM通过一致且可扩展的分词方案实现相机可控的视频生成,提高了几何一致性和视觉真实性,同时支持额外的控制模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19661 2025-12-23 cs.CV 57%

Over++: Generative Video Compositing for Layer Interaction Effects

Over++:用于层交互效果的生成视频合成

Luchao Qi, Jiaye Wu, Jun Myeong Choi, Cary Phillips, Roni Sengupta, Dan B Goldman

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Maryland(马里兰大学) Industrial Light & Magic(工业光魔)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 Over++是一种生成视频合成方法,通过文本提示和输入视频层生成逼真的环境效果,同时保留原始场景,无需假设相机姿态或深度信息。

Comments Project page: https://overplusplus.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20431 2025-12-23 cs.CV cs.RO 57%

BRIC: Bridging Kinematic Plans and Physical Control at Test Time

BRIC: 在测试时弥合运动计划与物理控制之间的差距

Dohun Lim, Minji Kim, Jaewoon Lim, Sungchan Kim

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BRIC通过结合测试时适应与轻量级引导机制,实现长期人体运动生成的物理合理性和一致性。

Comments Accepted to AAAI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13031 2025-12-23 cs.CV 57%

Towards 3D Object-Centric Feature Learning for Semantic Scene Completion

面向语义场景补全的3D物体感知特征学习

Weihua Wang, Yubo Cui, Xiangru Lin, Zhiheng Li, Zheng Fang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Ocean框架,通过分解场景为独立物体实例,提升语义场景补全的精度和性能。

Comments Accepted to AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI 57%

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19148 2025-12-23 cs.RO 50%

A Flexible Field-Based Policy Learning Framework for Diverse Robotic Systems and Sensors

一种灵活的基于场的策略学习框架,适用于多样化的机器人系统和传感器

Jose Gustavo Buenaventura Carreon, Floris Erich, Roman Mykhailyshyn, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出一种灵活的基于场的策略学习框架,通过整合扩散策略控制与3D语义场景表示,实现跨机器人系统的高效泛化与任务成功率提升。

Comments 6 pages, 7 figures, conference: SII 2026. Cancun, Mexico

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18815 2025-12-23 cs.LG cs.AI physics.ao-ph physics.geo-ph 50%

Controllable Probabilistic Forecasting with Stochastic Decomposition Layers

可控制的概率预报与随机分解层

John S. Schreck, William E. Chapman, Charlie Becker, David John Gagne, Dhamma Kimpara, Nihanth Cherukuru, Judith Berner, Kirsten J. Mayer, Negin Sobhani

机构 * NSF National Center for Atmospheric Research(国家大气科学研究中心) University of Colorado(科罗拉多大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 通过随机分解层将确定性天气模型转化为概率集合系统,提升预测的准确性和可解释性,降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 5 篇

2512.18635 2025-12-23 cs.CV 88%

Uni-Neur2Img: Unified Neural Signal-Guided Image Generation, Editing, and Stylization via Diffusion Transformers

Uni-Neur2Img:通过扩散变换器实现神经信号引导的图像生成、编辑和风格化

Xiyue Bai, Ronghao Yu, Jia Xiu, Pengfei Zhou, Jie Xia, Peng Ji

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 个性化与一致性 :image generation(title,abstract);diffusion(title);image editing(abstract);分类 cs.CV

AI总结 Uni-Neur2Img通过扩散变换器实现神经信号引导的图像生成、编辑和风格化,提供统一且高效的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19271 2025-12-23 cs.CV 79%

3SGen: Unified Subject, Style, and Structure-Driven Image Generation with Adaptive Task-specific Memory

3SGen: 一种统一的主体、风格和结构驱动的图像生成方法,具有自适应任务特定记忆

Xinyang Song, Libin Wang, Weining Wang, Zhiwei Li, Jianxin Sun, Dandan Zheng, Jingdong Chen, Qi Li, Zhenan Sun

机构 * School of Artificial Intelligence, UCAS(人工智能学院,UCAS) CASIA AntGroup(蚂蚁集团)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 3SGen通过统一的框架实现主体、风格和结构驱动的图像生成,采用自适应任务特定记忆模块提升生成质量和跨任务迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19026 2025-12-23 cs.CV cs.AI 79%

Finer-Personalization Rank: Fine-Grained Retrieval Examines Identity Preservation for Personalized Generation

细粒度个性化排名:细粒度检索检验身份保持在个性化生成中

Connor Kilrain, David Carlyn, Julia Chae, Sara Beery, Wei-Lun Chao, Jianyang Gu

机构 * The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院)

专题命中 个性化与一致性 :personalized generation(title,abstract);分类 cs.CV

AI总结 本文提出Finer-Personalization Rank评估协议,用于细粒度检验个性化生成中的身份保持,揭示现有方法中的身份漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18964 2025-12-23 cs.CV 79%

DVI: Disentangling Semantic and Visual Identity for Training-Free Personalized Generation

DVI: 解构语义与视觉身份以实现无训练个性化生成

Guandong Li, Yijun Ding

机构 * iFLYTEK

专题命中 个性化与一致性 :personalized generation(title);diffusion(abstract);分类 cs.CV

AI总结 DVI通过解构语义与视觉身份,实现无训练个性化生成,提升视觉一致性和氛围保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19048 2025-12-23 cs.CV 70%

WaTeRFlow: Watermark Temporal Robustness via Flow Consistency

WaTeRFlow:通过流一致性实现水印时间鲁棒性

Utae Jeong, Sumin In, Hyunju Ryu, Jaewan Choi, Feng Yang, Jongheon Jeong, Seungryong Kim, Sangpil Kim

机构 * Korea University(韩国大学) Google DeepMind(谷歌DeepMind) KAIST AI(韩国科学技术院人工智能)

专题命中 个性化与一致性 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 WaTeRFlow通过流一致性提升I2V场景下的水印鲁棒性,结合FUSE引擎、时间一致性损失和语义保持损失,实现跨模态水印恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2512.19632 2025-12-23 cs.CV 88%

Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment

生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐

Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry

机构 * University of Manitoba(曼尼托巴大学) University of Winnipeg(温哥华大学)

专题命中 图像生成评测 :diffusion(title,abstract);image generation(title);image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19539 2025-12-23 cs.CV 57%

StoryMem: Multi-shot Long Video Storytelling with Memory

StoryMem: 基于记忆的多镜头长视频叙事

Kaiwen Zhang, Liming Jiang, Angtian Wang, Jacob Zhiyuan Fang, Tiancheng Zhi, Qing Yan, Hao Kang, Xin Lu, Xingang Pan

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 StoryMem通过基于记忆的迭代镜头合成,实现了高质量多镜头视频叙事,提升了跨镜头一致性与审美质量。

Comments Project page: https://kevin-thu.github.io/StoryMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18477 2025-12-23 cs.RO cs.CV 57%

STORM: Search-Guided Generative World Models for Robotic Manipulation

STORM:基于搜索的生成世界模型用于机器人操作

Wenjun Lin, Jensen Zhang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 STORM通过结合生成模型与搜索算法,实现了机器人操作中的时空推理,显著提升了任务成功率和环境适应能力。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 2 篇

2512.18572 2025-12-23 eess.AS 50%

MeanFlow-TSE: One-Step Generative Target Speaker Extraction with Mean Flow

MeanFlow-TSE: 一步生成目标说话人提取方法

Riki Shimizu, Xilin Jiang, Nima Mesgarani

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 MeanFlow-TSE通过均值流目标实现一步生成,提升实时目标说话人提取的效率和质量。

Comments 6 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05047 2025-12-23 math.NA cs.NA 50%

An adaptive finite element multigrid solver using GPU acceleration

一种利用GPU加速的自适应有限元多重网格求解器

Manuel Liebchen, Robert Jendersie, Utku Kaya, Christian Lessig, Thomas Richter

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本研究开发了一种利用GPU加速的自适应有限元多重网格求解器,通过线性代数操作实现高效计算,显著提升了求解非稳态纳维-斯托克斯方程等复杂问题的速度。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他图像生成 1 篇

2512.10067 2025-12-23 cs.CV cs.LG 57%

Independent Density Estimation

独立密度估计

Jiahao Liu, Senhao Cao

机构 * Orcava Inc.(Orcava公司)

专题命中 其他图像生成 :image generation(abstract);分类 cs.CV

AI总结 本研究提出独立密度估计(IDE)方法,通过学习句子中单个词与图像特征之间的联系,提升模型在组合泛化任务上的性能。

Comments 10 pages, 1 table, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏