arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-05 至 2026-01-05 共收录 37 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 2 篇

2512.23537 2026-01-05 cs.CV cs.AI 57%

AnyMS: Bottom-up Attention Decoupling for Layout-guided and Training-free Multi-subject Customization

AnyMS: 从下到上注意力解耦用于布局引导和无训练多主体定制

Binhe Yu, Zhen Wang, Kexin Li, Yuqian Yuan, Wenqiao Zhang, Long Chen, Juncheng Li, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HKUST(香港科技大学) Zhejiang Tobacco Monopoly Administration(浙江烟草专卖局)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnyMS通过从下到上的双层注意力解耦机制,实现无训练的布局引导多主体定制,有效解决文本对齐、主体身份保持和布局控制的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 2 篇

2601.00368 2026-01-05 cs.CV 88%

Mask-Conditioned Voxel Diffusion for Joint Geometry and Color Inpainting

基于掩码的体素扩散用于联合几何和颜色修复

Aarya Sumuk

专题命中 图像修复 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文提出基于掩码的体素扩散方法,用于修复受损3D物体的几何和颜色,通过两阶段框架实现更完整和一致的修复效果。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24513 2026-01-05 cs.CY 78%

From Static to Dynamic: Evaluating the Perceptual Impact of Dynamic Elements in Urban Scenes via MLLM-Guided Generative Inpainting

从静态到动态:通过MLLM引导的生成修复技术评估城市场景中动态元素的感知影响

Zhiwei Wei, Mengzi Zhang, Boyan Lu, Zhitao Deng, Nai Yang, Hua Liao

专题命中 图像修复 :inpainting(title,abstract)

AI总结 通过MLLM引导的生成修复技术,研究评估了动态元素在城市场景中的感知影响,发现移除动态元素导致活力显著下降,揭示了光照、人类存在和深度变化对感知变化的关键作用。

Comments 31 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 4 篇

2601.00504 2026-01-05 cs.CV cs.AI cs.GR 62%

MotionPhysics: Learnable Motion Distillation for Text-Guided Simulation

MotionPhysics: 通过自然语言引导的模拟学习可学习的运动蒸馏

Miaowei Wang, Jakub Zadrożny, Oisin Mac Aodha, Amir Vaxman

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 MotionPhysics通过自然语言引导模拟,利用可学习的运动蒸馏损失实现对3D物体物理参数的自动学习,提升动态模拟的逼真度和效率。

Comments AAAI2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00051 2026-01-05 cs.CV 57%

TeleWorld: Towards Dynamic Multimodal Synthesis with a 4D World Model

TeleWorld:面向动态多模态合成的4D世界模型

Yabo Chen, Yuanzhi Liang, Jiepeng Wang, Tingxi Chen, Junfei Cheng, Zixiao Gu, Yuyang Huang, Zicheng Jiang, Wei Li, Tian Li, Weichen Li, Zuoxin Li, Guangce Liu, Jialun Liu, Junqi Liu, Haoyuan Wang, Qizhen Weng, Xuan'er Wu, Xunzhi Xiang, Xiaoyan Yang, Xin Zhang, Shiwen Zhang, Junyu Zhou, Chengcheng Zhou, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleWorld Team(TeleWorld团队)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 TeleWorld提出了一种实时多模态4D世界建模框架,通过生成-重建-引导范式实现动态场景重建与长期记忆,提升世界模型的交互性和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05583 2026-01-05 cs.LG cs.NE physics.app-ph physics.optics 50%

Model-free Optical Processors using In Situ Reinforcement Learning with Proximal Policy Optimization

无模型光学处理器使用原位强化学习与近端策略优化

Yuhang Li, Shiqi Chen, Tingyu Gong, Aydogan Ozcan

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 本文提出利用近端策略优化的无模型强化学习方法,实现衍射光学处理器的原位训练,有效解决物理系统优化与对齐问题,提升收敛速度和性能。

Comments 19 Pages, 7 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11651 2026-01-05 cs.LG cs.DC 50%

70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)

Tianyi Zhang, Mohsen Hariri, Shaochen Zhong, Vipin Chaudhary, Yang Sui, Xia Hu, Anshumali Shrivastava

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Department of Computer and Data Sciences, Case Western Reserve University(计算机与数据科学系,凯斯西储大学)

专题命中 效率与蒸馏 :diffusion(abstract)

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏