arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-01-27 至 2026-01-27 共收录 10 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2601.17673 2026-01-27 cs.CV cs.AI 70%

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

专题命中 可控生成 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18451 2026-01-27 cs.CV cs.AI cs.LG cs.MM cs.SD 62%

3DGesPolicy: Phoneme-Aware Holistic Co-Speech Gesture Generation Based on Action Control

3DGesPolicy: 基于动作控制的音素感知整体语义手势生成

Xuanmeng Sha, Liyun Zhang, Tomohiro Mashita, Naoya Chiba, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Osaka Electro-Communication University(大阪电讯大学) Osaka University(大阪大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV、cs.MM

AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV 57%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17857 2026-01-27 cs.CV 57%

SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction

SynMind:减少基于fMRI的图像重建中的语义幻觉

Lan Yang, Minghan Yang, Ke Li, Honggang Zhang, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) SketchX Lab, Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(SketchX实验室,视觉、语音和信号处理中心(CVSSP), Surrey大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMind通过整合显式语义编码与视觉先验,提升基于fMRI的图像重建质量,减少语义幻觉并提高与人类视觉感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17088 2026-01-27 cs.CV 57%

GlassesGB: Controllable 2D GAN-Based Eyewear Personalization for 3D Gaussian Blendshapes Head Avatars

GlassesGB: 可控的基于GAN的2D眼镜个性化技术用于3D高斯混合形状头虚拟角色

Rui-Yang Ju, Jen-Shiun Chiang

机构 * Kyoto University(京都大学) Tamkang University(Tamkang 大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 GlassesGB结合GAN与3D高斯混合形状技术,实现可控的2D眼镜个性化生成,用于3D头虚拟角色的定制化设计。

Comments IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18270 2026-01-27 math.OC 50%

Exact Controllability for Stochastic First-Order Multi-Dimensional Hyperbolic Systems

对随机一阶多维双曲系统的精确可控性

Zengyu Li, Qi Lü, Yu Wang, Haitian Yang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了随机多维双曲系统的精确可控性,通过建立新的Carleman估计和加权能量恒等式,证明了在特定几何条件下可控性成立,并探讨了其在交通流、流行病模型等领域的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09101 2026-01-27 cs.RO cs.AI 50%

Masked Generative Policy for Robotic Control

遮蔽生成策略用于机器人控制

Lipeng Zhuang, Shiyu Fan, Florent P. Audonnet, Yingdong Ru, Edmond S. L. Ho, Gerardo Aragon Camarasa, Paul Henderson

机构 * University of Glasgow(格拉斯哥大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 MGP通过并行生成和动态细化技术,实现了在复杂非马尔可夫任务中高效可靠的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19893 2026-01-27 cs.LG cs.AI cs.IT eess.IV math.IT 50%

Distillation-Enabled Knowledge Alignment for Generative Semantic Communications of AIGC Images

基于知识对齐的生成语义通信中的知识蒸馏

Jingzhi Hu, Geoffrey Ye Li

机构 * Department of Electrical and Electronic Engineering, Imperial College London(帝国理工学院伦敦分校电子与电气工程系)

专题命中 可控生成 :image generation(abstract)

AI总结 本文提出DeKA-g算法,通过知识蒸馏和低秩适应,提升生成语义通信中边缘与云生成图像的一致性及传输质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03400 2026-01-27 cs.RO 50%

Close-Fitting Dressing Assistance Based on State Estimation of Feet and Garments with Semantic-based Visual Attention

基于足部与衣物状态估计的近身穿衣辅助

Takuma Tsukakoshi, Tamon Miyake, Tetsuya Ogata, Yushi Wang, Takumi Akaishi, Shigeki Sugano

机构 * Creative Science and Engineering Faculty, Waseda Univ.(早稻田大学创意科学与工程学部) Future Robotics Organization, Waseda Univ.(早稻田大学未来机器人组织) Faculty of Science and Engineering, Waseda Univ.(早稻田大学科学与工程学部) The National Institute of Advanced Science and Technology(日本国家先进科学与技术研究院)

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究提出基于语义信息的穿衣辅助方法,通过多模态数据融合实现对足部和衣物状态的精准估计,成功帮助10名受试者穿袜子,优于其他方法。

Comments Accepted at RA-L, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17443 2026-01-27 cs.CL cs.AI cs.LG 50%

Clustering-driven Memory Compression for On-device Large Language Models

基于聚类的记忆压缩用于设备端大语言模型

Ondrej Bohdal, Pramit Saha, Umberto Michieli, Mete Ozay, Taha Ceritli

机构 * University of Oxford(牛津大学)

专题命中 可控生成 :personalized generation(abstract)

AI总结 本文提出一种基于聚类的记忆压缩方法,通过分组和合并相似记忆以提升设备端大语言模型的上下文效率和生成质量。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏