arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-02-05 至 2026-02-05 共收录 3
2512.10322 2026-02-05 cs.AI

User-Feedback-Driven Adaptation for Vision-and-Language Navigation

基于用户反馈的视觉-语言导航适应

Yongqiang Yu, Xuhui Li, Hazza Mahmood, Jinxing Zhou, Haodong Hong, Longtao Jiang, Zhiqiang Xu, Qi Wu, Xiaojun Chang

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed大学人工智能学院) School of Electrical Engineering and Computer Science, The University of Queensland(电气工程与计算机科学学院,昆士兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, The University of Adelaide(计算机科学学院,阿德莱德大学)

AI总结 本文提出基于用户反馈的视觉-语言导航适应方法,通过拓扑感知轨迹构建和持久记忆库机制,提升代理对用户指令的响应能力,实现高效模仿学习和跨指令风格的强适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04271 2026-02-05 cs.CV cs.AI cs.GR

SkeletonGaussian: Editable 4D Generation through Gaussian Skeletonization

SkeletonGaussian: 通过高斯骨架化实现可编辑的4D生成

Lifan Wu, Ruijie Zhu, Yubo Ai, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 SkeletonGaussian通过高斯骨架化实现可编辑的4D生成,利用分层可动表示和六平面细化提升生成质量与编辑能力。

Comments Accepted by CVM 2026. Project page: https://wusar.github.io/projects/skeletongaussian

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21610 2026-02-05 cs.CV

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏