arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-10 至 2025-12-10 共收录 4
2512.08627 2025-12-10 cs.CV

Trajectory Densification and Depth from Perspective-based Blur

轨迹密集化与基于视角的模糊深度估计

Tianchen Qiu, Qirun Zhang, Jiajian He, Zhengyue Zhuge, Jiahui Xu, Yueting Chen

机构 * College of Optical Science and Engineering(光学科学与工程学院) Zhejiang University(浙江大学)

AI总结 本文提出了一种基于视角模糊和密集轨迹的深度估计方法,利用视觉-语言模型和光学设计算法实现大范围深度的高精度重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08529 2025-12-10 cs.CV

MVP: Multiple View Prediction Improves GUI Grounding

MVP: 多视角预测改进 GUI 定位

Yunzhu Zhang, Zeyu Pan, Zhengwen Zeng, Shuheng Shen, Changhua Meng, Linchao Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Venus Team, Ant Group(蚂蚁集团 Venus 团队)

AI总结 MVP 通过多视角预测方法提升 GUI 定位的稳定性与准确性,显著提高多个模型的性能指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08186 2025-12-10 cs.RO

Ground Slow, Move Fast: A Dual-System Foundation Model for Generalizable Vision-and-Language Navigation

放慢脚步,快速移动:一种通用视觉-语言导航的双系统基础模型

Meng Wei, Chenyang Wan, Jiaqi Peng, Xiqian Yu, Yuqiang Yang, Delin Feng, Wenzhe Cai, Chenming Zhu, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Tsinghua University(清华大学)

AI总结 DualVLN通过双系统架构,结合高层推理与低层动作执行,提升视觉-语言导航的泛化能力和动态环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18549 2025-12-10 cs.LG cs.AI

RLCAD: Reinforcement Learning Training Gym for Revolution Involved CAD Command Sequence Generation

RLCAD: 用于革命涉及CAD命令序列生成的强化学习训练环境

Xiaolong Yin, Xingyu Lu, Jiahang Shen, Jingzhe Ni, Hailong Li, Ruofeng Tong, Min Tang, Peng Du

机构 * Zhejiang University, China(浙江大学) Shenzhen Poisson Software Co., Ltd., China(深圳Poisson软件有限公司)

AI总结 本文提出基于CAD几何引擎的RL训练环境,支持生成更复杂的CAD命令序列,实现从B-Rep几何体的高精度生成。

详情

展开后加载摘要…

URL PDF HTML 收藏