arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2025-12-25 至 2025-12-25 共收录 8
2512.21336 2025-12-25 cs.CL cs.AI cs.LG

Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty

通过量化不确定性优化掩码扩散模型的解码路径

Ziyu Chen, Xinbei Jiang, Peng Sun, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) University of Chicago(芝加哥大学)

AI总结 通过引入去噪熵度量,优化掩码扩散模型的解码路径以提升生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21302 2025-12-25 cs.CV

AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents

AndroidLens: 长延迟评估与嵌套子目标用于Android GUI代理

Yue Cao, Yingyao Wang, Pi Bu, Jingxuan Xing, Wei Jiang, Zekun Zhu, Junpeng Ma, Sashuai Zhou, Tong Lu, Jun Song, Yu Cheng, Yuning Jiang, Bo Zheng

机构 * Nanjing University(南京大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 AndroidLens通过引入571个长延迟任务和嵌套子目标,评估Android GUI代理的性能,揭示了现实环境中任务完成的挑战。

Comments 23 pages, 13 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20954 2025-12-25 cs.CL cs.AI

Reflection Pretraining Enables Token-Level Self-Correction in Biological Sequence Models

反射预训练使生物序列模型实现token级自我修正

Xiang Zhang, Jiaqi Wei, Yuejin Yang, Zijie Qiu, Yuhan Chen, Zhiqiang Gao, Muhammad Abdul-Mageed, Laks V. S. Lakshmanan, Wanli Ouyang, Chenyu You, Siqi Sun

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Stony Brook University(石溪大学)

AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20940 2025-12-25 cs.RO

ETP-R1: Evolving Topological Planning with Reinforcement Fine-tuning for Vision-Language Navigation in Continuous Environments

连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。

Shuhao Ye, Sitong Mao, Yuxiang Cui, Xuan Yu, Shichao Zhai, Wen Chen, Shunbo Zhou, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Huawei Technologies Co., Ltd(华为技术有限公司) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15745 2025-12-25 cs.LG cs.AI cs.CL

LLaDA2.0: Scaling Up Diffusion Language Models to 100B

LLaDA2.0:将扩散语言模型扩展到100B参数

Tiwei Bie, Maosong Cao, Kun Chen, Lun Du, Mingliang Gong, Zhuochen Gong, Yanmei Gu, Jiaqi Hu, Zenan Huang, Zhenzhong Lan, Chengxi Li, Chongxuan Li, Jianguo Li, Zehuan Li, Huabin Liu, Lin Liu, Guoshan Lu, Xiaocheng Lu, Yuxin Ma, Jianfeng Tan, Lanning Wei, Ji-Rong Wen, Yipeng Xing, Xiaolu Zhang, Junbo Zhao, Da Zheng, Jun Zhou, Junlin Zhou, Zhanchao Zhou, Liwang Zhu, Yihong Zhuang

机构 * Ant Group(蚂蚁集团) Renmin University of China(中国人民大学) Zhejiang University(浙江大学) Westlake University(西湖大学) HongKong University of Science and Technology(香港科学与技术大学)

AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02622 2025-12-25 cs.CV

RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence

RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能

Xuming He, Zehao Fan, Hengjia Li, Fan Zhuo, Hankun Xu, Senlin Cheng, Di Weng, Haifeng Liu, Can Ye, Boxi Wu

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01907 2025-12-25 cs.CV cs.CL

RSCC: A Large-Scale Remote Sensing Change Caption Dataset for Disaster Events

RSCC:一种大规模遥感变化描述数据集用于灾害事件

Zhenyuan Chen, Chenxi Wang, Ningyu Zhang, Feng Zhang

机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(国家自然资源部空间时空信息与智能服务重点实验室)

AI总结 RSCC数据集通过提供大规模遥感图像对和详细变化描述,提升视觉-语言模型在灾害事件双时间理解中的性能和应用能力。

Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08712 2025-12-25 cs.RO

NavDP: Learning Sim-to-Real Navigation Diffusion Policy with Privileged Information Guidance

NavDP: 基于特权信息引导的学习导航扩散策略

Wenzhe Cai, Jiaqi Peng, Yuqiang Yang, Yujian Zhang, Meng Wei, Hanqing Wang, Yilun Chen, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Lab(上海人工智能实验室) Tsinghua University(清华大学) Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 NavDP通过基于特权信息引导的学习方法,实现自主机器人在多样化环境中的零样本模拟到现实导航转移。

Comments Project Page: https://wzcai99.github.io/navigation-diffusion-policy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏