Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
通过量化不确定性优化掩码扩散模型的解码路径
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; University of Chicago(芝加哥大学)
AI总结 通过引入去噪熵度量,优化掩码扩散模型的解码路径以提升生成质量与准确性。
高校专区
通过量化不确定性优化掩码扩散模型的解码路径
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; University of Chicago(芝加哥大学)
AI总结 通过引入去噪熵度量,优化掩码扩散模型的解码路径以提升生成质量与准确性。
AndroidLens: 长延迟评估与嵌套子目标用于Android GUI代理
机构 * Nanjing University(南京大学) ; Alibaba Group(阿里巴巴集团) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学)
AI总结 AndroidLens通过引入571个长延迟任务和嵌套子目标,评估Android GUI代理的性能,揭示了现实环境中任务完成的挑战。
Comments 23 pages, 13 figures, 8 tables
反射预训练使生物序列模型实现token级自我修正
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of British Columbia(不列颠哥伦比亚大学) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学) ; Stony Brook University(石溪大学)
AI总结 本文提出反射预训练方法,通过生成辅助标记提升生物序列模型的token表达能力,实现token级自我修正和推理能力提升。
连续环境中的视觉-语言导航(VLN-CE)需要一个具身体验的智能体在连续环境中导航至目标,遵循自然语言指令。虽然当前基于图的方法通过将环境抽象为拓扑地图并简化动作空间到路径选择,提供了一种高效、结构化的方法,但它们在利用大规模数据和先进训练范式方面落后于基于大视觉-语言模型(LVLMs)的方法。在本文中,我们通过引入ETP-R1框架,将数据扩展和强化微调(RFT)范式应用于基于图的VLN-CE模型,以弥合这一差距。
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Co., Ltd(华为技术有限公司) ; Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)
AI总结 ETP-R1通过数据扩展和强化微调范式,提升基于图的连续环境视觉-语言导航性能,实现新状态最先进的表现。
Comments 8 pages, 6 figures
LLaDA2.0:将扩散语言模型扩展到100B参数
机构 * Ant Group(蚂蚁集团) ; Renmin University of China(中国人民大学) ; Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; HongKong University of Science and Technology(香港科学与技术大学)
AI总结 LLaDA2.0通过三阶段块级训练方案将扩散语言模型扩展至100B参数,实现高效前沿规模部署。
Comments 19 pages
RULER-Bench: 探索下一代视频生成模型的基于规则的推理能力以实现视觉基础智能
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团)
AI总结 RULER-Bench通过评估视频生成模型的基于规则的推理能力,揭示了其在时间一致性等指标上的不足,为提升视频生成模型的推理能力提供新方向。
RSCC:一种大规模遥感变化描述数据集用于灾害事件
机构 * School of Earth Sciences, Zhejiang University(浙江大学地球科学学院) ; School of Software Technology, Zhejiang University(浙江大学软件学院) ; Zhejiang Provincial Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室) ; Key Laboratory of Spatio-temporal Information and Intelligent Services (LSIIS), Ministry of Natural Resources of the People’s Republic of China(国家自然资源部空间时空信息与智能服务重点实验室)
AI总结 RSCC数据集通过提供大规模遥感图像对和详细变化描述,提升视觉-语言模型在灾害事件双时间理解中的性能和应用能力。
Comments Accepted by NeurIPS 2025 Dataset and Benchmark Track
NavDP: 基于特权信息引导的学习导航扩散策略
机构 * Shanghai AI Lab(上海人工智能实验室) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学)
AI总结 NavDP通过基于特权信息引导的学习方法,实现自主机器人在多样化环境中的零样本模拟到现实导航转移。
Comments Project Page: https://wzcai99.github.io/navigation-diffusion-policy.github.io/