arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Zhejiang University(浙江大学)

2026-08-17 至 2026-08-17 共收录 10
2608.14441 2026-08-17 cs.AI 新提交

PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments

PACE-Bench:动态环境中基于代码演化的物理适应基准测试

Yuhao Zhan, Bingxiang He, Zecong Tang, Chaojun Xiao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

AI总结 PACE-Bench是涵盖六个物理领域144个适应对的模拟器支撑基准,用于测试智能体在环境物理条件变化时的代码演化适应能力,研究发现机制重新设计是核心瓶颈,现有方法性能仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14135 2026-08-17 cs.RO cs.LG 新提交

AgilePE: Autonomous UAV Pursuit-Evasion via Self-Play Reinforcement Learning

AgilePE:基于自博弈强化学习的自主无人机追逃

Wenhao Tang, Tianyang Chen, Zhejun Cui, Boyuan An, Jiayu Chen, Ruize Zhang, Huidong Liu, Tianyue Wu, Qingmin Liao, Fei Gao, Yu Wang, Chao Yu

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) Chongqing University(重庆大学)

AI总结 该研究提出AgilePE系统,通过自博弈强化学习实现自主无人机追逃,其策略可零样本迁移至真实四旋翼,展现出复杂追逃战术与交互式部署能力。

Comments 8 pages, 7 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14043 2026-08-17 cs.CV 新提交

Beyond Text Conditioning: A Systematic Study of MLLM-DiT Fusion for Video Generation

超越文本条件:面向视频生成的MLLM-DiT融合系统研究

Yanbo Ding, Yijia Fan, Caihua Shan, Yifan Yang, Yifei Shen, Weijie Wang, Xirui Hu, Dongsheng Li, Lili Qiu, Yuqing Yang, Yali Wang

机构 * Chinese Academy of Sciences(中国科学院) Microsoft Research(微软研究院) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学)

AI总结 该研究针对视频生成中MLLM与DiT融合问题,提出BiVidGen框架,通过MLLM生成语义视觉标记辅助DiT渲染,提升了视频的语义对齐度与时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13938 2026-08-17 cs.CV 新提交

CoANeRV: Coordinate-Aware Token-Space Neural Video Representation

CoANeRV:坐标感知的令牌空间神经视频表示

Jialong Guo, Ke Liu, Mengxuan Li, Jiajun Bu, Haishuai Wang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学学院) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江省无障碍感知与智能系统重点实验室)

AI总结 该研究提出CoANeRV框架,通过轴自适应位置编码等实现高效摊销式视频表示,提升重建质量并降低内存消耗,相关代码已公开。

Comments 27 pages, 13 figures. Code is available at https://github.com/jialong2023/CoANeRV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13626 2026-08-17 cs.AI cs.CL cs.LG 新提交

A Calibrated Test of Internal Action Maps: State Signals Without Global Affine Closure

内部动作图的校准测试:无全局仿射闭包的状态信号

Dekun Yang

机构 * Zhejiang University(浙江大学)

AI总结 该研究测试无全局仿射闭包时内部动作图的校准情况,以Qwen/Qwen3-4B为对象发现状态可用性等可分离,仅h28/h36有因果效应,重拟合未通过组合测试。

Comments 12 pages, 7 figures, 4 tables; includes supplementary results and ancillary reproducibility files

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13552 2026-08-17 cs.CV 版本更新

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: https://kxding.github.io/project/PlayWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09035 2026-08-17 cs.SD cs.AI cs.MM 版本更新

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

MusicLayout:用于可控文本生成音乐的显式结构规划

Shuyu Li, Kejun Zhang, Jiahe Lei, Shulei Ji, Zihao Wang, Jiaxing Yu, Wanying Wu, Lei Wang

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Ant Group(蚂蚁集团)

AI总结 针对文本生成音乐结构隐含难控的问题,提出MusicLayout显式中间表示,将其集成到统一自回归框架实现布局级控制,实验证实该方法可改进音乐长程结构组织并支持布局级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08802 2026-08-17 cs.AI 版本更新

Improving Generalization Robustness of Multimodal RLVR

提升多模态RLVR的泛化鲁棒性

Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You

机构 * National University of Singapore(新加坡国立大学) DAMO Academy Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学) University of California Berkeley(加州大学伯克利分校) Rochester Institute of Technology(罗切斯特理工学院) Georgia Institute of Technology(佐治亚理工学院) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 针对多模态RLVR泛化鲁棒性不足的问题,提出含动态三元奖励与一致性正则化器的PIRL方法,压力测试与动态评估中其性能下降幅度均小于GRPO。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14616 2026-08-17 cs.AI cs.CV 版本更新

SportD: How do VLMs physically strategize?

SportD:视觉语言模型能进行物理策略制定吗?

Jasin Cekinmez, Addison J. Wu, Haotian Xia, Kyumin Andrew Shim, Anay Putty, Jinglin Xiao, Zhuohan Liu, Leo Liu, Weining Shen

机构 * Princeton University(普林斯顿大学) Rice University(莱斯大学) UC Irvine(加州大学欧文分校) POSTECH(浦项科技大学) NYU Shanghai(纽约大学上海分校) UC Santa Barbara(加州大学圣塔芭芭拉分校) Zhejiang University(浙江大学)

AI总结 研究视觉语言模型在足球场景中能否进行物理策略制定,引入SportD基准,通过控球价值模型评估模型决策,发现模型表现低于职业球员,有偏好低方差低回报动作等问题,为衡量模型物理策略推理提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏