arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-28 至 2026-08-28 共收录 7
2608.24275 2026-08-28 cs.AI cs.CL 版本更新

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24135 2026-08-28 cs.AI cs.SE 版本更新

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-28 cs.AI 版本更新

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-28 cs.RO 版本更新

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Hengshuo Chu, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-08-28 cs.CV 版本更新

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11515 2026-08-28 cs.LG cs.AI cs.CL 版本更新

AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air

AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法

Shiyi Yang, Xiaoxue Yu, Rongpeng Li, Jianhang Zhu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Lab(浙江实验室)

AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏