arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

2026-08-28 至 2026-08-28 共收录 17
2608.27448 2026-08-28 cs.CL 新提交

TTPO: Test-Time Policy Optimization

TTPO:测试时策略优化

Aozhe Wang, Zhengxi Lu, Jianze Wang, Shangke Lv, Ying Liu, Weiming Lu, Jun Xiao, Yueting Zhuang, Hua Yang, Qianglong Chen, Yongliang Shen

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 该研究针对大语言模型测试时训练的伪标签缺陷,提出 TTPO 方法,通过不对称目标函数与 token 级选择优化,在无标签下实现了与标签监督 OPSD 相当的性能,提升了模型数学推理能力并增强了跨任务泛化性。

Comments Project Page: this https URL (https://zju-real.github.io/TTPO) Code: this https URL (https://github.com/ZJU-REAL/TTPO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26883 2026-08-28 cs.RO 新提交

Active Surface-Driven Reconfigurable Gripper: Robust Grasping and Sequential Manipulation of Thin Objects

主动表面驱动的可重构夹爪:薄物体的稳健抓取与顺序操作

Ziyi Zheng, Keqi Zhu, Hao Wu, Yanzhe Wang, Huixu Dong

机构 * Zhejiang University(浙江大学) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

AI总结 该研究针对现有机械夹爪抓取薄物体时稳健性不足的问题,提出主动表面驱动的可重构欠驱动夹爪,通过设计、建模、优化及实验验证,实现薄物体的可靠抓取与顺序操作。

Comments Accepted by RSS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26872 2026-08-28 cs.CV 新提交

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏

Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26821 2026-08-28 cs.RO 新提交

TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation

TemporalFlow-VLA:学习基于物理基础的执行历史以实现长 horizon 机器人操作

Jiarui Yang, Yehao Lu, Yuning Su, Yu Zhong, Yufeng Xie, Yazhou Zhang, Haiyu Lan, Kaixiang Lu, Peiwen Lin, Chuang Wang, Junwei Liang, Enyu Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Simon Fraser University(西蒙菲莎大学) AgiBot(云圣智能科技(上海)有限公司)

AI总结 TemporalFlow-VLA 针对长 horizon 机器人操作中视觉相似状态需不同动作的问题,通过物理监督学习紧凑执行历史,在 LIBERO、RoboTwin 等任务上取得优异性能,且部署无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26747 2026-08-28 cs.AI 新提交

AgentFold: Closed-Loop Agentic Search for Protein Folding Model Design

AgentFold:用于蛋白质折叠模型设计的闭环智能体搜索

Mingquan Liu, Jiangyu Chen, Hanqun Cao, Xujun Zhang, Pengsen Ma, Xiangru Tang, Shuting Jin, Zhuo Yang, Tianfan Fu, Fang Wu, Xiangxiang Zeng

机构 * Hunan University(湖南大学) Nanjing University(南京大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Wuhan University of Science and Technology(武汉科技大学) Southeast University(东南大学) Stanford University(斯坦福大学)

AI总结 AgentFold是将蛋白质折叠模型开发转化为闭环搜索的多智能体框架,以ESMFold为起点,通过MCTS策略分配计算资源,在匹配预算下较Codex提案提升lDDT 7.5%,优于随机搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26656 2026-08-28 cs.CV cs.AI 新提交

CoGeo-GS: Concept-Driven and Geometry-Aware Multi-Object Removal in 3D Scenes

CoGeo-GS:3D场景中基于概念驱动与几何感知的多物体移除方法

Yuanxiang Ni, Xianliang Huang, Chenhang Ma, Chen Xiao, Yuewen Ma, Ruxin Wang, Hao Zhang

机构 * Southern University of Science and Technology(南方科技大学) ByteDance(字节跳动) Zhejiang University(浙江大学) Fudan University(复旦大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

AI总结 针对3D场景多物体移除的挑战,提出CoGeo-GS框架,通过概念感知语义标签与几何感知补全流水线实现可控多物体移除,在视觉质量与重建保真度上优于现有方法。

Comments 6 pages, 4 figures, accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26622 2026-08-28 cs.RO 新提交

Relaxation-Aware Multimodal Sensing of Soft Gripper Driven by Structure-Perception-Learning

基于结构-感知-学习的软夹持器的松弛感知多模态感知

Yanzhe Wang, Hao Wu, Ziyi Zheng, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

AI总结 该研究针对软夹持器抓取力因粘弹性松弛衰减的问题,提出结构-感知-学习框架,结合变刚度设计与温度耦合粘弹性力表征,使280秒力控抓取误差降低80%至95%,实现稳定持续抓取。

Comments 11 pages, 9 figures. Published in Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26544 2026-08-28 cs.LG 新提交

Chart2SVG: Editable SVG Generation from Raster Chart Images

Chart2SVG:从栅格图表图像生成可编辑的SVG

Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang

机构 * Renmin University of China(中国人民大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shandong University(山东大学) Microsoft Research(微软研究院) Qwen Large Model Application Team, Alibaba(阿里巴巴通义大模型应用团队) University of Technology Sydney(悉尼科技大学)

AI总结 Chart2SVG是融合图表语义令牌、Beagle+数据集与Chart Structure Graph的多模态大语言模型,可生成可编辑SVG,在图表重建与编辑任务中性能优于基线,助力智能可视化工具发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26535 2026-08-28 cs.AI 新提交

Multi2AV-Safety: Benchmarking Safety in Multimodal-to-Audio-Video Generation

Multi2AV-Safety:多模态到音视频生成的安全性基准测试

Kaichao Jiang, Changtao Miao, Baiqi Wu, Zhiyuan Lu, Kang Yang, Peiwei Zhao, Junchi Chen, Yunfeng Diao, He Liu, Qi Chu, Tao Gong, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Hefei University of Technology(合肥工业大学)

AI总结 本研究推出首个覆盖11种非单例多模态条件配置的音视频生成安全性基准Multi2AV-Safety,发现现有安全守卫存在组合风险感知不足的系统性弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26506 2026-08-28 cs.LG cs.CL 新提交

A Single Suffix to Break Them All: Basin-Aware Jailbreaks for Merged Model Families

一个后缀突破所有:针对合并模型家族的感知 Basin 越狱攻击

Yu Zhe, Yixin Tan, Junhao Wei, Wang Chen

机构 * RIKEN AIP(理化学研究所先进智能项目) Institute of Science Tokyo(东京科学大学) Zhejiang University(浙江大学)

AI总结 该研究针对合并模型家族提出BAJ方法,利用预训练基础模型的越狱风险,通过最小-最大优化生成可迁移的对抗性后缀,在多种设置下均实现高迁移成功率且能抵御现有防御。

Comments Accepted by EMNLP findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24275 2026-08-28 cs.AI cs.CL 版本更新

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24135 2026-08-28 cs.AI cs.SE 版本更新

Robust Code RL via Faulty-Code-Driven Test case Synthesis and Dense Reward Shaping

基于故障代码驱动的测试用例合成与密集奖励塑造的鲁棒代码强化学习

Yiwen Zhang, Xiaodong Yan, Zhenyu Huang, Deng Zhao, Liang Jiang, Qing Cui, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 该研究提出RobustTests框架,通过故障代码驱动的测试用例合成与密集奖励塑造,实现RL微调的Qwen3-32B在LiveCodeBench上较基线方法获绝对3%性能提升,增强了LLM代码生成能力。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-28 cs.AI 版本更新

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26663 2026-08-28 cs.RO 版本更新

Tactile-WAM: Touch-Aware World Action Model with Tactile Asymmetric Attention

Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型

Siyu Wu, Linjing You, Junjie Zhu, Yaozu Liu, Huang Kaixiang, Chen Yonghang, Jituo Li, Changhao Zhang, Jian Liu, Hengshuo Chu, Qi Li, Hengshuang Zhao

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。

Comments Submitted to RSS2026 WorkShop Tactile for FM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09828 2026-08-28 cs.CV 版本更新

Latent Spatial Memory for Video World Models

视频世界模型的潜在空间记忆

Weijie Wang, Haoyu Zhao, Yifan Yang, Feng Chen, Zeyu Zhang, Yefei He, Zicheng Duan, Donny Y. Chen, Yuqing Yang, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Microsoft Research(微软研究院) Adelaide University(阿德莱德大学) Monash University(莫纳什大学)

AI总结 提出潜在空间记忆框架Mirage,通过在扩散潜在空间中直接构建和查询3D缓存,避免像素空间重建,实现高效视频生成,速度提升10.57倍,内存减少55倍。

Comments Project Page: this https URL (https://aka.ms/latent-spatial-memory), Code: this https URL (https://github.com/microsoft/LatentSpatialMemory)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08000 2026-08-28 cs.CL cs.AI 版本更新

Summarization is Not Dead Yet

摘要生成尚未消亡

Dongqi Liu, Chenxi Whitehouse, Zheng Zhao, Zhuchen Cao, Jian Li, Yabiao Wang

机构 * Saarland University(萨尔大学) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) University of Cambridge(剑桥大学) University of Edinburgh(爱丁堡大学) Zhejiang University(浙江大学) Tencent YouTu Lab(腾讯优图实验室)

AI总结 通过多维度评估,发现人类参考摘要在信息量和忠实度上仍优于大语言模型,后者仅在表面连贯性和流畅性上占优,表明摘要生成研究仍有挑战。

Comments EMNLP 2026 Main & Long Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11515 2026-08-28 cs.LG cs.AI cs.CL 版本更新

AirLLM: Diffusion Policy-based Adaptive LoRA for Remote Fine-Tuning of LLM over the Air

AirLLM:面向空中远程微调的基于扩散策略的自适应LoRA方法

Shiyi Yang, Xiaoxue Yu, Rongpeng Li, Jianhang Zhu, Zhifeng Zhao, Honggang Zhang

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Lab(浙江实验室)

AI总结 AirLLM是一种分层扩散策略框架,通过PPO智能体与DDIM交替优化实现自适应LoRA秩配置,可提升LLM空中远程微调性能并降低传输成本。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏