arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-08-28 至 2026-08-28 共收录 3
2608.24275 2026-08-28 cs.AI cs.CL 版本更新

RePolicy: Reinforcement Learning for Safety-Policy Invocation in Agent Safeguards

RePolicy:用于智能体安全保障中安全策略调用的强化学习方法

Houcheng Jiang, Boxuan Zhang, Qiyong Zhong, Junfeng Fang, Xiang Wang, Xiangnan He

机构 * Zhejiang University(浙江大学) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 针对现有智能体安全保障方法难以适应未见轨迹和变化策略上下文的问题,提出RePolicy方法,结合PolicyTraj-20K与带可验证奖励和策略上下文扰动的GRPO,在六个智能体安全基准上取得良好安全检测与策略调用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21308 2026-08-28 cs.LG 版本更新

Rethinking Expressivity and Efficiency in Test-Time Training

重新思考测试时训练的表达性与效率

Zeyun Zhong, Joya Chen, Manuel Martin, Frederik Diederichs, Juergen Gall, Juergen Beyerer

机构 * Fraunhofer IOSB(弗劳恩霍夫IOSB研究所) National University of Singapore(新加坡国立大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) University of Bonn(波恩大学) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

AI总结 该研究针对测试时训练难以平衡表达性与效率的问题,提出E²-TTT方法,通过推导闭式状态转移实现并行分块训练,在语言建模、上下文检索及长上下文外推任务中表现优异,兼顾性能与训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11637 2026-08-28 cs.AI 版本更新

TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation

TouchThinker: 通过大规模数据和动作感知表示将触觉常识推理扩展到开放世界

Kailin Lyu, Di Wu, Pengwei Zhang, Yuhang Zheng, Yingxin Lai, Long Xiao, Kangyi Wu, Pengna Li, Chen Gao, Lianyu Hu, Xiaobin Hu, Jie Hao, Ce Hao, Weihao Yuan, Shuicheng Yan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院) Xiamen University(厦门大学) Xi’an Jiaotong University(西安交通大学) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学)

AI总结 提出TouchThinker框架,通过构建百万级多源触觉数据集TouchThinker-1M和动作感知建模,将触觉常识推理扩展到开放世界,在多个数据集上取得竞争性表现。

Comments 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏