arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-07-03 至 2026-07-03 共收录 4
2607.02234 2026-07-03 cs.AI cs.LG 新提交

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01752 2026-07-03 cs.LG 新提交

Efficient Temporal Point Processes via Monotone Alternating Splines

通过单调交替样条实现高效时间点过程

Cheng Wan, Quyu Kong, Feng Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Cloud(阿里云) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心与统计学院)

AI总结 针对单调神经网络在建模累积条件强度函数时的结构缺陷,提出单调交替样条框架,通过分离插值与外推组件提升表示能力与计算效率,在合成和真实数据集上取得更优性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31612 2026-07-03 cs.CV 新提交

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态

Chen Liu, Ling Chen, Hanzhang Zhou, Xu Zhang, Quyu Kong, Panrong Tong, Wenhao Wang, Xin Yu, Steven Hoi, Yue Wang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) University of Technology Sydney(悉尼科技大学) Adelaide University(阿德莱德大学)

AI总结 提出主动任务驱动记忆(ATMem),将GUI代理的记忆从被动存储转变为主动维护的执行状态,并引入STR-GRPO强化学习方法,通过对比记忆开启和关闭的轨迹来选择性使用记忆,以提升长周期任务执行的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏