arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-07-03 至 2026-07-03 共收录 7
2607.02234 2026-07-03 cs.AI cs.LG 新提交

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01804 2026-07-03 cs.RO 新提交

VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon

VLA-Corrector:面向自适应动作视界的轻量级检测与校正推理

Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

机构 * OmniAI Group of ZJU ACES Lab(浙江大学ACES实验室OmniAI组) Zhejiang University(浙江大学) Alibaba DAMO Academy(阿里巴巴达摩院)

AI总结 提出VLA-Corrector,一种轻量级校正推理框架,通过潜在空间视觉监控和在线梯度引导,实现事件触发的自适应动作视界,在不修改骨干策略权重的情况下,中断复合错误并提升鲁棒性。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01752 2026-07-03 cs.LG 新提交

Efficient Temporal Point Processes via Monotone Alternating Splines

通过单调交替样条实现高效时间点过程

Cheng Wan, Quyu Kong, Feng Zhou

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Cloud(阿里云) Center for Applied Statistics and School of Statistics, Renmin University of China(中国人民大学应用统计中心与统计学院)

AI总结 针对单调神经网络在建模累积条件强度函数时的结构缺陷,提出单调交替样条框架,通过分离插值与外推组件提升表示能力与计算效率,在合成和真实数据集上取得更优性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31612 2026-07-03 cs.CV 新提交

What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States

GUI代理真正需要什么样的记忆?从被动记录到主动任务驱动状态

Chen Liu, Ling Chen, Hanzhang Zhou, Xu Zhang, Quyu Kong, Panrong Tong, Wenhao Wang, Xin Yu, Steven Hoi, Yue Wang

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) University of Technology Sydney(悉尼科技大学) Adelaide University(阿德莱德大学)

AI总结 提出主动任务驱动记忆(ATMem),将GUI代理的记忆从被动存储转变为主动维护的执行状态,并引入STR-GRPO强化学习方法,通过对比记忆开启和关闭的轨迹来选择性使用记忆,以提升长周期任务执行的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11891 2026-07-03 cs.RO cs.SY eess.SY 版本更新

VLSA: Vision-Language-Action Models with Plug-and-Play Safety Constraint Layer

VLSA: 具有即插即用安全约束层的视觉-语言-动作模型

Songqiao Hu, Zeyi Liu, Shuang Liu, Jun Cen, Zihan Meng, Shihefeng Wang, Xiang Li, Xiao He

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学智能与机器人研究院) TetraBOT DAMO Academy, Alibaba Group(阿里巴巴集团达摩院)

AI总结 提出AEGIS架构,通过控制屏障函数构建即插即用安全约束层,集成到VLA模型中保证安全性与任务性能,在SafeLIBERO基准上障碍物避免率提升超50%,任务成功率提升近10%。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20441 2026-07-03 cs.SD cs.AI 版本更新

UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement

UniSE:一种基于仅解码器自回归语言模型的统一语音增强框架

Haoyin Yan, Chengwei Liu, Shaofei Xue, Xiaotao Liang, Yinghao Liu, Yuxiang Kong, Zheng Xue

机构 * Qwen Business Unit of Alibaba, China(阿里巴巴Qwen业务单元,中国) Tongyi AI Lab of Alibaba, China(阿里巴巴通义AI实验室,中国)

AI总结 提出UniSE,一种统一的仅解码器LM框架,通过自回归生成离散令牌处理语音恢复、目标说话人提取和语音分离任务,并引入渐进强化学习优化质量,在多个基准上取得竞争性表现。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏