arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-13 至 2026-05-13 共收录 19
2605.12481 2026-05-13 cs.AI

ToolCUA: Towards Optimal GUI-Tool Path Orchestration for Computer Use Agents

ToolCUA:迈向计算机使用代理的最优GUI工具路径协调

Xuhao Hu, Xi Zhang, Haiyang Xu, Kyle Qiao, Jingyi Yang, Xuanjing Huang, Jing Shao, Ming Yan, Jieping Ye

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出ToolCUA,通过分阶段训练范式学习最优GUI-工具路径选择,利用交互式轨迹缩放管道和工具引导的GUI RFT提升关键切换点决策,实验显示其在OSWorld-MCP上准确率达46.85%,优于基线模型66%,证明了有效的GUI-工具协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12039 2026-05-13 cs.CL

SkillGraph: Skill-Augmented Reinforcement Learning for Agents via Evolving Skill Graphs

SkillGraph:通过演化的技能图增强代理的强化学习

Xiaoyuan Li, Moxin Li, Keqin Bao, Yubo Ma, Wenjie Wang, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

AI总结 SkillGraph通过演化的技能图增强代理的强化学习,解决技能组合任务中的依赖识别和库维护问题,实验显示其在复杂任务中表现优异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12022 2026-05-13 cs.CL

SAGE: Scalable Automated Robustness Augmentation for LLM Knowledge Evaluation

SAGE:可扩展的自动鲁棒性增强用于LLM知识评估

Xiaoyuan Li, Yuzhe Wang, Moxin Li, Keqin Bao, Rui Men, Yichang Zhang, Dayiheng Liu, Wenjie Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12004 2026-05-13 cs.CL

Learning Agentic Policy from Action Guidance

从动作指导学习代理策略

Yuxiang Ji, Zengbin Wang, Yong Wang, Shidong Yang, Ziyu Ma, Guanhua Chen, Zonghua Sun, Liaoni Wu, Xiangxiang Chu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里云实验室,阿里巴巴集团) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出ActGuide-RL方法,通过利用日常人类交互生成的动作数据,减少对昂贵迭代监督微调的依赖,提升代理强化学习在搜索代理基准上的性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11978 2026-05-13 cs.CL

On Predicting the Post-training Potential of Pre-trained LLMs

关于预训练语言模型后训练潜力的预测

Xiaoyuan Li, Yubo Ma, Kexin Yang, Moxin Li, Keqin Bao, Wenie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

AI总结 本文提出RuDE框架,通过响应判别预测预训练模型后训练潜力,实验显示与后训练表现相关性超90%,验证了其在高效基础模型开发中的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11887 2026-05-13 cs.CL cs.LG

Qwen-Scope: Turning Sparse Features into Development Tools for Large Language Models

Qwen-Scope:将稀疏特征转化为大语言模型的开发工具

Boyi Deng, Xu Wang, Yaoning Wang, Yu Wan, Yubo Ma, Baosong Yang, Haoran Wei, Jialong Tang, Huan Lin, Ruize Gao, Tianhao Li, Qian Cao, Xuancheng Ren, Xiaodong Deng, An Yang, Fei Huang, Dayiheng Liu, Jingren Zhou

机构 * Qwen Team(Qwen团队)

AI总结 Qwen-Scope通过稀疏自编码器为大语言模型提供开发工具,支持推理引导、评估分析、数据驱动工作流和训练优化,展示了SAEs在模型诊断与改进中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10235 2026-05-13 cs.CL

Route Before Retrieve: Activating Latent Routing Abilities of LLMs for RAG vs. Long-Context Selection

在检索前路由:激活大语言模型的潜在路由能力用于RAG与长上下文选择

Yiwen Chen, Kuan Li, Fuzhen Zhuang, Deqing Wang, Zhao Zhang, Liwen Zhang, Yong Jiang, Shuai Wang, Minhao Cheng

机构 * Beihang University(北航) HKUST(香港科技大学) Alibaba Group(阿里巴巴集团) Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 本文提出Pre-Route框架,通过结构化推理提前决策,利用轻量级元数据进行任务分析和信息需求预测,实现可解释且高效的路由决策,实验表明其在成本效益上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08804 2026-05-13 cs.RO

Constraint-Aware Diffusion Priors for High-Fidelity and Versatile Quadruped Locomotion

具有约束意识的扩散先验用于高保真和多功能四足运动

Jianhui Chen, Ruixin Zhan, Liu Liu, Yang Cai, Ziqiao Li

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出Diff-CAST框架,利用扩散模型多模态分布建模能力解决传统GAN判别器模式崩溃和运动分布捕捉问题,通过Symmetric Augmented Command Conditioning和Constrained RL实现高保真四足运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10500 2026-05-13 cs.CV

Visual Enhanced Depth Scaling for Multimodal Latent Reasoning

视觉增强深度缩放用于多模态潜在推理

Yudong Han, Yong Wang, Zaiquan Yang, Zhen Qu, Liyuan Pan, Xiangxiang Chu

机构 * Beijing Institute of Technology(北京理工大学) AMAP, Alibaba Group(阿里集团AMAP) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Yangtze Delta Region Academy of Beijing Institude of Technology, Jiaxing, China(北京理工大学扬子江地区学院,嘉兴,中国)

AI总结 本文提出视觉回放模块和路由深度缩放,通过增强视觉感知和细化复杂潜在表示,提升多模态潜在推理的效率与性能。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09587 2026-05-13 cs.CV cs.AI

MieDB-100k: A Comprehensive Dataset for Medical Image Editing

MieDB-100k:用于医学图像编辑的综合数据集

Yongfan Lai, Wen Qian, Bo Liu, Hongyan Li, Hao Luo, Fan Wang, Bohan Zhuang, Shenda Hong

机构 * State Key Laboratory of General Artificial Intelligence, Beijing, China(1 国家一般人工智能重点实验室,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(2 智能科学与技术学院,北京大学,北京,中国) National Institute of Health Data Science, Peking University, Beijing, China(3 国家健康数据科学研究院,北京大学,北京,中国) DAMO Academy, Alibaba Group, Zhejiang, China(4 阿里巴巴集团 DAMO 院,浙江,中国) hupan lab, zhejiang province(5 鹏元实验室,浙江省) Zhejiang University, Zhejiang, China(6 浙江大学,浙江,中国)

AI总结 本文提出MieDB-100k数据集,通过数据筛选流程结合专家模型与规则生成方法,解决医学图像编辑中数据质量、多样性与可扩展性不足的问题,实验表明其在医学图像编辑任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24145 2026-05-13 cs.AI

OpsAgent: An Evolving Multi-agent System for Incident Management in Microservices

OpsAgent:一种用于微服务中 incident 管理的演进多智能体系统

Yu Luo, Jiamin Jiang, Jingfei Feng, Lei Tao, Qingliang Zhang, Xidao Wen, Yongqian Sun, Shenglin Zhang, Dan Pei

机构 * Nankai University(南开大学) Alibaba Cloud(阿里云) Lenovo(联想) Tsinghua University(清华大学)

AI总结 本文提出 OpsAgent,一种轻量级自演进多智能体系统,通过训练自由数据处理器将异构可观测数据转化为结构化文本描述,并结合多智能体协作框架实现诊断推理的透明性和可审计性,实验证明其在微服务系统中的泛化性、可解释性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11832 2026-05-13 cs.RO

Learning Action Manifold with Multi-view Latent Priors for Robotic Manipulation

基于多视图潜在先验的学习动作流形用于机器人操作

Junjin Xiao, Dongyang Li, Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Feng Xiong, Mu Xu, Xing Wei, Zhiheng Ma, Qing Zhang, Wei-Shi Zheng

机构 * Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(机器智能与先进计算国家重点实验室,教育部,中国) AMap, Alibaba Group(阿里的AMap) Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

AI总结 本文提出利用多视图扩散模型合成潜在新视角,并引入几何引导门控变换器以提升机器人视觉-语言-动作模型的空间感知与操作性能,通过动作流形学习提高动作学习效率,实验证明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11814 2026-05-13 cs.AI

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

MedMemoryBench:个性化医疗中智能体记忆的基准测试

Yihao Wang, Haoran Xu, Renjie Gu, Yixuan Ye, Xinyi Chen, Xinyu Mu, Yuan Gao, Chunxiao Guo, Peng Wei, Jinjie Gu, Huan Li, Ke Chen, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 本文提出MedMemoryBench,通过合成真实医疗场景数据,评估智能体长期记忆能力,并揭示主流架构在复杂医疗推理中的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11807 2026-05-13 cs.AI

Why Users Go There: World Knowledge-Augmented Generative Next POI Recommendation

为何用户前往那里:世界知识增强的生成性下一个兴趣点推荐

Qiuyu Ding, Heng-Da Xu, Wei Zhang, Dongyi Lv, Changda Xia, Feng Xiong, Mu Xu

机构 * Amap, Alibaba Group(阿里巴巴集团阿地图) Xi’an Jiaotong University(西安交通大学)

AI总结 本文提出AWARE模型,通过LLM代理生成时空感知的上下文叙述,结合用户行为增强世界知识,提升POI推荐效果,实验证明其优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11685 2026-05-13 cs.CL

Robust LLM Unlearning Against Relearning Attacks: The Minor Components in Representations Matter

鲁棒的LLM去学习对抗重新学习攻击:表示中的次要成分至关重要

Zeguan Xiao, Xuanzhe Xu, Yun Chen, Yong Wang, Jian Yang, Yanqing Hu, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海金融学院) Alibaba Group(阿里巴巴集团) Southern University of Science and Technology(南方科技大学) Beihang University(北航)

AI总结 本文研究了LLM去学习中对抗重新学习攻击的脆弱性,发现现有方法主要优化主导成分,而次要成分更抗反转。提出Minor Component Unlearning方法,通过聚焦稳健方向提升抗攻击能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11629 2026-05-13 cs.CL

OmniThoughtVis: A Scalable Distillation Pipeline for Deployable Multimodal Reasoning Models

OmniThoughtVis: 一种可扩展的蒸馏流水线,用于可部署的多模态推理模型

Yuanhao Yue, Chengyu Wang, Yuanjie Lyu, Lei Shen, Jun Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出OmniThoughtVis流水线,通过大规模多模态Co T监督将高容量教师模型的推理能力转移到小型部署模型,实现了在多个基准上的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01103 2026-05-13 cs.AI

Probing RLVR training instability through the lens of objective-level hacking

通过目标层面黑客的视角探查RLVR训练不稳定性

Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang

机构 * School of Physics, Peking University(北京大学物理学院) Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)

AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12678 2026-05-13 cs.CL

Gradient-Boosted Decision Tree for Listwise Context Model in Multimodal Review Helpfulness Prediction

基于列表式上下文模型的梯度提升决策树在多模态评论有用性预测中的应用

Thong Nguyen, Xiaobao Wu, Xinshuai Dong, Anh Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) DAMO Academy(达摩院)

AI总结 本文提出列表式注意力网络和梯度提升决策树,用于多模态评论有用性预测,以提升模型泛化能力与排名准确性。

Comments Published in ACL 2023 (Findings). Code is available at https://github.com/nguyentthong/gbdt_listwise_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.03524 2026-05-13 cs.CL

Adaptive Contrastive Learning on Multimodal Transformer for Review Helpfulness Predictions

多模态Transformer上的自适应对比学习用于评论有用性预测

Thong Nguyen, Xiaobao Wu, Anh-Tuan Luu, Cong-Duy Nguyen, Zhen Hai, Lidong Bing

机构 * National University of Singapore(国立新加坡大学) VinAI Research(VinAI研究院) Nanyang Technological University(南洋理工大学) DAMO Academy(达摩院)

AI总结 本文提出多模态对比学习方法,通过增强跨模态关系和自适应加权方案提升多模态评论有用性预测性能,实验证明优于现有方法。

Comments Accepted to the main EMNLP 2022 conference. Code is available at https://github.com/nguyentthong/adaptive_contrastive_mrhp

详情

展开后加载摘要…

URL PDF HTML 收藏