arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-06-09 至 2026-06-09 共收录 9
2606.09447 2026-06-09 cs.AI 新提交

AliyunConsoleAgent: Training Web Agents in Real-World Cloud Environments via Distillation and Reinforcement Learning

AliyunConsoleAgent:通过蒸馏和强化学习在真实云环境中训练Web智能体

Bojie Rong, Zheyu Shen, Qiaoping Wang, Pengfei Kang, Yang Xu, Yawen Wei, Hanyu Wu, Zhi Zhao, Leihao Pei, Linquan Jiang

机构 * Alibaba Cloud China(阿里云中国)

AI总结 提出AliyunConsoleAgent框架,通过蒸馏前沿模型轨迹进行监督微调,再结合GRPO和双通道结果奖励模型在真实云环境中强化学习,实现文档验证自动化,以低成本达到接近前沿专有模型的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09393 2026-06-09 cs.CV 新提交

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成

Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里云) The Chinese University of Hong Kong(香港中文大学)

AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。

Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09392 2026-06-09 cs.AI 新提交

From Coarse to Fine: Managing Temporal Granularity in Spatio-Temporal Data for Fine-Grained Traffic Prediction

从粗到细:管理时空数据中的时间粒度以实现细粒度交通预测

Shuhao Li, Weidong Yang, Yue Cui, Zizhuo Xu, Lipeng Ma, Fan Zhang, Xiaofang Zhou

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) The Hong Kong University of Science and Technology(香港科技大学) Guangzhou University(广州大学)

AI总结 针对粗粒度采样数据难以支持细粒度预测的问题,提出时空细化预测器(STRP),通过树卷积和逆膨胀卷积实现高效时空建模,在六个数据集上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-06-09 cs.CL 新提交

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09048 2026-06-09 eess.AS cs.AI cs.SD 新提交

BareWave: Waveform-Native Flow-Matching Text-to-Speech

BareWave: 波形原生流匹配文本转语音

Wei Fan, Chao-Hong Tan, Qian Chen, Wen Wang, Xiangang Li, Kejiang Chen, Weiming Zhang, Nenghai Yu

机构 * Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) Tongyi Fun Team, Alibaba Group(阿里巴巴集团通义Fun团队)

AI总结 提出BareWave,一种完全波形原生的流匹配TTS框架,通过训练时表示对齐、分阶段噪声调度和速度感知感知对齐解决直接波形训练难题,实现零样本语音克隆的高质量合成。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08708 2026-06-09 cs.CV 新提交

PRPO: Perception-Reinforced Policy Optimization via Token-Level Dynamic Advantage Reshaping

PRPO: 通过令牌级动态优势重塑的感知强化策略优化

Qiming Li, Tianlun Li, Xiaolong Cheng, Hangyu Li, Ruiyan Gong, Kangning Niu, Kaitao Jiang, Mu Xu

机构 * Amap CV Lab, Alibaba Group(阿里巴巴集团高德地图计算机视觉实验室) Peking University(北京大学)

AI总结 提出令牌级强化学习框架PRPO,通过鲁棒视觉依赖(RVD)指标识别关键感知令牌,并利用感知优势重塑(PAR)技术增强其学习信号,在7个多模态推理基准上平均提升23.3%(3B模型)和21.1%(7B模型)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07978 2026-06-09 cs.CL 新提交

MechLens: Late Crystallization of Factual Knowledge Explains Intervention Effectiveness in Language Models

MechLens:事实知识的晚期结晶解释语言模型中的干预有效性

Xueping Gao

机构 * Alibaba Cloud(阿里云)

AI总结 本文发现LLM中的事实知识在最后层突然“结晶”,而非逐层涌现,并基于此提出结晶引导的干预原则,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07965 2026-06-09 cs.AI 新提交

Zero-Shot Learning in Industrial Scenarios: New Large-Scale Benchmark, Challenges and Baseline

工业场景中的零样本学习:新的大规模基准、挑战与基线

Zekai Zhang, Qinghui Chen, Maomao Xiong, Shijiao Ding, Zhanzhi Su, Xinjie Yao, Yiming Sun, Cong Bai, Jinglin Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学) Microsoft Research(微软研究院)

AI总结 针对工业场景中视觉语言模型应用难、数据稀缺的问题,提出大规模多模态工业开放数据集MMIO和精炼文本-视觉提示RTVP,实现零样本工业缺陷检测,在MMIO上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07654 2026-06-09 cs.CV cs.AI 新提交

MM-Matryoshka: Towards Budget-Elastic Visual Document Retrieval via a 2D Multimodal Matryoshka Training Framework

MM-Matryoshka:通过二维多模态套娃训练框架实现预算弹性视觉文档检索

Haowen Xiang, Yibo Yan, Jiahao Huo, Yu Huang, Yi Cao, Mingdong Ou, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出MM-Matryoshka,一种二维套娃训练框架,使视觉文档检索器在向量维度和编码器深度上实现弹性预算选择,无需为不同预算训练独立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏