arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-18 至 2026-05-18 共收录 9
2605.15803 2026-05-18 cs.CV cs.LG

Embedding-perturbed Exploration Preference Optimization for Flow Models

嵌入扰动探索偏好优化用于流模型

Sujie Hu, Chubin Chen, Jiashu Zhu, Jiahong Wu, Xiangxiang Chu, Xiu Li

机构 * Tsinghua University(清华大学) AMAP, Alibaba Group(阿里集团AMAP)

AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15676 2026-05-18 cs.CL

Dynamic Chunking for Diffusion Language Models

扩散语言模型的动态分块

Yichen Zhu, Xiaoming Shi, Peng Zhao, Weiyu Chen, Debing Zhang, James Kwok

机构 * CSE, HKUST(香港科技大学计算机科学与工程系) Xiaohongshu Inc.(小红书公司) Alibaba group(阿里巴巴集团) CityUHK(城市大学香港校区)

AI总结 本文提出动态分块扩散模型,通过内容定义语义分块替代固定位置分块,提升序列结构利用效率,在参数规模达1.5B的下游任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15617 2026-05-18 cs.DC cs.AI

A Few GPUs, A Whole Lotta Scale: Faithful LLM Training Emulation with PrismLLM

几块GPU,大量规模:PrismLLM实现忠实的LLM训练仿真

Shaoke Xi, ChonLam Lao, Boyi Jia, Jiaqi Gao, Zhipeng Zhang, Jiamin Cao, Brian Sutioso, Erci Xu, Minlan Yu, Kui Ren, Yong Li, Zhengping Qian, Ennan Zhai, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团) Harvard University(哈佛大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 PrismLLM通过切片方法构建高保真执行图,使工程师能用少量GPU模拟大规模训练行为,准确复现性能和内存表现,节省集群访问成本。

Comments 13 pages body, 21 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15412 2026-05-18 cs.CE cs.AI cs.CL

From Feedback Loops to Policy Updates: Reinforcement Fine-Tuning for LLM-Based Alpha Factor Discovery

从反馈循环到政策更新:基于强化微调的LLM驱动的alpha因子发现

Lingzhe Zhang, Tong Jia, Yunpeng Zhai, Zixuan Xie, Chiming Duan, Minghua He, Philip S. Yu, Ying Li

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Nanjing University(南京大学) University of Illinois Chicago(伊利诺伊大学香槟分校)

AI总结 本文提出QuantEvolver框架,通过强化微调将可执行量化评估转化为策略更新,提升LLM在alpha因子发现中的表现,生成高质量且互补的因子池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15334 2026-05-18 cs.LG cs.AI cs.CL cs.SE

From I/O to Code with Discovery Agent

从输入输出到代码:发现代理

Yihong Dong, Jiaru Qian, Haoran Zhang, Peixu Wang, Binhua Li, Zhi Jin, Yongbin Li, Ge Li, Xiaokang Yang, Xue Jiang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Wuhan University(武汉大学) Renmin University of China(中国人民大学) National University of Singapore(新加坡国立大学) Shanghai Jiaotong University(上海交通大学)

AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15300 2026-05-18 cs.CV

Deep Pre-Alignment for VLMs

视觉语言模型的深度预对齐

Tianyu Yu, Kechen Fang, Zihao Wan, Kaidong Zhang, Yicheng Zhang, Jun Song, Bo Zheng, Yuan Yao

机构 * Tsinghua University Shanghai Qi Zhi Institute Taobao \& Tmall Group of Alibaba

AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。

Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01679 2026-05-18 cs.LG cs.AI cs.CL

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

融合监督学习与强化学习微调的前缀采样

Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

机构 * ILCC, University of Edinburgh(爱丁堡大学ILCC) Fudan University(复旦大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) ILLC, University of Amsterdam(阿姆斯特丹大学ILLC)

AI总结 本文提出Prefix-RFT方法,结合示范数据与探索学习,通过数学问题验证其有效性,超越了单独SFT和RFT以及混合策略方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08300 2026-05-18 cs.CL cs.AI

Large Language Models Could Be Rote Learners

大语言模型可能只是机械学习者

Yuyang Xu, Renjun Hu, Haochao Ying, Jian Wu, Xing Shi, Wei Lin

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Laboratory of Transvascular Implantation Devices and TIDRI(血管植入设备国家重点实验室和TIDRI) Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) School of Data Science of Engineering, East China Normal University(华东师范大学工程数据科学学院) Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University School of Medicine(浙江大学医学院第二附属医院和良渚实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文研究大语言模型在基准测试中的可靠性问题,提出TrinEval框架以区分真实能力学习与机械记忆,发现主流模型在知识点上依赖机械记忆的比例高达19.6%。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12636 2026-05-18 cs.DC cs.AI cs.LG cs.PF

TrainMover: An Interruption-Resilient Runtime for ML Training

TrainMover: 一种具有中断容错能力的机器学习训练运行时

ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yong Li, Zhengping Qian, Aditya Akella, Minlan Yu, Ennan Zhai, Dennis Cai, Jingren Zhou

机构 * Harvard University(哈佛大学) Alibaba Group(阿里巴巴集团) UT Austin(得克萨斯大学奥斯汀分校)

AI总结 TrainMover通过弹性与备用机器处理中断,实现最小停机时间和零内存开销,减少GPU浪费时间达55%。

Comments 14 pages body, 19 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏