Embedding-perturbed Exploration Preference Optimization for Flow Models
嵌入扰动探索偏好优化用于流模型
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里集团AMAP)
AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。
Comments Accepted by ICML 2026
大厂专区
嵌入扰动探索偏好优化用于流模型
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里集团AMAP)
AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。
Comments Accepted by ICML 2026
扩散语言模型的动态分块
机构 * CSE, HKUST(香港科技大学计算机科学与工程系) ; Xiaohongshu Inc.(小红书公司) ; Alibaba group(阿里巴巴集团) ; CityUHK(城市大学香港校区)
AI总结 本文提出动态分块扩散模型,通过内容定义语义分块替代固定位置分块,提升序列结构利用效率,在参数规模达1.5B的下游任务中表现更优。
几块GPU,大量规模:PrismLLM实现忠实的LLM训练仿真
机构 * Alibaba Group(阿里巴巴集团) ; Harvard University(哈佛大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
AI总结 PrismLLM通过切片方法构建高保真执行图,使工程师能用少量GPU模拟大规模训练行为,准确复现性能和内存表现,节省集群访问成本。
Comments 13 pages body, 21 pages total
从反馈循环到政策更新:基于强化微调的LLM驱动的alpha因子发现
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Nanjing University(南京大学) ; University of Illinois Chicago(伊利诺伊大学香槟分校)
AI总结 本文提出QuantEvolver框架,通过强化微调将可执行量化评估转化为策略更新,提升LLM在alpha因子发现中的表现,生成高质量且互补的因子池。
从输入输出到代码:发现代理
机构 * School of Computer Science, Peking University(北京大学计算机科学系) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Wuhan University(武汉大学) ; Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学) ; Shanghai Jiaotong University(上海交通大学)
AI总结 本文提出DIO-Agent,通过将IO2Code视为离散程序空间的进化搜索,利用LLM作为突变算子,结合执行误差信号指导突变,解决从输入输出行为合成代码的难题。
视觉语言模型的深度预对齐
机构 * Tsinghua University ; Shanghai Qi Zhi Institute ; Taobao \& Tmall Group of Alibaba
AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。
Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment
融合监督学习与强化学习微调的前缀采样
机构 * ILCC, University of Edinburgh(爱丁堡大学ILCC) ; Fudan University(复旦大学) ; Qwen Team, Alibaba Group(阿里集团Qwen团队) ; ILLC, University of Amsterdam(阿姆斯特丹大学ILLC)
AI总结 本文提出Prefix-RFT方法,结合示范数据与探索学习,通过数学问题验证其有效性,超越了单独SFT和RFT以及混合策略方法。
Comments ICML 2026
大语言模型可能只是机械学习者
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; State Key Laboratory of Transvascular Implantation Devices and TIDRI(血管植入设备国家重点实验室和TIDRI) ; Zhejiang Key Laboratory of Medical Imaging Artificial Intelligence(浙江医学影像人工智能重点实验室) ; School of Data Science of Engineering, East China Normal University(华东师范大学工程数据科学学院) ; Second Affiliated Hospital and Liangzhu Laboratory, Zhejiang University School of Medicine(浙江大学医学院第二附属医院和良渚实验室) ; Alibaba Group(阿里巴巴集团)
AI总结 本文研究大语言模型在基准测试中的可靠性问题,提出TrinEval框架以区分真实能力学习与机械记忆,发现主流模型在知识点上依赖机械记忆的比例高达19.6%。
Comments Work in Progress
TrainMover: 一种具有中断容错能力的机器学习训练运行时
机构 * Harvard University(哈佛大学) ; Alibaba Group(阿里巴巴集团) ; UT Austin(得克萨斯大学奥斯汀分校)
AI总结 TrainMover通过弹性与备用机器处理中断,实现最小停机时间和零内存开销,减少GPU浪费时间达55%。
Comments 14 pages body, 19 pages total