Multi-Stakeholder LLM Alignment: Decomposing Estimation from Aggregation
多方利益相关者LLM对齐:从聚合中分解估计
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; Beihang University(北京航空航天大学)
AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。
大厂专区
多方利益相关者LLM对齐:从聚合中分解估计
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; Beihang University(北京航空航天大学)
AI总结 针对多方利益相关者任务中用户偏好冲突的问题,提出DecompR方法,通过反事实校准权重固定查询结构,独立估计角色效用,消除候选依赖的权重漂移并降低估计噪声。
ProcCtrlBench: 评估LLM编码智能体中的过程级缺陷与控制保持
机构 * Amap, Alibaba Group(阿里云)
AI总结 提出ProcCtrlBench基准,通过可复用的缺陷本体和标准化轨迹表示,从过程证据而非仅最终结果评估LLM编码智能体的执行质量,并引入控制保持量化执行过程的可解释性、可中断性等属性。
Comments 22 pages, 8 figures
VIDA: 多模态机器翻译中视觉依赖歧义的数据集
机构 * Department of Informatics, Universität Hamburg(汉堡大学信息学院) ; Alibaba Group(阿里巴巴集团) ; Alibaba Cloud(阿里云)
AI总结 提出VIDA数据集,包含2500个精心策划的实例,用于评估多模态机器翻译中需要视觉证据才能解决的歧义,并引入以歧义消解为中心的指标,实验表明链式思维微调能提升跨分布歧义消解能力。
DynFrame: 自适应推理驱动的多模态框架与动态帧增强用于复杂视频理解
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出DynFrame框架,通过将时间窗口和采样密度作为原生token进行单步检索,并引入分段解耦GRPO优化,解决了视频多模态大模型中采样密度不可学习及检索与回答优化耦合的问题。
ReCA: 通过递归上下文分配实现多镜头长视频外推
机构 * Monash University(墨尔本大学) ; Tongyi Lab, Alibaba Group(通义实验室,阿里集团) ; Zhejiang University(浙江大学) ; University of Queensland(昆士兰大学)
AI总结 针对多镜头视频外推任务中上下文分配瓶颈,提出递归上下文分配框架,通过层次化分解和结构化状态传播提升长视频生成的一致性和质量。
Comments Project Page: https://reca.vmv.re , Code: https://github.com/ali-vilab/ReCA
Extra-Merge:追踪语言模型预训练中模型合并的秩-1子空间
机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室) ; University of Chinese Academy of Sciences, China(中国科学院大学) ; Alibaba Group, China(阿里巴巴集团) ; School of Mathematics, Southeast University, Nanjing, China(东南大学数学学院)
AI总结 本文通过分析预训练后期轨迹发现秩-1子空间现象,提出无需额外训练的Extra-Merge方法,沿该子空间外推以最小化损失,在GPT-2和LLaMA系列上优于标准合并基线。
Uniboost:基于价值对齐的全局协调实现公平高效的流量分配
机构 * Taobao \& Tmall Group of Alibaba Hangzhou China ; Taobao \& Tmall Group of Alibaba Beijing China ; Taobao \& Tmall Group of Alibaba
AI总结 提出Uniboost统一流量分配框架,通过后验价值对齐机制和独立线性提升范式,解决耦合分配、分数膨胀和可解释性问题,提升流量分配效率和推荐性能。
Comments accepted by SIGIR 2026
LLM蒸馏中的桥园困境:为什么混合硬标签和软标签有效
机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院) ; Alibaba Group, Hangzhou, China(阿里巴巴集团) ; State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) ; Key Laboratory of Big Data Mining and Knowledge Management (BDKM), University of Chinese Academy of Sciences, Beijing, China(中国科学院大数据挖掘与知识管理重点实验室)
AI总结 针对大语言模型知识蒸馏中硬标签与软标签的混合使用,提出桥园分解理论解释其降低暴露偏差的机制,并开发自适应混合监督方法,在多个模型上实现性能提升和9.7倍训练成本降低。
Comments Accepted at ICML 2026
InfoQuant:为低比特LLM量化塑造激活分布
机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) ; Ant Group(蚂蚁集团) ; College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院) ; China Mobile (Zhejiang) Research & Innovation Institute(中国移动(浙江)研究院) ; Alibaba Cloud Computing(阿里云计算) ; State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)
AI总结 针对低比特激活量化中分布与量化器不匹配的问题,提出基于信息论的分析和无需训练的峰值抑制正交变换(PSOT)方法,显著提升量化精度。
RISE: 自进化视觉语言模型的可靠改进
机构 * AMAP, Alibaba Group(阿里集团AMAP实验室)
AI总结 针对视觉语言模型自进化中角色交替粗粒度、问题质量下降和类型坍缩问题,提出RISE框架,通过细粒度角色交替、质量监督器和技能感知动态平衡实现可靠自进化。
D-OPSD:用于连续调优步蒸馏扩散模型的在线自蒸馏方法
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Z-Image Team, Alibaba Group(阿里集团Z-Image团队) ; University of California, San Diego(加州大学圣地亚哥分校) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 提出D-OPSD,一种在线自蒸馏训练范式,使步蒸馏扩散模型在监督微调中保持少步推理能力,通过让模型同时作为教师和学生,利用不同上下文条件(学生仅文本特征,教师多模态特征)最小化预测分布,学习新概念和风格而不牺牲原有少步能力。
Comments Project Page: https://vvvvvjdy.github.io/d-opsd/
DIANOIA: 多智能体推理的诊断性分解与联合优化
机构 * Alibaba Group(阿里巴巴集团)
AI总结 提出DIANOIA框架,通过覆盖度、保真度和综合度三个可测量通道分解多智能体推理增益,并基于此设计诊断协议和对应系统,在多个基准上以更少token实现更优性能。
MATT-CTR:一种模型无关的测试时范式,用于通过置信度引导的推理路径进行CTR预测
机构 * Alibaba Group(阿里巴巴集团)
AI总结 提出一种模型无关的测试时范式MATT,利用特征组合的置信度分数生成多条推理路径并聚合预测,以缓解低置信度特征对CTR预测的影响。
Doc-CoB:通过视觉链式框推理增强文档理解
机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) ; Alibaba Group(阿里巴巴集团) ; Shanghai AI Laboratory(上海人工智能实验室)
AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。