How LoRA Remembers? A Parametric Memory Law for LLM Finetuning
LoRA如何记忆?大语言模型微调的参数记忆定律
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。
Comments Ongoing work
大厂专区
LoRA如何记忆?大语言模型微调的参数记忆定律
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。
Comments Ongoing work
来自稀疏观测的大深度补全模型
机构 * Zhejiang University(浙江大学) ; Tongyi Lab, Alibaba Group(阿里云实验室) ; Fudan University(复旦大学) ; Ningbo Innovation Center, Zhejiang University(宁波创新中心,浙江大学) ; NingboTech University(宁波科技学院) ; Jinhua Institute of Zhejiang University(金华大学浙大研究院)
AI总结 提出LDCM,利用单目基础模型和基于泊松的深度初始化策略,结合点图头回归3D坐标,实现稀疏观测下的度量准确深度补全。
Comments ICLR 2026. Project webpage: https://pkqbajng.github.io/ldcm/
面向文本到图像扩散Transformer的鲁棒且可泛化的安全引导
机构 * Huzhou Normal University(湖州师范学院) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang Normal University(浙江师范大学) ; Zhejiang University of Technology(浙江工业大学)
AI总结 提出SafeDIG框架,通过位置感知稀疏特征迁移实现扩散Transformer的安全引导,在保持源域安全性和图像质量的同时,有效降低目标域和整体不安全生成率。
EarlyTom: 早期令牌压缩实现快速视频理解
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Alibaba Cloud Computing(阿里云计算)
AI总结 针对视频大语言模型中视觉编码阶段效率低下的问题,提出EarlyTom无训练令牌压缩框架,通过在视觉编码器内部进行早期压缩,显著降低首令牌延迟并提升吞吐量。
Comments Accepted by CVPR 2026. 16 pages, 8 figures, 8 tables. Project page: https://viridisgreen.github.io/EarlyTom
使大语言模型通过反馈从流式经验中学习合成
机构 * Huzhou Normal University(湖州师范学院) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; Zhejiang Key Laboratory of Intelligent Education Technology and Application(浙江省智能教育技术与应用重点实验室)
AI总结 提出StreamSynth设置和SynLearner框架,使模型通过任务流积累经验并利用反馈提升合成数据生成性能。
ESPO:早期停止的近端策略优化
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团) ; Peking University(北京大学)
AI总结 提出ESPO算法,通过在强化学习训练大语言模型时在线检测轨迹失败并提前终止,节省计算资源并提升数学推理性能。
EvoRubric: 用于开放生成的自我进化评分标准驱动强化学习
机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)
AI总结 提出EvoRubric,一种单策略共进化强化学习框架,通过动态交替生成响应和评分标准,并引入多层验证机制,解决开放生成任务中缺乏明确奖励的问题,在医学、写作和科学领域超越传统静态和外部LLM驱动方法。
SSDAU:面向联合实体关系抽取的结构化语义数据增强
机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(南京大学新型软件技术国家重点实验室) ; Amap, Alibaba Group, China(阿里巴巴集团阿地图) ; University of Alberta, Edmonton, Canada(阿尔伯塔大学) ; The University of Tokyo, Tokyo, Japan(东京大学)
AI总结 提出结构化语义数据增强方法SSDAU,通过保留三元组感知语义结构、上下文感知编码和BERTopic过滤,提升联合实体关系抽取的泛化能力,在多个模型和数据集上优于现有方法。
Comments 10 pages, 4 figure
AgentDropoutV2: 通过测试时修正或拒绝剪枝优化多智能体系统中的信息流
机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Alibaba Group(阿里巴巴集团)
AI总结 提出AgentDropoutV2框架,在测试时通过检索增强修正器纠正错误并剪枝不可修复输出,动态优化多智能体系统信息流,显著提升数学和代码基准性能。
面向持续监督微调的在策略重放
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团)
AI总结 提出在策略重放(OPR)方法,通过重放模型自身生成的高质量响应来缓解持续监督微调中的灾难性遗忘,在多个大语言模型上显著降低遗忘。
大型视觉语言模型在CFMME上的基准测试:一个全面的中文金融多模态评估数据集
机构 * Qwen DianJin Team, Alibaba Cloud Computing(文言金团队,阿里云计算)
AI总结 提出CFMME,一个包含6052个实例的中文金融多模态评估基准,涵盖八种主要金融图像模态和四项核心多模态任务,用于评估LVLMs在金融业务全流程中的感知、理解、推理和认知能力。
恢复策略诱导错误:鲁棒GUI智能体的基准测试与轨迹合成
机构 * alibaba(阿里巴巴)
AI总结 提出GUI-RobustEval基准和鲁棒驱动轨迹合成框架RoTS,通过树状管道主动发现错误模式并合成恢复步骤,训练模型在GUI任务上取得最先进性能。
Comments ICML 2026 Spotlight. 36 pages, 19 figures, includes appendix
CrystalXRD-Bench:面向多种晶体材料的XRD峰索引的视觉-语言模型基准测试
机构 * Alibaba Group(阿里巴巴集团)
AI总结 提出CrystalXRD-Bench基准,通过250个样本评估视觉-语言模型从粉末XRD图谱中识别米勒指数(HKL)的能力,发现最佳模型Jaccard得分仅0.5888,任务远未解决。
Comments 18 pages, 10 figures
迈向具有智能体纠正和语义评估的类人交互式语音识别
机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; X-LANCE Lab, School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院X-LANCE实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Fudan University(复旦大学) ; Tongyi Fun Team, Alibaba Group(阿里云通义团队)
AI总结 提出Agentic ASR闭环框架,通过多轮交互和语义纠正减少语义错误,并引入句子级语义错误率(S^2ER)作为评估指标。
FinGuard:检测LLM交互中的金融监管违规
机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云计算Qwen金融团队) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)
AI总结 针对金融领域LLM交互中的监管违规检测问题,提出基于监管文档的自动化管道,构建首个金融合规检测基准FinGuard-Bench,并训练FinGuard模型,在基准上显著优于现有方法。
GDSD:强化学习作为扩散语言模型的引导去噪器自蒸馏
机构 * UCL Dept. of Statistical Science(伦敦大学学院统计科学系) ; UCL Centre for AI(伦敦大学学院人工智能中心) ; Alibaba Group(阿里巴巴集团) ; Dept. of EEE(电子工程系) ; Imperial College London(伦敦帝国理工学院) ; UNIST(全南大学) ; University of Basel(巴塞尔大学)
AI总结 提出引导去噪器自蒸馏(GDSD)方法,通过从逆KL正则化强化学习的闭式最优解中导出的优势引导自教师直接蒸馏扩散语言模型的去噪器,避免了ELBO似然代理带来的训练-推理不匹配偏差,在规划、数学和代码基准上显著优于现有方法。
Comments Preprint
DMC-CF: 用于因果推理的动态多模态反事实QA基准
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) ; Alibaba Group(阿里巴巴集团)
AI总结 针对现有因果推理数据集规模有限或基于非真实数据的问题,提出基于真实视频的大规模多模态因果反事实推理基准DMC-CF-Static,并利用动态图干预框架构建动态评估基准DMC-CF-Dynamic,实验表明当前多模态大模型在真实场景下的因果推理能力仍需大幅提升。
STAMP:在可控且可扩展的虚拟环境中训练移动GUI代理的显式记忆
机构 * Tongyi AI Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Beijing Jiaotong University(北京交通大学)
AI总结 提出STAMP框架,通过可控虚拟环境注入确定性记忆变量,生成可验证监督数据并支持在线强化学习,解决移动GUI代理在长时任务中因上下文窗口限制和缺乏显式记忆导致的失败问题。
Comments 24 pages, 4figures, 21 tables
高德地图中基于隐式推理的生成式时空意图序列推荐
机构 * AMAP, Alibaba Group(阿里集团地图(AMAP))
AI总结 提出GPlan框架,通过渐进式隐式思维链蒸馏和时空反事实DPO,将LLM推理能力压缩至轻量模型,实现低延迟且符合时空约束的意图序列生成。
Comments 9 pages, 1 figure
GenesisFunc: 面向准确且泛化的函数调用的多智能体数据生成
机构 * Tongyi Fun Team, Alibaba Group(通义功能团队,阿里巴巴集团)
AI总结 提出GenesisFunc多智能体自动生成函数调用训练数据,通过多阶段评估保证质量,微调8B模型在域内和域外均优于同类开源模型,性能接近部分API模型。
Comments Accepted by ACL 2026 Main
Eureka:面向企业AI云资源需求预测的智能特征工程
机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) ; School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) ; School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) ; Independent Researcher, United States(独立研究员,美国)
AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。
Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)
Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer
MPDocBench-Parse:面向实际的多页文档解析基准测试
机构 * University of Science and Technology of China(中国科学技术大学) ; Tongyi Lab, Alibaba Group(阿里云实验室)
AI总结 针对现有基准测试在真实场景中评估不足的问题,提出MPDocBench-Parse基准,包含433份多页文档(3246页),覆盖15种文档类型,设计全面的内容保真度和逻辑结构评估协议,实验表明现有模型在语义连续性、视觉内容解析和层次结构恢复方面存在明显局限。
推进多站点排放控制:一种基于物理信息的迁移学习框架结合专家混合模型实现碳-污染物协同控制
机构 * College of Mechanical Engineering(机械工程学院) ; Alibaba Group(阿里巴巴集团) ; School of Computer Science and Technology(计算机科学与技术学院) ; Science and Education Integration College of Energy and Carbon Neutralization(能源与碳中和科学教育融合学院) ; State Key Laboratory of Clean Energy Utilization(清洁能源利用国家重点实验室)
AI总结 针对多站点城市固体废物焚烧厂排放控制中数据驱动模型迁移困难的问题,提出一种结合物理约束和运行工况异构性的碳-污染物专家混合模型(CPMoE),通过物理信息迁移学习实现跨站点知识迁移,在13个源站点和12个目标站点上均取得高预测精度,并实现3.6-6.3%的风险指数降低和94-100%的污染物协同减排。
Comments Supplementary materials will be released after the final version is finalized
SkillTrojan:基于技能智能体系统的后门攻击
机构 * Alibaba Group(阿里巴巴集团) ; National University of Defense Technology(国防科技大学) ; Fudan University(复旦大学) ; Wuhan University(武汉大学)
AI总结 提出SkillTrojan,一种针对技能实现而非模型参数的后门攻击方法,通过将恶意逻辑嵌入看似正常的技能中,利用技能组合重构并执行攻击者指定的负载,在保持良性行为的同时实现高攻击成功率。