Qwen-Image-2.0 Technical Report
Qwen-Image-2.0 技术报告
机构 * Qwen Team(通义实验室)
AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。
大厂专区
Qwen-Image-2.0 技术报告
机构 * Qwen Team(通义实验室)
AI总结 Qwen-Image-2.0 通过多模态扩散变换器和定制化训练流程,统一高保真生成与精确图像编辑,提升多语言文本精度、高分辨率逼真度及复杂指令遵循能力。
DeepSight: 通过潜在状态预测实现长视距世界建模的端到端自动驾驶
机构 * Tsinghua University(清华大学) ; Amap, Alibaba Group(阿里巴巴集团Amap) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出通过鸟瞰图空间预测连续未来帧的潜在语义特征,实现长视距世界建模,并引入高效适应性文本推理机制提升复杂场景下的驾驶性能。
Comments ICML 2026
通过语义表示对齐提升人类图像动画
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University, China(上海交通大学人工智能学院,中国) ; Alibaba Group, China(阿里巴巴集团,中国)
AI总结 本文提出SemanticREPA方法,通过结构和ID对齐提升人类动画质量,增强动作连续性和一致性。
Comments Accepted by CVPR 2026 workshop
TRACE:通过令牌路由自我对策略对齐来聚焦关键位置
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; AMAP, Alibaba Group(阿里集团AMAP) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Tsinghua University(清华大学)
AI总结 TRACE通过令牌路由自我对齐方法,在关键位置进行知识蒸馏,减少冗余梯度影响,提升长周期数学任务表现,优于GRPO并保持外部基准性能。
Comments work in progress
PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Tencent(腾讯) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; Tsinghua University(清华大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Arizona State University(亚利桑那州立大学) ; Rice University(里士满大学) ; Technical University of Munich(慕尼黑技术大学) ; Stanford University(斯坦福大学) ; Alibaba Group(阿里巴巴集团)
AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。
通过数据到洞察发现代理实现自主商业智能
机构 * Rajax Network Technology(Taobao Shangou of Alibaba)(阿里淘宝购物网络技术)
AI总结 本文提出AIDA框架,通过灵活的零售环境和定制DSL实现复杂业务环境的自主探索,实验表明其在洞察发现和分析深度上优于传统方法。
ReasonSTL:通过工具增强的过程奖励学习桥接自然语言与信号时间逻辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出ReasonSTL框架,通过工具增强和过程奖励学习,解决自然语言到信号时间逻辑(STL)的转换难题,提供透明、低成本且隐私保护的正式规范起草方案。
Tstars-Tryon 1.0:鲁棒且逼真的虚拟试衣系统用于多样化服装物品
机构 * Alibaba Group(阿里巴巴集团) ; Taobao App(淘宝App)
AI总结 本文提出Tstars-Tryon 1.0,一种高效且逼真的虚拟试衣系统,能够处理复杂场景,支持多件衣物试穿,并在大规模部署中实现高效率和高质量输出。
Comments 24 pages, model evaluation report
通过规划对齐代理:一个轨迹级奖励建模的基准测试
机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; AMAP, Alibaba Group(阿里集团AMAP)
AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。
Comments accepted to ACL 2026 main conference
迈向跨语言价值判断:一种共识多元主义视角
机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) ; Tongyi Lab, Alibaba Group(阿里集团通义实验室) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出X-Value基准,用于评估LLM跨语言判断内容深层价值的能力,通过两阶段人机协作标注框架解决文化多样性和学科复杂性挑战,涵盖14种语言7大全球议题类别。
大语言模型代理的代币经济学:从计算和经济学的双重视角研究
机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) ; School of Economics Zhejiang University(浙江大学经济学院) ; The State Key Laboratory of Blockchain and Data Security Zhejiang University(浙江大学区块链与数据安全国家重点实验室) ; Alibaba Cloud(阿里云)
AI总结 本文从计算与经济学双重视角,首次系统探讨代币经济学,提出四维分类框架,涵盖单代理、多代理系统、代理生态系统及安全领域,旨在解决输出质量与经济成本的平衡问题。
Ace-Skill:通过优先级和聚类进化提升多模态智能体
机构 * AMAP, Alibaba Group(阿里集团AMAP) ; CASIA ; BNU(北华大学)
AI总结 Ace-Skill通过优先级采样和聚类组织优化多模态智能体的自我进化过程,提升信息获取效率和知识检索可靠性,实现自我强化的良性循环,提升多模态工具使用任务的性能。
FraudBench: 一个多模态基准用于检测AI生成的欺诈性退款证据
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) ; Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性科技实验室) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出FraudBench,一个用于检测AI生成欺诈性退款证据的多模态基准。通过真实用户评价证据构建,结合图像编辑模型生成伪造证据,并评估不同模型在不同生成器下的性能。
UserGPT 技术报告
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文提出UserGPT框架,通过属性生成和摘要生成提升LLM的人格理解能力,结合行为模拟引擎和数据导向语义化模块,实现对长行为历史的高效推理。
无评论强化学习中的取消假设:从结果奖励到令牌信用
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The University of Edinburgh(爱丁堡大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Qwen Team, Alibaba Group(阿里集团Qwen团队) ; University of Amsterdam(阿姆斯特丹大学)
AI总结 本文从令牌层面研究无评论强化学习,揭示令牌翻转现象,并提出取消假设,解释令牌层面信用分配机制,通过实验验证该假设并提出改进训练的方法。
当隐藏状态漂移时:KV缓存能否拯救长程推测解码?
机构 * Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组)
AI总结 本文研究长程推测解码中隐藏状态漂移问题,提出KV重用假设,通过KVShot框架验证,发现KV重用能提升长程接受率,但端到端加速有限,指出需超越TTT向块级训练发展。
将评分接地:为可靠视觉语言处理奖励模型的显式视觉前提验证
机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴大模型应用团队) ; Alibaba Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所阿里巴巴分所) ; Beijing University of Posts and Telecommunications(北京邮电大学)
AI总结 本文提出EVPV方法,通过显式验证视觉前提提升视觉语言处理奖励模型的可靠性,实验表明其在多模态推理基准上提升了重排序准确率。
Comments 27 pages, 4 figures, 10 tables. Evaluated on VisualProcessBench and six multimodal reasoning benchmarks (LogicVista, MMMU, MathVerse-VO, MathVision, MathVista, WeMath). Includes ablations and causal analysis via controlled constraint corruption. Code: https://github.com/Qwen-Applications/EVPV-PRM
基于注意力的视觉文档检索增强
机构 * Alibaba Group(阿里巴巴集团) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 本文提出AGREE框架,通过多模态大语言模型的注意力机制引导检索器识别相关文档区域,提升细粒度相关性建模,实验表明在ViDoRe V2基准上显著优于传统方法。
Comments Published as a conference paper at SIGIR 2026
迈向定制化的多模态角色扮演
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。
Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/