arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-08-25 至 2026-08-25 共收录 20
2608.23565 2026-08-25 cs.AI 新提交

ReWorld: An Interactive World Model with Long-Horizon Memory

ReWorld:具有长程记忆的交互式世界模型

Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu, Yihua Du, Wei Wang, Tianyi Gui, Lianghua Huang, Yingcong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) ATH, Alibaba(阿里巴巴 ATH 实验室)

AI总结 ReWorld通过训练分离、推理约束解决交互式世界模型的控制与记忆矛盾,结合混合注意力等技术,在三轴评估中优于6种模型,实现长程视频生成与记忆。

Comments 21 pages, 9 figures. Project page: this https URL (https://zhifeichen097.github.io/ReWorld/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23311 2026-08-25 cs.CL 新提交

Beyond the Stability-Exploration Dilemma: Environmental Regularization for LLM Policy Optimization

超越稳定性-探索困境:面向大语言模型策略优化的环境正则化方法

Xianlei Zhou, Xiangdi Meng, Yu He, Tianyu Qi, Shuyan Guan, Xianli Zhang, Jian Zhang, Xin Li, Qika Lin, Jun Liu

机构 * Alibaba Group(阿里巴巴集团) Beijing Normal University(北京师范大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型策略优化的稳定性-探索困境,提出ERPO方法,通过查询KL散度正则化输入侧分布,接入现有策略优化流水线,在数学推理基准上实现了更强准确率与更稳定行为。

Comments Accepted to EMNLP 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23045 2026-08-25 cs.AI 新提交

From Inertia to Objectivity: Improving Deep Research Agents with Noise Isolation

从惯性到客观性:通过噪声隔离改进深度研究智能体

Xiangxin Zhang, Zhanwei Zhang, Zhihang Fu, Binbin Lin, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 针对深度研究智能体存在的惯性偏差问题,提出NIS-Agent方法,在网页分类和最终答案验证环节应用上下文隔离,降低33%的token成本,训练的8B模型性能可与GPT-4o相当。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23035 2026-08-25 cs.AI 新提交

MobilePA-Bench: Benchmarking Mobile Planner Agents on Complex Real-World Tasks

MobilePA-Bench:面向复杂真实世界任务的移动规划智能体基准测试

Yi Zhu, Xiongwei Wu, Qiyi Wang, Tingyu Qu, Jiajun Liu, Sihan Cao, Long Chen, Weigao Sun, Feida Zhu, Yiran Zhong, Steven Hoi

机构 * Alibaba(阿里巴巴)

AI总结 该研究提出 MobilePA-Bench 基准,针对现有移动智能体评估基准的盲区,从多维度测试移动规划智能体,发现前沿 LLM 在移动场景中存在可靠性问题,该基准可用于诊断与加速可靠移动智能体开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22788 2026-08-25 cs.AI cs.LG 新提交

TailSieve: Partial-Rollout-Guided Tail Routing for LLM Rollouts

TailSieve:面向大语言模型(LLM)rollout的部分rollout引导式长尾路由

Tianqi Xu, Lu Lv, Haoyang Huang, Wenjie Huang, Zhanming Shen, Yuhao Shen, Baolin Zhang, Xinyi Hu, Shuang Ge, Jun Dai, Tianyu Liu, Suorong Yang, Zhikai Li, Ye Bai, Jun Zhang, Lei Chen, Yue Li, Mingchen Wan

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问业务部) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 TailSieve是面向LLM rollout的部分rollout引导式框架,通过联合控制长尾路由与副本分配,仅路由即可实现最高1.67倍加速,结合专用推测解码可达2.59倍加速,同时保留策略内生成并避免长度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22704 2026-08-25 cs.CL cs.SD 新提交

WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs

WnW:用于长文本语音大语言模型的消长型键值缓存

Yiming Yao, Chenyang Lyu, Xuanfan Ni, Longyue Wang, Weihua Luo, Yazheng Yang, Jinsong Su

机构 * Alibaba Group(阿里巴巴集团) School of Informatics Xiamen University(厦门大学信息学院)

AI总结 针对长音频语音大语言模型的KV缓存内存开销问题,提出WnW消长型KV缓存方法,通过分类KV头实现高准确率与低GPU内存占用,且开销小、可迁移。

Comments Accepted at EMNLP 2026 Main Conference. 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22376 2026-08-25 cs.CL 新提交

Can Large Language Models "Hyper-Thread"?

大语言模型能否实现“超线程”?

Fei Ding

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究提出模型超线程假说,设计三种条件评估并行功能加载等,在 AIME 2025 开发集上获最高准确率,为超线程假说提供初步证据,推动推理扩展视角转变。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22367 2026-08-25 cs.CL 新提交

Context-Aware Cluster Decoding: Semantic Anchor-Driven Coherence in dMLLMs

上下文感知集群解码:dMLLMs中的语义锚驱动连贯性

Yikai Zhao, Qiyan Zhao, Jiaquan Zhang, Xiaofeng Zhang, Xiaosong Yuan, Pengzhou Cheng

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Alibaba Group(阿里巴巴集团) Shanghai University(上海大学)

AI总结 针对 dMLLMs 生成长文本时的语义漂移与重复问题,提出上下文感知集群解码方法,结合置信度与邻域邻近度评分,在多模型多基准上实现质量提升并减少幻觉。

Comments This paper is accepted by EMNLP 2026. 19 pages, 12 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21860 2026-08-25 cs.LG cs.AI 新提交

ChainPrune: Evaluating and Reducing Redundancy in Long Chain-of-Thought Reasoning

ChainPrune:评估与减少长思维链推理中的冗余

Weihang Pan, Zhengxu Yu, Yuxiang Zhang, Wenzhi Li, Zhongming Jin, Binbin Lin, Xiaofei He, Jieping Ye

机构 * Alibaba Group(阿里巴巴集团)

AI总结 ChainPrune 是一种推理路径语义结构优化方法,通过整合推理路径为树结构、选择主导路径及结合 DPO 与监督损失,减少长思维链冗余,在保精度的同时降低了步骤长度与计算开销。

Comments 15 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21690 2026-08-25 cs.AI 新提交

Context as an Environment: Programmatic Context Management for Long-Horizon Agents

上下文作为环境:面向长程智能体的程序化上下文管理

Yin Lin, Elaine Ang, Erkang Zhu, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团) Columbia University(哥伦比亚大学)

AI总结 本研究提出名为Scroll的上下文管理器,将智能体会话视为可执行环境,结合事件日志与Python内核实现程序化上下文管理,在多个长程智能体基准测试中大幅超越现有最优系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16554 2026-08-25 cs.CL 版本更新

Ask, Condition or Abstain: Reinforcement Learning for Missing-Premise Reasoning

询问、条件化或弃权:针对缺失前提推理的强化学习

Yongqi Tong, Zhenyu Zhang, Zimi Liu, Kewei Fu, Mingli Song, Haofei Zhang, Junshao Zhang, Hong Zhu, Jiang-Ming Yang, Xin Zhang, Jianshe Li

机构 * Ant International(蚂蚁国际) Zhejiang University(浙江大学) Dingtalk, Alibaba Group(阿里巴巴集团钉钉) Ant Group(蚂蚁集团)

AI总结 本研究提出ACA-RL框架,结合MPB基准,训练模型应对缺失前提的推理任务,可询问、条件化或弃权,提升欠定问题处理能力。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20553 2026-08-25 cs.AI cs.CL 版本更新

CMI-Mem: Toward Generalizable Long-Term Memory Management via CMI-Augmented Reinforcement Learning

CMI-Mem:通过CMI增强的强化学习实现可泛化的长期内存管理

Yubo Wang, Qiuyu Zhao, Zenghui Sun, Shichao Dong, Jinsong Lan, Xiaoyong Zhu, Haoyang Li, Bo Zheng, Lei Chen

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) PolyU(香港理工大学) HKUST(GZ)(香港科技大学(广州))

AI总结 研究针对现有内存管理器模型局限,提出基于强化学习的CMI-Mem模型,结合下游问答正确性与内在条件互信息CMI作为混合奖励,可评估新输入信息,补充而非取代问答基础,实现可泛化的长期内存管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-25 cs.LG 版本更新

Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12969 2026-08-25 cs.LG cs.AI 版本更新

Revisiting Reinforcement Learning with Verifiable Rewards from a Contrastive Perspective

从对比视角重新审视基于可验证奖励的强化学习

Feng Zhang, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Beijing Institute of Technology(北京理工大学) Qwen Business Unit of Alibaba(阿里巴巴Qwen业务部) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出ConSPO方法,通过对比序列级策略优化,解决GRPO在目标函数上的似然错配和信用分配不敏感问题,在推理任务上超越强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26917 2026-08-25 cs.CV 版本更新

AnimateAnyMesh++: A Flexible Feed-Forward Framework for High-Fidelity Text-Driven Mesh Animation

AnimateAnyMesh++: 一种灵活的4D基础模型用于高质量文本驱动的网格动画

Zijie Wu, Chaohui Yu, Fan Wang, Xiang Bai

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab, Hangzhou, China(湖畔实验室) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院)

AI总结 本文提出AnimateAnyMesh++,通过扩展数据集、改进架构和生成能力,实现高质量文本驱动的网格动画,提升了轨迹重建和几何保真度。

Comments 15 pages, TPAMI 2026 accepted, code url: this https URL (https://github.com/JarrentWu1031/AnimateAnyMesh-pp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29902 2026-08-25 cs.AI 版本更新

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

Comments Accepted at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-08-25 cs.CV cs.LG 版本更新

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04448 2026-08-25 cs.AI cs.CL cs.CV cs.LG cs.MA 版本更新

SkillNet: Create, Evaluate, and Connect AI Skills

SkillNet: 创建、评估和连接AI技能

Yuan Liang, Ruobin Zhong, Haoming Xu, Chen Jiang, Yi Zhong, Runnan Fang, Jia-Chen Gu, Shumin Deng, Yunzhi Yao, Mengru Wang, Shuofei Qiao, Yida Xue, Xin Xu, Tongtong Wu, Kun Wang, Yang Liu, Zhen Bi, Jungang Lou, Yuchen Eleanor Jiang, Hangcheng Zhu, Gang Yu, Haiwen Hong, Longtao Huang, Hui Xue, Chenxi Wang, Yijun Wang, Zifei Shan, Xi Chen, Zhaopeng Tu, Feiyu Xiong, Xin Xie, Peng Zhang, Zhengke Gui, Lei Liang, Jun Zhou, Chiyu Wu, Jin Shang, Yu Gong, Junyu Lin, Changliang Xu, Hongjie Deng, Wen Zhang, Keyan Ding, Qiang Zhang, Fei Huang, Ningyu Zhang, Jeff Z. Pan, Guilin Qi, Haofen Wang, Huajun Chen

机构 * Zhejiang University(浙江大学) Tongji University(同济大学) Southeast University(东南大学) Alibaba Group(阿里巴巴集团) Tencent(腾讯) Fudan University(复旦大学) The University of Edinburgh(爱丁堡大学) Monash University(墨尔本大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Huzhou University(湖州大学) Hornor Device Co., Ltd(Hornor设备有限公司) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究所,UCAS)

AI总结 SkillNet通过统一的本体和多维评估机制,大规模创建、评估和连接AI技能,提升代理性能并促进技能的持久掌握。

Comments this http URL (http://skillnet.openkg.cn/;) add SkillNet-Gym, a benchmark for evaluating skill retrieval, utilization, composition, and SkillNet-Fabric for task-specific skill routing through lightweight Wikis

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05206 2026-08-25 cs.LG cs.IR 版本更新

Bidding-Aware Retrieval for Multi-Stage Consistency in Online Advertising

面向在线广告多阶段一致性的竞价感知检索

Bin Liu, Yunfei Liu, Ziru Xu, Zhi Kou, Yeqiu Yang, Han Zhu, Jian Xu

机构 * Taobao \& Tmall Group of Alibaba Beijing China Taobao \& Tmall Group of Alibaba

AI总结 针对在线广告系统检索与排序阶段的竞价不一致问题,提出BAR框架,经阿里平台验证可提升收入4.32%、正向广告展示量22.2%

Comments Accepted by CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15294 2026-08-25 cs.SD cs.MM 版本更新

MeMo: Attentional Momentum for Real-Time Audio-Visual Target Speaker Extraction Under Impaired Visual Conditions

MeMo: 视觉受损条件下的实时视听目标说话人提取的注意力动量

Junjie Li, Wenxuan Wu, Shuai Wang, Zexu Pan, Kong Aik Lee, Helen Meng, Haizhou Li

机构 * Department of Electrical and Electronic Engineering, Faculty of Engineering, The Hong Kong Polytechnic University(电子工程系,工程学院,香港理工大学) Department of Systems Engineering and Engineering Management, The Chinese University of Hong Kong(系统工程与工程管理系,香港中文大学) School of Artificial Intelligence (SAI), The Chinese University of Hong Kong, Shenzhen(人工智能学院(SAI),香港中文大学深圳校区) School of Intelligence Science and Technology, Nanjing University(智能科学与技术学院,南京大学) Tongyi Lab, Alibaba Group, Singapore(通义实验室,阿里巴巴集团,新加坡)

AI总结 提出MeMo框架,通过两个自适应记忆库存储注意力信息,在视觉线索缺失时维持注意力动量,实现实时目标说话人提取,SI-SNR提升至少2dB。

详情

展开后加载摘要…

URL PDF HTML 收藏