arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-05-28 至 2026-05-28 共收录 14
2605.28773 2026-05-28 cs.CL cs.AI cs.LG cs.MA cs.MM

Rethinking Memory as Continuously Evolving Connectivity

重新思考记忆作为持续演化的连接性

Jizhan Fang, Buqiang Xu, Zhixian Wang, Haoliang Cao, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang, Gang Yu, Ying Wei, Guozhou Zheng, Feiyu Xiong, Haofen Wang, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) MemTensor Tongji University(同济大学)

AI总结 提出 FluxMem 框架,将记忆建模为异构图并通过三个阶段(初始连接形成、反馈驱动优化、长期巩固)动态演化拓扑结构,以解决现有记忆增强型 LLM 代理在动态环境中的脆弱性问题。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28237 2026-05-28 cs.RO cs.CV

POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation

POINav: 在真实世界视觉语言导航中基准测试与增强最终米级到达

Ruiyan Gong, Meisheng Zhang, Yuxiang Zhao, Mingchao Sun, Yanfen Shen, Zedong Chu, Zhining Gu, Wei Guo, Xiaolong Cheng, Qiming Li, Kangning Niu, Yanqing Zhu, Xiaolong Wu, Tianlun Li, Mu Xu

机构 * Amap CV Lab, Alibaba Group(阿里集团阿里的Amap视觉实验室)

AI总结 针对真实世界POI导航的“最后几米”挑战,提出首个闭环评估基准POINav-Bench,并设计脑-动作框架结合70K真实标志-入口数据对,实现高保真度导航。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28109 2026-05-28 cs.LG

Long Live The Balance: Information Bottleneck Driven Tree-based Policy Optimization

平衡万岁:信息瓶颈驱动的基于树的策略优化

Hao Jiang, Shurui Li, Tianpeng Bu, Bowen Xu, Xin Liu, Qihua Chen, Hongtao Duan, Lulu Hu, Bin Yang, Minying Zhang

机构 * Alibaba Cloud Computing, Alibaba Group(阿里云计算,阿里巴巴集团)

AI总结 针对在线强化学习中探索-利用不平衡问题,提出基于信息瓶颈理论的IB-Score指标和IB-TPO框架,通过树采样策略提升优化稳定性和性能。

Comments Accepted to ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28020 2026-05-28 cs.CL

The Missing Piece in Pre-trained Model Evaluation: Reward-Guided Decoding Unlocks Task-Oriented Behavior Without Parameter Updates

预训练模型评估中缺失的一环:奖励引导解码无需参数更新即可解锁任务导向行为

Shaobo Wang, Guo Chen, Ziyue Wang, Zhengyang Tang, Qingyang Liu, Xingzhang Ren, Dayiheng Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Qwen Team, Alibaba Group(阿里云Qwen团队) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出一种无需训练的奖励引导解码框架EBD,通过外部轻量奖励模型调整输出分布,激活冻结预训练模型的任务导向行为,实现更公平的推理时评估。

Comments 26 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27976 2026-05-28 cs.SD

VoiceGiraffe: A Benchmark for Extreme Long-Context Audio-Language Understanding

VoiceGiraffe: 极端长上下文音频-语言理解的基准

Jashin Ye, Dongxiao Wang, Yixuan Ye, Sashuai Zhou, Weihuang Lin, Mingyang Han, Kunpeng Wang, Zeyu Yuan, Boyu Li, Haoxiang Shi, Jingchen Shu, Jun Song, Bo Zheng

机构 * Future Living Lab(未来生活实验室) Alibaba(阿里巴巴)

AI总结 提出VoiceGiraffe基准,通过1500个三元组和双层分类法评估大音频语言模型在长上下文场景下的单跳感知与多跳推理能力,揭示模型在长距离记忆持久性上的瓶颈。

Comments Benchmark Project: https://github.com/LivingFutureLab/VoiceGiraffe

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27924 2026-05-28 cs.CV

SIGMA: Semantic-Difference Instruction-Grounding Mask Annotator for Text-Driven Image Manipulation Localization

SIGMA: 基于语义差异的指令引导掩码标注器用于文本驱动图像操作定位

Peiyu Zhuang, Jianquan Yang, Haodong Li, Zhuoying Cai, Ruitao Xie, Jishen Zeng, Baoying Chen, Jiwu Huang, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Guangdong Provincial Key Laboratory of Intelligent Information Processing and Shenzhen Key Laboratory of Media Security(广东省智能信息处理重点实验室和深圳媒体安全重点实验室) Shenzhen University of Advanced Technology and Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(深圳先进技术大学和深圳先进技术研究所,中国科学院) Alibaba Group(阿里巴巴集团) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

AI总结 提出SIGMA方法,通过视觉基础模型中的语义特征差异和指令引导的空间先验,自动从公开编辑数据集中生成像素级掩码,用于训练图像操作定位模型,在五个基准上F1提升12.20%,并生成约110万训练集使六个检测器平均F1提升18.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27908 2026-05-28 cs.CL cs.AI

ESC-Skills: Discovering and Self-Evolving Skills for Emotional Support Conversations

ESC-Skills: 发现并自我进化情感支持对话技能

Jie Zhu, Huaixia Dou, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang, Fang Kong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队)

AI总结 提出ESC-Skills框架,通过干预单元建模支持交互并构建技能库,结合多轮廓自我进化机制,提升情感支持对话的可解释性、可控性和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27258 2026-05-28 cs.SD cs.AI

PilotTTS: A Disciplined Modular Recipe for Competitive Speech Synthesis

PilotTTS:一种有纪律的模块化配方用于竞争性语音合成

Bowen Li, Shaotong Guo, Zhen Wang, Yang Xiang, Mingli Jin, Yihang Lin, Jiahui Zhao, Weibo Xiong, Dongrui Zhang, Keming Chen, Yunze Gao, Zeyang Lin, Yuze Zhou, Yue Liu

机构 * Amap, Alibaba Group(阿里巴巴集团爱马仕部门) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出PilotTTS轻量级自回归TTS系统,通过极简架构和严格数据工程(仅用20万小时开源处理数据)实现竞争性能,支持零样本语音克隆、情感/副语言/方言合成,在Seed-TTS Eval基准上取得最低WER和最高说话人相似度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25378 2026-05-28 cs.CV cs.AI

CollectionLoRA: Collecting 50 Effects in 1 LoRA via Multi-Teacher On-Policy Distillation

CollectionLoRA: 通过多教师在线策略蒸馏将50种效果收集到1个LoRA中

Fangtai Wu, Hailong Guo, Shijie Huang, Jiayi Song, Yubo Huang, Mushui Liu, Zhao Wang, Yunlong Yu, Jiaming Liu, Ruihua Huang

机构 * Zhejiang University(浙江大学) Qwen Applications Business Group of Alibaba(阿里巴巴Qwen应用业务组) Xi'an Jiaotong University(西安交通大学)

AI总结 提出CollectionLoRA框架,通过多教师在线策略蒸馏将多达50种不同效果LoRA和少步生成能力整合到单个LoRA中,解决参数干扰并降低部署成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02097 2026-05-28 cs.CL

ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs

ClinConsensus:一个用于评估中文医疗大模型临床评分标准覆盖率的医师校准基准

Xiang Zheng, Han Li, Wenjie Luo, Weiqi Zhai, Yiyuan Li, Chuanmiao Yan, Xue Yang, Kailuan Wu, Ruyi Xu, Tianyun Lu, Tianyi Tang, Yubo Ma, Kexin Yang, Dayiheng Liu, Sen Yang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

AI总结 为解决开放域医疗大模型评估缺乏医师校准的临床响应标准覆盖率问题,提出包含2500个专家病例的ClinConsensus基准,并引入医师锚定覆盖率评分(CACS)及双裁判框架,发现前沿模型存在19.2-21.9分的覆盖率差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14864 2026-05-28 cs.CL

Shopping Companion: Benchmarking and Training LLM Agents for Long-Horizon Preference-Grounded E-Commerce Tasks

购物助手:面向长期偏好引导的电子商务任务的LLM智能体基准测试与训练

Zijian Yu, Kejun Xiao, Huaipeng Zhao, Tao Luo, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

AI总结 针对电子商务中缺乏长期偏好感知购物任务基准和细粒度训练监督的问题,提出了Shopping Companion Bench基准和免标注工具级奖励方法,有效提升了LLM智能体的偏好捕获与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01766 2026-05-28 cs.RO

Neural Implicit Action Fields: From Discrete Waypoints to Continuous Functions for Vision-Language-Action Models

神经隐式动作场:从离散路点到连续函数的视觉-语言-动作模型

Haoyun Liu, Jianzhuang Zhao, Xinyuan Chang, Tianle Shi, Chuanzhang Meng, Jiayuan Tan, Feng Xiong, Tong Lin, Dongjie Huo, Mu Xu, SongLin Dong, Zhiheng Ma, Yihong Gong, Sheng Zhong

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳大学计算微电子学院) Guangdong Provincial Key Laboratory of Computility Microelectronics(广东省计算微电子重点实验室) Amap, Alibaba Group(阿里集团Amap) Shenzhen University(深圳大学) Xi'an Jiaotong University(西安交通大学) Beijing University of Chemical Technology(北京化工大学)

AI总结 针对视觉-语言-动作模型预测离散动作路点与物理运动连续性不匹配的问题,提出神经隐式动作场(NIAF),通过将动作表示从离散路点重构为连续函数,实现任意时间分辨率的连续动作流形合成,支持解析求导和显式速度监督,提升控制平滑性和物理合理性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏