arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

共收录 2423
2609.04148 2026-09-04 cs.AI cs.CL 新提交

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments

Terminal-Universe:将智能体轨迹转化为可扩展的终端环境

Jie Wu, Zhenru Zhang, Beichen Zhang, Xuwu Wang, Yuhui Su, Mouxiang Chen, Peng Wang, Zhihai Wang, Que Shen, Hao Zhou, An Yang, Fei Huang, Yujiu Yang, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Tsinghua University(清华大学)

AI总结 Terminal-Universe 是将智能体轨迹转化为可重用终端环境的框架,可扩展任务的广度与深度,经其生成的语料库微调 Qwen3.5-27B,显著提升了代码智能体的单轮与多轮任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.04083 2026-09-04 cs.CV cs.AI cs.CL cs.IR 新提交

CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation

CORE:通过重排器蒸馏提升多模态大语言模型(MLLM)嵌入中的组合推理能力

Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Chu Liu, Pengjun Xie, Yilun Zhao, Shu Wu

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Yale University(耶鲁大学) CASIA(中国科学院自动化研究所)

AI总结 该研究提出CORE方法,通过将MLLM重排器的组合判断蒸馏到嵌入模型,在COLA等三个组合推理基准及MCMR基准上实现了最优性能,提升了嵌入模型的组合检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03673 2026-09-04 cs.CV 新提交

Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation

视频生成器是否会跨片段追踪世界?视频延续中世界状态推理的基准与方法

Yingmao Miao, Pengfei Zhang, Chaoran Xu, Meng Yu, Jing Tang, Xiangxiang Chu, Chao Shen, Chenhao Lin

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对视频生成器无法可靠追踪视频世界状态的问题,构建了基准Statebench并提出方法Stateagent,将可控视频延续的全案例状态分数从45.2提升至69.3,还有益于一分钟规模的故事生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03526 2026-09-04 cs.AI 新提交

CulturalMenuBench: Probing the Knowledge-Application Gap in Multimodal Culinary Reasoning

CulturalMenuBench:探究多模态烹饪推理中的知识应用差距

Bo Zeng, Linfeng Gao, Peiqin Lin, Yu Zhao, Mingyan Zeng, Yu Tong, Xintong Wang, Linlong Xu, Longyue Wang, Weihua Luo, Qinggang Zhang, Jinsong Su

机构 * Alibaba Group(阿里巴巴集团) Xiamen University(厦门大学) University of Hamburg(汉堡大学)

AI总结 该研究推出多模态烹饪推理基准CulturalMenuBench,发现模型在食物识别任务中存在知识应用差距,无法通过视觉输入激活文化知识,推动了关联感知、过程与文化背景的训练。

Comments Accepted to EMNLP 2026 Findings. Code and data: https://github.com/BobTsang-NLP/CulturalMenuBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.03515 2026-09-04 cs.AI 新提交

What Matters for Aggressive Decoding-Time KV Eviction? Temporal Aggregation and Ranking Preservation

激进解码时KV驱逐的关键因素:时间聚合与排名保留

Bo Zeng, Yu Zhao, Yefeng Liu, Zhihong Lu, Xuanfan Ni, Xintong Wang

机构 * Ant Group(蚂蚁集团) Alibaba Group(阿里巴巴集团) Universität Hamburg(汉堡大学)

AI总结 该研究聚焦激进解码时KV驱逐的关键因素,提出基于EMA的InertiaKV及其变体,揭示时间聚合与排名保留的重要性,相关方法可提升解码吞吐量且不显著降低质量。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25348 2026-09-04 cs.LG cs.SI 版本更新

From Leakage to Fidelity: Reliable Benchmarking for Temporal Cascade Prediction

超越泄露和复杂性:迈向现实和高效的流行信息级联预测

Jie Peng, Rui Wang, Qiang Wang, Zhewei Wei, Bin Tong, Guan Wang, Bo Zheng

机构 * Renmin University of China(中国人民大学) Alibaba(阿里巴巴)

AI总结 本文针对信息级联流行度预测中的三个关键问题:时间泄露、数据集特征贫乏和计算效率低下,提出了一种时间有序分割策略、大规模电商级联数据集Taoke以及轻量级框架CasTemp,实现了在四个数据集上的最先进的性能和数量级的速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02348 2026-09-03 cs.CV 新提交

Structured-Prior-Guided Diffusion Inpainting with Physical Consistency for Traffic Sign Augmentation

面向交通标志增强的、具备物理一致性的结构化先验引导扩散修复

Luo Li, Chongchong Huang, Jun Jia, Qiang Gao, Xinlong Liu, Gui Yang, Liang Cao

机构 * AMAP, Alibaba Group(高德地图(阿里巴巴集团旗下))

AI总结 针对交通标志检测的长尾数据问题,提出结构化先验引导的物理一致性扩散修复框架,在多指标上优于7种对比方法,合成数据显著提升稀有标志检测性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02074 2026-09-03 cs.AI 新提交

CHIME: Credit-Aware Hierarchical Memory Evolution for Long-Horizon Agentic Planning

CHIME:面向长视界智能体规划的信用感知分层记忆演化

Yongshi Ye, Tian Lan, Feihu Jiang, Muyang Ye, Bin Zhu, Qianghuai Jia, Longyue Wang, Zhao Xu, Weihua Luo, Xiaodong Shi

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism(文化和旅游部闽台非物质文化遗产数字化保护与智能处理重点实验室(厦门大学)) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 针对现有自演化记忆方法的信用分配问题,提出CHIME框架,通过维护规划与执行双记忆库并遵循先归因后记忆原则,在四个长视界智能体基准上优于多种基线,且记忆高效可迁移。

Comments 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.02012 2026-09-03 cs.CV cs.IR 新提交

GeoStore: Finding Small Storefronts in Large Scenes -- A Fine-Grained POI Localization Benchmark with Global-to-Local Asymmetric Matching

GeoStore:在大场景中寻找小型店面——一个采用全局到局部非对称匹配的细粒度POI定位基准

Lu Han, Xiting Sun, Hao Wang, Zhiqiang Cao, Ruihuan Du, Ziquan Zeng, Chunlong Lv

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

AI总结 本文针对POI定位的非对称细粒度开放集问题推出首个基准GeoStore,提出GLAM方法,在多项指标上优于基线,且重排序效率更高,基准与代码将公开。

Comments 6 pages, 3 figures. Submitted to ICASSP 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30209 2026-09-03 cs.CV 版本更新

DICS: Exploring Data Intrinsic Consistency for Visual Instruction Selection

DICS:探索数据内在一致性用于视觉指令选择

Yuyang Hong, Jinhui Guo, Jiaqi Gu, Lubin Fan, Ruixiang Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Alibaba Token Hub, Alibaba Group(阿里巴巴集团)

AI总结 提出基于数据内在一致性(DIC)的自适应视觉指令选择方法DICS,仅用25%数据就超越现有最优方法,还构建600万样本语料库,用不足25%训练数据达到InternVL3-8B-Instruct的94.52%性能

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-09-03 cs.CV 版本更新

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17499 2026-09-03 cs.AI 版本更新

Pailitao-MMSearch: Building Native E-Commerce Multimodal Search Foundation

派利淘-多模态搜索:构建原生电子商务多模态搜索基础

Xiaohan Ye, Xu Chen, Zihan Gong, Jian Ding, Lianyu Du, Baicheng Chen, Yunmeng Shu, Jingqian Zhao, Zhixiang Zhao, Shuaiqi Jia, Chong Ma, Shuwen Xiao, Xiangheng Kong, Yuan Gao, Jun Song, Jinsong Lan, Xiaoyong Zhu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝及天猫集团)

AI总结 针对电子商务多模态搜索问题,提出派利淘-多模态搜索基础模型,通过混合语义ID、两阶段持续预训练策略和混合推理后训练管道,在淘宝派利淘平台实现显著改进,提升了商品交易总额和交易量。

Comments Technical Report: Pailitao-MMSearch

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27284 2026-09-03 cs.RO cs.AI 版本更新

FineVLA: Fine-Grained Instruction Alignment for Steerable Vision-Language-Action Policies

FineVLA:面向可操控视觉-语言-动作策略的细粒度指令对齐

Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu

机构 * XLANG Lab, The University of Hong Kong(XLANG实验室,香港大学) Qwen Team, Alibaba Inc.(通义团队,阿里巴巴公司)

AI总结 提出FineVLA框架,通过构建细粒度数据集和训练策略,在保持任务成功率的同时实现机器人动作的细粒度可控性。

Comments 26 pages, 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05605 2026-09-03 cs.LG cs.AI cs.CV 版本更新

Shiva-DiT: Residual-Based Differentiable Top-$k$ Selection for Efficient Diffusion Transformers

Shiva-DiT:基于残差的可微Top-k选择用于高效扩散变换器

Jiaji Zhang, Hailiang Zhao, Jiaju Wu, Ruichao Sun, Xinkui Zhao, Shuiguang Deng

机构 * AIOS, Alibaba Group(阿里云人工智能实验室,阿里巴巴集团) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Nanyang Technological University(南洋理工大学)

AI总结 Shiva-DiT通过基于残差的可微Top-k选择,在保持端到端可学习性的同时,实现了高效扩散变换器的剪枝,提升了计算效率并减少了硬件开销。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14845 2026-09-03 cs.LG cs.CL 版本更新

Prompting the Unknown: Understanding Response Uncertainty in Large Language Models

提示未知:理解大语言模型中的响应不确定性

Ze Yu Zhang, Arun Verma, Finale Doshi-Velez, Bryan Kian Hsiang Low

机构 * Alibaba Group(阿里巴巴集团) Harvard University(哈佛大学) National University of Singapore(新加坡国立大学)

AI总结 该研究针对大语言模型响应不确定性与提示的关系问题,提出含四类不确定性来源的提示-响应概念模型,经实验验证模型及相关理论结果。

Comments Accepted at ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01425 2026-09-02 cs.LG 新提交

CATeye: Coupled Attribute-Topology Invariance Learning for Voucher Abuse Detection

CATeye:用于优惠券滥用检测的耦合属性-拓扑不变性学习

Tian Tian, Shuaicheng Niu, Hao Kuang, Yuanhang Hu, Dong Li, Zhiqi Shen

机构 * Nanyang Technological University(南洋理工大学) Lazada Inc.(来扎达公司) Alibaba Group(阿里巴巴集团)

AI总结 本文针对电商优惠券滥用检测中欺诈模式演变引发的分布偏移问题,提出CATeye框架,通过AIS与EIS选择不变属性和边,构建多视图优化,在Lazada数据集及公开基准上较9种基线最高提升平均F1分数8.61%。

Comments 8 pages, 3 figures, Accepted by CIKM 2026 Applied Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01147 2026-09-02 cs.CV cs.CL 新提交

On the Design Fundamentals of Pixel Text Representation Learning

像素文本表示学习的设计基础

Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

机构 * The Chinese University of Hong Kong(香港中文大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Fudan University(复旦大学) Aberystwyth University(阿伯里斯特威斯大学) University of Macau(澳门大学) Shanghai University of Finance and Economics(上海财经大学)

AI总结 本研究针对现有像素-文本编码器的缺陷,确定视觉文本表示学习的四个关键设计原则,据此训练的Pixel Linguist II在多项视觉文本任务上达SOTA,且在高视觉令牌压缩下仍具鲁棒性,推动光学上下文压缩发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01058 2026-09-02 cs.AI 新提交

ARISE-RL: Agentic Rubric-Grounded Iterative Self-Evolution with Reinforcement Learning

ARISE-RL:基于智能体评分准则的强化学习迭代自进化框架

Fanrui Zhang, Ruixue Ding, Qiang Zhang, Xi Chen, Boli Chen, Shihang Wang, Qiuchen Wang, Hongmin Zhan, Jinxin Bian, Li xingchao, Peijin Zheng, Hao cheng, Pengjun Xie, Kaipeng Zhang, Jiawei Liu, Zheng-Jun Zha

机构 * Alibaba ATH Token Foundry(阿里巴巴ATH代币铸造厂) Hema, Alibaba Group(阿里巴巴集团盒马)

AI总结 针对强化学习训练开放式智能体的奖励与评分准则难题,提出ARISE-RL框架,结合Generator与Solver的协同进化及RG-SED机制,在ECR-Bench上实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.01024 2026-09-02 cs.CL 新提交

PCoMoE: Shifting MoE Inference from Monolithic Expert Selection to Fine-Grained Path Composition

PCoMoE:将混合专家(MoE)推理从整体专家选择转向细粒度路径组合

Ziyan Gan, Fangxin Liu, Chenyang Guan, Junjie Wang, Ning Yang, Haomin Li, Xiang Li, Siran Yang, Jiamang Wang, Lin Qu, Zongwu Wang, Li Jiang, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 本研究针对MoE推理受整体专家抽象限制的问题,提出PCoMoE路径组合式执行框架,通过路径级优化等技术实现1.31倍推理加速与10%准确率提升。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00950 2026-09-02 cs.RO 新提交

HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments

HitMem:面向动态环境的、具有多模态上下文感知检索功能的分层时序三维记忆

Ruijie Tang, Chenye Zou, Guoquan Wu, Jun Wei, Wei Chen, Jiaxin Zhu

机构 * Institute of Software, Chinese Academy of Sciences (ISCAS)(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团)

AI总结 HitMem是面向动态环境的分层时序三维记忆框架,通过多模态上下文感知检索机制解决现有三维记忆框架的静态假设缺陷,在Dyna-THOR基准上提升了物体重定位准确率与任务性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00865 2026-09-02 cs.LG cs.CL 新提交

MemoryWalker: Stop Training Agents on Contexts They Never Saw

MemoryWalker:停止在智能体从未见过的上下文上进行训练

Zinco J, Xunjie Zhu, Shen Huang, Zhenyi Wang, Pengjun Xie, Jieping Ye

机构 * Token Foundry, Alibaba Group(Token Foundry,阿里巴巴集团)

AI总结 针对智能体压缩上下文训练引发的树状学习对象问题,提出LogitTree、4D注意力掩码及SDCC方法,在七个网络搜索基准上验证SDCC可缩小训练-rollout差距并提升奖励。

Comments Your Memory-Compressing Harness Makes Training and Inference Inconsistent

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00823 2026-09-02 cs.AI cs.CL 新提交

Polished but Unresolved: Identifying Late-Stage Pressure States in Long-Horizon Tool-Use Agents

精致却未解决:识别长 horizon 工具使用智能体的晚期压力状态

Haoyang Chen, Yi Liu, Jianzhi Shao, Xiaozhou Xu, Zhe Sun, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Alibaba Group(阿里巴巴集团)

AI总结 本研究识别长 horizon 工具使用智能体的晚期压力状态,提出 PSPR 插件缓解该压力,实验显示其可增强现有智能体方法。

Comments Accepted in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.00048 2026-09-02 cs.CL cs.AI 新提交

GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments

GUI-CC:将GUI世界模型作为智能体环境对其上下文一致性进行基准测试

Lin Fu, Zheyuan Yang, Tianhui Zhang, Jinbiao Wei, Guo Gan, Boxu Liu, Yilun Zhao, Yu Rong

机构 * Yale University(耶鲁大学) Zhejiang University(浙江大学) China University of Geosciences(中国地质大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Tongji University(同济大学) University of California, San Diego(加利福尼亚大学圣迭戈分校)

AI总结 研究针对GUI世界模型作为智能体环境评估的不匹配问题,提出GUI-CC基准,含两个赛道及对应任务,评估四项指标,发现当前模型单步生成合理但多步上下文一致性不足。

Comments EMNLP 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13028 2026-09-02 cs.CV cs.RO 版本更新

RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction

用于改进人机物体交接预测的RGB-D视频生成

Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) College of Computing and Data Science(计算与数据科学学院) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团)

AI总结 针对人机物体交接数据集稀缺及现实-模拟差距问题,提出Hand2Bot数据集与PassGen生成流水线,实现高意图识别准确率与低误触发率,支持机器人稳健零样本迁移与早期意图预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30785 2026-09-01 cs.AI 新提交

SkillZip Pro: Execution-Aware Dynamic Compression of Progressively Loaded Skills for Self-Evolving Agents

SkillZip Pro:面向自进化智能体的渐进式加载技能的执行感知动态压缩

Xiaofan Bai, Chao Liu, Hongqiang Lin, Di Wu, Mingli Song, Xuan Jin, Xipeng Cao, Yuhong Li

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 SkillZip Pro 是面向自进化智能体的渐进式加载技能的执行感知压缩器,可高效降低技能 bundle 的 token 成本且不损失性能,还能保留路由和公共入口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30753 2026-09-01 cs.IR cs.AI 新提交

Learning from What You Retrieve: Online RL Fine-Tuning for Semantic Retrieval

从检索内容中学习:面向语义检索的在线强化学习微调

Shaowei Wei, Chong Huang, Songtao Fang, Jin Zhang, Zhuojun Wang, Chengfu Huo

机构 * Alibaba Group(阿里巴巴集团)

AI总结 针对电商检索中双编码器与重排器的目标不匹配问题,提出PAO选择性RL优化方法,在冻结文档索引下提升检索性能且优于标准RL与蒸馏基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30730 2026-09-01 cs.LG cs.CL 新提交

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

电商基准测试集:评估大语言模型智能体在长周期自主商业运营中的表现

Wei Fan, Xinjie Shen, Xudong Guo, Jianhong Tu, Yang Su, Yinger Zhang, Lianghao Deng, Fengyu Wang, Baohua Dong, Yangqiu Song, Dayiheng Liu

机构 * Qwen Team, Alibaba Group(通义千问团队,阿里巴巴集团) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系) Taobao & Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)

AI总结 该研究推出首个开源电商长周期自主商业运营基准E-Commerce Bench,评估18个前沿LLM智能体,发现无单一模型占优,GPT-5.6 Sol盈利最高,Qwen3.8-Max-Preview为开源模型最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30606 2026-09-01 cs.IR cs.AI 新提交

Generative Retrieval for E-commerce: Jointly Learning Embedding and Codebook with Same Product Cluster

面向电商的生成式检索:结合同一产品聚类的联合嵌入与码本学习

Songtao Fang, Zihao Xu, Shaowei Wei, Jin Zhang, Zhuojun Wang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对电商生成式检索的级联训练误差累积与交互建模不足问题,提出联合训练嵌入模型和码本并引入产品聚类监督的方法,有效提升了检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30528 2026-09-01 cs.LG 新提交

PAC: Progress-Augmented Advantage Curriculum for Multi-Task Reinforcement Learning of LLMs

PAC:面向大语言模型多任务强化学习的进度增强优势课程

Yuanqiang Yu, Yanzhao Zheng, Zhentao Zhang, Tianze Xu, Chao Ma, Jihuai Zhu, Jiashun Liu, Xinle Deng, Baohua Dong, Hangcheng Zhu, Ruohui Huang

机构 * Alibaba Group(阿里巴巴集团)

AI总结 该研究针对LLM多任务RL后训练的任务分配问题,提出PAC方法结合优势与奖励增益信号,经多场景验证可提升样本效率与最终性能。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏