arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-21 至 2026-04-21 共收录 21
2604.18126 2026-04-21 cs.RO cs.CV

Chatting about Conditional Trajectory Prediction

关于条件轨迹预测的讨论

Yuxiang Zhao, Wei Huang, Haipeng Zeng, Huan Zhao, Yujie Song

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出CiT方法,通过跨时间域意图交互实现轨迹预测,结合自身运动与社交交互信息,提升预测精度并集成机器人运动规划模块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17972 2026-04-21 cs.CL

Modeling Multiple Support Strategies within a Single Turn for Emotional Support Conversations

在单轮中建模多种支持策略用于情感支持对话

Jie Zhu, Huaixia Dou, Junhui Li, Lifan Guo, Feng Chen, Jinsong Su, Chi Zhang, Fang Kong

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队) Xiamen University(厦门大学)

AI总结 本文提出在单轮中生成多策略回应的方法,通过All-in-One和One-by-One生成策略,结合强化学习提升策略选择和回应生成,实验证明多策略生成能提高情感支持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17959 2026-04-21 cs.CV cs.GR

Chatting about Upper-Body Expressive Human Pose and Shape Estimation

关于上半身表达性人体姿态和形状估计的讨论

Yuxiang Zhao, Wei Huang, Yujie Song, Liu Wang, Huan Zhao

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出CoEvoer框架,通过上下文信息交换实现不同身体部位的特征级交互,提升上半身表达性人体姿态和形状估计的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07937 2026-04-21 cs.CL

HCRE: LLM-based Hierarchical Classification for Cross-Document Relation Extraction with a Prediction-then-Verification Strategy

HCRE: 基于大语言模型的跨文档关系抽取的分层分类方法

Guoqi Ma, Liang Zhang, Hongyao Tu, Hao Fu, Hui Li, Yujie Lin, Longyue Wang, Weihua Luo, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Li Auto Inc.(Li Auto公司) Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)

AI总结 本文提出HCRE方法,通过分层关系树减少LLM需考虑的关系选项,结合预测-验证策略提升可靠性,实验表明其优于现有基线。

Comments ACL 2026 Findings; camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11698 2026-04-21 cs.LG

SpiralFormer: Looped Transformers Can Learn Hierarchical Dependencies via Multi-Resolution Recursion

SpiralFormer:通过多分辨率递归学习层次依赖的循环Transformer

Chengting Yu, Xiaobo Shu, Yadao Wang, Yizhen Zhang, Haoyi Wu, You Wu, Rujiao Long, Ziheng Chen, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学)

AI总结 SpiralFormer通过多分辨率递归机制提升循环Transformer的参数和计算效率,实验证明其在不同模型规模下均优于传统递归和非递归基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10306 2026-04-21 cs.AI cs.CL

Evidence-Augmented Policy Optimization with Reward Co-Evolution for Long-Context Reasoning

增强证据的策略优化用于长上下文推理

Xin Guan, Zijian Li, Shen Huang, Pengjun Xie, Jingren Zhou, Jiuxin Cao

机构 * Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07739 2026-04-21 cs.LG cs.AI

MeSH: Memory-as-State-Highways for Recursive Transformers

MeSH: 递归变换器的记忆作为状态高速公路

Chengting Yu, Xiaobo Shu, Yadao Wang, Yizhen Zhang, Haoyi Wu, Jiaang Li, Rujiao Long, Ziheng Chen, Yuchi Xu, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出MeSH方案,通过外部化状态管理与轻量级路由解决递归变换器中的计算同质化和信息过载问题,提升模型性能。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05067 2026-04-21 cs.CV cs.AI

LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding

LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解

Boyuan Sun, Jiaxing Zhao, Xiang Chen, Xihan Wei, Qibin Hou

机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) Tongyi Group, Alibaba(阿里巴巴通义集团)

AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17543 2026-04-21 cs.CL

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

PoliLegalLM:政治与法律领域大型语言模型的技术报告

Yuting Huang, Yinghao Hu, Qian Xiao, Wenlin Zhong, Yiquan Wu, Taishi Zhou, Moke Chen, Changlong Sun, Kun Kuang, Fei Wu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)

AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17419 2026-04-21 cs.MA cs.LG

ARMove: Learning to Predict Human Mobility through Agentic Reasoning

ARMove: 通过代理推理学习预测人类移动

Chuyue Wang, Jie Feng, Yuxi Wu, Shenglin Yi, Hang Zhang

机构 * Tencent(腾讯) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Meituan(美团)

AI总结 ARMove通过代理推理方法,解决人类移动预测中的可解释性、迭代学习和迁移性问题,实验表明其在六个指标上优于现有方法,且在不同地区和用户群体中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17295 2026-04-21 cs.AI

LLaTiSA: Towards Difficulty-Stratified Time Series Reasoning from Visual Perception to Semantics

LLaTiSA:从视觉感知到语义的难度分层时间序列推理

Yueyang Ding, HaoPeng Zhang, Rui Dai, Yi Wang, Tianyu Zong, Kaikui Liu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) Amap(高德)

AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17282 2026-04-21 cs.CL

MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning

MedPRMBench: 一种面向医疗推理过程奖励模型的细粒度基准

Lingyan Wu, Xiang Zheng, Weiqi Zhai, Wei Wang, Xuan Ren, Zifan Zhang, Hu Wei, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出MedPRMBench,首个医疗领域过程奖励模型基准,通过三阶段流程生成高质量数据,涵盖14种细粒度错误类型,评估模型在医疗推理中的误差检测能力,提升下游任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22913 2026-04-21 cs.IR cs.LG

SIGMA: A Semantic-Grounded Instruction-Driven Generative Multi-Task Recommender at AliExpress

SIGMA:阿里国际站的语义引导指令驱动生成多任务推荐系统

Yang Yu, Lei Kou, Huaikuan Yi, Bin Chen, Yayu Cao, Lei Shen, Chao Zhang, Bing Wang, Xiaoyi Zeng

机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)

AI总结 SIGMA通过语义引导和指令驱动方法,解决传统推荐系统在多任务和实时业务需求中的局限,提升推荐准确性和多样性。

Comments Accepted by SIGIR 2026 Industry Track. 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19549 2026-04-21 cs.CL cs.CV cs.IR

Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework

塑造向量空间:通过剪枝-然后-融合框架实现高效的多向量视觉文档检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Jiahao Huo, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

AI总结 本文提出剪枝-然后-融合框架,通过两阶段方法提升多向量视觉文档检索效率,实验表明其在压缩率与特征保真度间取得平衡,显著扩展近无损压缩范围。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19979 2026-04-21 cs.CV

CamPVG: Camera-Controlled Panoramic Video Generation with Epipolar-Aware Diffusion

CamPVG:基于视图控制的全景视频生成与视图感知扩散

Chenhao Ji, Chaohui Yu, Junyao Gao, Fan Wang, Cairong Zhao

机构 * Tongji University(同济大学) DAMO Academy, Alibaba Group(阿里达摩院)

AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。

Comments SIGGRAPH Asia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16950 2026-04-21 cs.AI

AutoPKG: An Automated Framework for Dynamic E-commerce Product-Attribute Knowledge Graph Construction

AutoPKG:一种用于动态电子商务产品-属性知识图谱构建的自动化框架

Pollawat Hongwimol, Haoning Shang, Chutong Wang, Zhichao Wan, Yi Gao, Yuanming Li, Lin Gui, Wenhao Sun, Cheng Yu

机构 * Lazada, Alibaba International Digital Commerce Group(Lazada,阿里巴巴国际数字 commerce 集团) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出AutoPKG框架,通过多智能体大语言模型自动构建产品-属性知识图谱,解决电子商务产品属性提取中本体不一致、不完整和维护成本高的问题,实验证明其在提升GMV和推荐效果上的显著优势。

Comments Accepted as ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16881 2026-04-21 cs.CL cs.AI

Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation

通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译

Jiang Zhou, Xiaohu Zhao, Xinwei Wu, Tianyu Dong, Hao Wang, Yangyang Liu, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Deyi Xiong

机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。

Comments 23 pages, 11 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21471 2026-04-21 cs.CL

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

通过多智能体协作扩展LLM上下文窗口之外的知识输入

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。

Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents

详情

展开后加载摘要…

URL PDF HTML 收藏