Chatting about Conditional Trajectory Prediction
关于条件轨迹预测的讨论
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出CiT方法,通过跨时间域意图交互实现轨迹预测,结合自身运动与社交交互信息,提升预测精度并集成机器人运动规划模块。
大厂专区
关于条件轨迹预测的讨论
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出CiT方法,通过跨时间域意图交互实现轨迹预测,结合自身运动与社交交互信息,提升预测精度并集成机器人运动规划模块。
在单轮中建模多种支持策略用于情感支持对话
机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) ; Qwen DianJin Team, Alibaba Cloud Computing(阿里云Qwen团队) ; Xiamen University(厦门大学)
AI总结 本文提出在单轮中生成多策略回应的方法,通过All-in-One和One-by-One生成策略,结合强化学习提升策略选择和回应生成,实验证明多策略生成能提高情感支持质量。
关于上半身表达性人体姿态和形状估计的讨论
机构 * Sun Yat-sen University(中山大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出CoEvoer框架,通过上下文信息交换实现不同身体部位的特征级交互,提升上半身表达性人体姿态和形状估计的准确性和泛化能力。
HCRE: 基于大语言模型的跨文档关系抽取的分层分类方法
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; Li Auto Inc.(Li Auto公司) ; Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)
AI总结 本文提出HCRE方法,通过分层关系树减少LLM需考虑的关系选项,结合预测-验证策略提升可靠性,实验表明其优于现有基线。
Comments ACL 2026 Findings; camera ready version
SpiralFormer:通过多分辨率递归学习层次依赖的循环Transformer
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学)
AI总结 SpiralFormer通过多分辨率递归机制提升循环Transformer的参数和计算效率,实验证明其在不同模型规模下均优于传统递归和非递归基线。
增强证据的策略优化用于长上下文推理
机构 * Tongyi Lab(通义实验室) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出EAPO方法,通过引入组相对证据奖励和适应性奖励-策略共演机制,提升长上下文推理中的证据提取质量,从而增强推理性能。
ViT$^3$:解锁视觉中的测试时间训练
机构 * Tsinghua University(清华大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。
Comments CVPR 2026, oral
超越上下文的规模:文档理解的多模态检索增强生成综述
机构 * MBZUAI ; Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学) ; Wuhan University(武汉大学) ; Nanyang Technological University(南洋理工大学) ; University of Melbourne(墨尔本大学)
AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。
Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document
MeSH: 递归变换器的记忆作为状态高速公路
机构 * Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学) ; ShanghaiTech University(上海科技大学)
AI总结 本文提出MeSH方案,通过外部化状态管理与轻量级路由解决递归变换器中的计算同质化和信息过载问题,提升模型性能。
Comments Accepted by ICLR 2026
LLaVA-Octopus:解锁指令驱动的自适应投影器融合用于视频理解
机构 * VCIP, CS, Nankai University(南开大学计算机科学与技术学院) ; Tongyi Group, Alibaba(阿里巴巴通义集团)
AI总结 LLaVA-Octopus通过根据用户指令动态调整不同视觉投影器的特征权重,提升视频理解任务的性能,实验表明其在多个基准测试中表现优异。
Comments 18 pages, 10 figures
PoliLegalLM:政治与法律领域大型语言模型的技术报告
机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) ; Zhejiang University(浙江大学) ; Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)
AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。
ARMove: 通过代理推理学习预测人类移动
机构 * Tencent(腾讯) ; Zhongguancun Academy(中关村学院) ; Alibaba Group(阿里巴巴集团) ; Meituan(美团)
AI总结 ARMove通过代理推理方法,解决人类移动预测中的可解释性、迭代学习和迁移性问题,实验表明其在六个指标上优于现有方法,且在不同地区和用户群体中表现稳健。
LLaTiSA:从视觉感知到语义的难度分层时间序列推理
机构 * Alibaba Group(阿里巴巴集团) ; Amap(高德)
AI总结 本文提出LLaTiSA,通过四层分类体系提升时间序列推理能力,结合可视化模式与精确校准的数值表格增强视觉语言模型的时序感知,实现跨多样任务和现实场景的鲁棒泛化。
MedPRMBench: 一种面向医疗推理过程奖励模型的细粒度基准
机构 * Alibaba Group(阿里巴巴集团)
AI总结 本文提出MedPRMBench,首个医疗领域过程奖励模型基准,通过三阶段流程生成高质量数据,涵盖14种细粒度错误类型,评估模型在医疗推理中的误差检测能力,提升下游任务准确率。
SIGMA:阿里国际站的语义引导指令驱动生成多任务推荐系统
机构 * Alibaba International Digital Commercial Group(阿里巴巴国际数字商业集团)
AI总结 SIGMA通过语义引导和指令驱动方法,解决传统推荐系统在多任务和实时业务需求中的局限,提升推荐准确性和多样性。
Comments Accepted by SIGIR 2026 Industry Track. 5 pages, 3 figures
塑造向量空间:通过剪枝-然后-融合框架实现高效的多向量视觉文档检索
机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Alibaba Cloud Computing(阿里云计算)
AI总结 本文提出剪枝-然后-融合框架,通过两阶段方法提升多向量视觉文档检索效率,实验表明其在压缩率与特征保真度间取得平衡,显著扩展近无损压缩范围。
Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)
CamPVG:基于视图控制的全景视频生成与视图感知扩散
机构 * Tongji University(同济大学) ; DAMO Academy, Alibaba Group(阿里达摩院)
AI总结 本文提出CamPVG,首个基于视图控制的全景视频生成框架,通过全景Plücker嵌入和视图感知模块提升生成视频的质量与一致性。
Comments SIGGRAPH Asia 2025
Writing-RL: 通过自适应课程强化学习推进长文本写作
机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) ; Tsinghua University(清华大学) ; Dept. of Comp. Sci. & Tech.(计算机科学与技术系) ; Institute for AI(人工智能研究院) ; Institute of Intelligent Computing(智能计算研究院) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。
Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL
AutoPKG:一种用于动态电子商务产品-属性知识图谱构建的自动化框架
机构 * Lazada, Alibaba International Digital Commerce Group(Lazada,阿里巴巴国际数字 commerce 集团) ; Nanyang Technological University, Singapore(南洋理工大学,新加坡)
AI总结 本文提出AutoPKG框架,通过多智能体大语言模型自动构建产品-属性知识图谱,解决电子商务产品属性提取中本体不一致、不完整和维护成本高的问题,实验证明其在提升GMV和推荐效果上的显著优势。
Comments Accepted as ACL 2026 Findings
通过可验证奖励的强化学习激励参数知识用于跨文化实体翻译
机构 * TJUNLP Lab, Tianjin University, China(天津大学TJUNLP实验室) ; Alibaba Group, China(阿里巴巴集团)
AI总结 本文提出EA-RLVR框架,通过可验证奖励信号优化跨文化实体翻译,提升模型在实体翻译准确性和领域外泛化能力,实验表明在7k样本训练下模型性能显著提升。
Comments 23 pages, 11 figures, 11 tables
通过多智能体协作扩展LLM上下文窗口之外的知识输入
机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) ; Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) ; Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)
AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。
Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents