arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-03-19 至 2026-03-19 共收录 11
2603.17693 2026-03-19 cs.CV

Learning Transferable Temporal Primitives for Video Reasoning via Synthetic Videos

通过合成视频学习可迁移的时间原语以实现视频推理

Songtao Jiang, Sibo Song, Chenyi Zhou, Yuan Wang, Ruizhe Chen, Tongkun Guan, Ruilin Luo, Yan Zhang, Zhihang Tang, Yuchong Sun, Hang Zhang, Zhibo Yang, Shuai Bai, Junyang Lin, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出SynRL框架,通过合成视频训练模型的时间原语,提升视频推理能力,在15个基准测试中取得显著成效,合成数据在复杂场景中表现优于真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05305 2026-03-19 cs.CV cs.AI

Frequency Autoregressive Image Generation with Continuous Tokens

基于连续标记的频率自回归图像生成

Hu Yu, Hao Luo, Hangjie Yuan, Yu Rong, Jie Huang, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group, DAMO Academy(阿里巴巴集团,达摩院)

AI总结 本文提出频率自回归(FAR)范式,通过连续标记器构建图像,利用频谱依赖性提升生成效果,并在ImageNet上验证了其在图像生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17546 2026-03-19 cs.CV

ProGVC: Progressive-based Generative Video Compression via Auto-Regressive Context Modeling

ProGVC:基于渐进式的生成视频压缩 via 自动回归上下文建模

Daowen Li, Ruixiao Dong, Ying Chen, Kai Li, Ding Ding, Li Li

机构 * Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学)

AI总结 ProGVC提出一种统一渐进传输、高效熵编码和细节合成的视频压缩框架,通过多尺度自回归上下文模型实现低比特率下的高质量视频压缩与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17474 2026-03-19 cs.CV cs.AI

Revisiting Cross-Attention Mechanisms: Leveraging Beneficial Noise for Domain-Adaptive Learning

重新审视交叉注意力机制:利用有益噪声进行领域自适应学习

Zelin Zang, Yehui Yang, Fei Wang, Liangyu Li, Baigui Sun

机构 * School of Engineering, Westlake University(西lake大学工程学院) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences (HKISI-CAS)(香港科学院人工智能与机器人中心) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences (CASIA)(多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences (UCAS)(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出DACSM框架,通过引入有益噪声增强交叉注意力,结合领域翻译和尺度感知对齐,提升跨领域表示学习的鲁棒性,实验显示在VisDA-2017等数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17439 2026-03-19 cs.LG cs.AI

Baguan-TS: A Sequence-Native In-Context Learning Model for Time Series Forecasting with Covariates

Baguan-TS: 一种序列原生的上下文学习模型用于具有协变量的时间序列预测

Linxiao Yang, Xue Jiang, Gezheng Xu, Tian Zhou, Min Yang, ZhaoYang Zhu, Linyuan Geng, Zhipeng Zeng, Qiming Chen, Xinyue Gu, Rong Jin, Liang Sun

机构 * DAMO Academy, Alibaba Group, Hangzhou, China(阿里达摩院,阿里巴巴集团,杭州,中国)

AI总结 Baguan-TS通过整合原始序列表示学习与上下文学习,解决了时间序列预测中上下文学习与端到端序列模型的适应性问题,提升了模型的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17437 2026-03-19 cs.RO

FloorPlan-VLN: A New Paradigm for Floor Plan Guided Vision-Language Navigation

FloorPlan-VLN: 一种新的基于平面图引导的视觉-语言导航范式

Kehan Chen, Yan Huang, Dong An, Jiawei He, Yifei Su, Jing Liu, Nianfeng Liu, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences and School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院自动化研究所新型模式识别实验室,中国科学院人工智能学院) AMap, Alibaba Group(阿里巴巴集团高德地图) BAAI(北京人工智能研究院) Xiaomi Robotics Lab(小米机器人实验室) FiveAges

AI总结 本文提出FloorPlan-VLN范式,利用结构化的语义平面图作为全局空间先验,通过FP-Nav方法实现仅需简洁指令的导航,实验表明其在导航成功率上优于现有方法,验证了平面图引导导航的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16927 2026-03-19 cs.CV eess.IV

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

利用大型视觉模型实现低空无线网络中多无人机协同感知

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba Cloud(阿里云) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

AI总结 本文提出一种通信高效的多无人机协同感知框架BHU,通过Top-K选择机制和Swin-large-based MaskDINO编码器提升感知性能,同时利用深度强化学习优化协作无人机选择和资源分配,实验表明在资源受限环境下感知性能提升超5%且通信开销降低85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16600 2026-03-19 cs.CV

Rationale Matters: Learning Transferable Rubrics via Proxy-Guided Critique for VLM Reward Models

原因至关重要:通过代理引导的批评学习可转移的评分标准用于视觉语言模型奖励模型

Weijie Qiu, Dai Guan, Junxin Wang, Zhihang Li, Yongbo Gai, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文提出Proxy-GRM,通过代理引导的评分标准验证提升视觉语言模型奖励模型的评分质量,利用轻量级代理代理进行评分标准验证,实现评分标准的可转移性和一致性,实验表明其在多个基准测试中表现优异。

Comments 25 pages, 10 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21240 2026-03-19 cs.LG cs.AI

Tree Search for LLM Agent Reinforcement Learning

基于树搜索的LLM代理强化学习

Yuxiang Ji, Ziyu Ma, Yong Wang, Guanhua Chen, Xiangxiang Chu, Liaoni Wu

机构 * Xiamen University(厦门大学) AMAP, Alibaba Group(阿里集团AMAP实验室) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出Tree-GRPO方法,通过树结构提升LLM代理在长期任务中的表现,利用树搜索共享前缀以增加rollout数量,并通过理论分析证明其与直接偏好学习等效。

Comments ICLR 2026, Code: https://github.com/AMAP-ML/Tree-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17049 2026-03-19 cs.CV cs.AI

From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis

从几何模仿到综合生成:一种基于上下文的多模态扩散模型用于城市形态合成

Fangshuo Zhou, Huaxia Li, Liuchang Xu, Rui Hu, Sensen Wu, Liang Xu, Hailin Feng, Zhenhong Du

机构 * Zhejiang Agriculture and Forestry University(浙江农业与林业大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出ControlCity模型,通过多模态信息融合实现城市形态综合生成,提升了形态保真度和空间重叠度,实现了跨城市风格迁移和未知城市零样本生成。

Comments Accepted

Journal ref International Journal of Geographical Information Science (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.04264 2026-03-19 cs.LG

HighAir: A Hierarchical Graph Neural Network-Based Air Quality Forecasting Method

HighAir:一种基于分层图神经网络的空气质量预报方法

Ling Chen, Jiahui Xu, Binqing Wu, Mingqi Lv, Chaoqun Zhan, Sanjian Chen, Jian Chang

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) College of Computer Science, Zhejiang University of Technology(浙江工业大学计算机科学学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出HighAir方法,通过分层图神经网络建模城市与监测站间污染物扩散过程,考虑天气和土地利用等复杂因素,提升空气质量预报精度。

详情

展开后加载摘要…

URL PDF HTML 收藏