arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-20 至 2026-04-20 共收录 10
2604.16256 2026-04-20 cs.CV cs.CL

Do Vision-Language Models Truly Perform Vision Reasoning? A Rigorous Study of the Modality Gap

视觉-语言模型真的能进行视觉推理吗?一种对模态差距的严格研究

Yige Xu, Yongjie Wang, Zizhuo Wu, Kaisong Song, Jun Lin, Zhiqi Shen

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-国立大学全球可持续发展公司实验室(ANGEL)) Tongyi Lab, Alibaba Group, China(阿里云实验室,阿里巴巴集团,中国)

AI总结 本文通过CrossMath基准测试,发现视觉-语言模型在文本输入时表现优异,但加入图像信息后推理性能下降,表明其推理主要依赖文本空间,而非真实视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16044 2026-04-20 cs.CV

Elucidating the SNR-t Bias of Diffusion Probabilistic Models

阐明扩散概率模型的SNR-t偏差

Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan

机构 * Lanzhou University(兰州大学) AMAP Alibaba Group(AMAP阿里巴巴集团)

AI总结 本文揭示了扩散模型在推理阶段SNR与时间步的不匹配问题,提出差分校正方法提升生成质量,实验表明在多种模型和数据集上效果显著。

Comments Accepted to CVPR 2026, 19pages, with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09033 2026-04-20 cs.CL

Do LLMs Really Know What They Don't Know? Internal States Mainly Reflect Knowledge Recall Rather Than Truthfulness

大语言模型真的了解它们不知道的东西吗?内部状态主要反映知识回忆而非真实性

Chi Seng Cheang, Hou Pong Chan, Wenxuan Zhang, Yang Deng

机构 * Singapore Management University(新加坡国立管理学院) DAMO Academy, Alibaba Group(阿里集团达摩院) Singapore University of Technology and Design(新加坡科技设计大学)

AI总结 本文探讨大语言模型是否真正了解其未知领域,通过分析内部状态发现其主要反映知识回忆而非真实性,提出hallucination分类方法以区分不同hallucination类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15840 2026-04-20 cs.CL

CoEvolve: Training LLM Agents via Agent-Data Mutual Evolution

CoEvolve:通过代理-数据互演训练LLM代理

Shidong Yang, Ziyu Ma, Tongwen Huang, Yiming Hu, Yong Wang, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团) AMAP

AI总结 本文提出CoEvolve框架,通过闭环交互训练提升LLM代理性能,利用反馈信号识别失败模式并指导任务合成,实验显示在AppWorld和BFCL上显著提升表现。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01766 2026-04-20 cs.LG cs.AI

CoMeT: Collaborative Memory Transformer for Efficient Long Context Modeling

CoMeT:用于高效长上下文建模的协作记忆变换器

Runsong Zhao, Shilei Liu, Jiwei Tang, Langming Liu, Haibin Chen, Weidong Zhang, Yujin Yuan, Tong Xiao, Jingbo Zhu, Wenbo Su, Bo Zheng

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院) Tsinghua University(清华大学) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

AI总结 CoMeT通过双内存系统和层级流水线并行策略,实现长上下文处理的常数内存和线性时间复杂度,有效提升模型性能。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08480 2026-04-20 cs.CV

Video-STAR: Reinforcing Open-Vocabulary Action Recognition with Tools

Video-STAR: 通过工具强化开放词汇动作识别

Zhenlong Yuan, Xiangyan Qu, Chengxuan Qian, Rui Chen, Jing Tang, Lei Sun, Xiangxiang Chu, Dapeng Zhang, Yiwei Wang, Yujun Cai, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) University of California at Merced(加州大学默塞德分校) University of Queensland(昆士兰大学) Case Western Reserve University(凯斯西储大学)

AI总结 Video-STAR通过结合上下文子动作分解与工具增强强化学习,提升开放词汇动作识别的细粒度匹配与跨模态推理能力,有效减少跨模态幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01944 2026-04-20 cs.RO cs.CV

AutoDrive-R$^2$: Incentivizing Reasoning and Self-Reflection Capacity for VLA Model in Autonomous Driving

AutoDrive-R$^2$: 促进自动驾驶VLA模型的推理与自反思能力

Zhenlong Yuan, Chengxuan Qian, Jing Tang, Rui Chen, Zijian Song, Lei Sun, Xiangxiang Chu, Yujun Cai, Dapeng Zhang, Shuo Li

机构 * AMAP, Alibaba Group(阿里集团AMAP) Sun Yat-sen University(中山大学) University of Queensland(昆士兰大学) Lanzhou University(兰州大学) Case Western Reserve University(凯斯西储大学)

AI总结 本文提出AutoDrive-R$^2$框架,通过链式推理和强化学习提升自动驾驶VLA系统的推理与自反思能力,使用nuScenesR$^2$-6K数据集和GRPO算法实现高鲁棒性轨迹规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08125 2026-04-20 cs.LG cs.CL

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.04300 2026-04-20 cs.CV cs.AI

T2I-FactualBench: Benchmarking the Factuality of Text-to-Image Models with Knowledge-Intensive Concepts

T2I-FactualBench:基于知识密集概念的文本到图像模型事实性评估基准

Ziwei Huang, Wanggui He, Quanyu Long, Yandi Wang, Haoyuan Li, Zhelun Yu, Fangxun Shu, Long Chan, Hao Jiang, Fei Wu, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出T2I-FactualBench,通过知识密集概念评估文本到图像模型的事实性,揭示当前SOTA模型在事实性上的不足。

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 27501-27524, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17596 2026-04-20 cs.MM cs.AI eess.IV

Subjective and Objective Quality-of-Experience Evaluation Study for Live Video Streaming

主观与客观直播视频流质量体验评估研究

Zehao Zhu, Wei Sun, Jun Jia, Wei Wu, Sibin Deng, Kai Li, Ying Chen, Xiongkuo Min, Jia Wang, Guangtao Zhai

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学) Alibaba Group(阿里巴巴集团)

AI总结 本文研究直播视频流的主观和客观质量体验评估,构建了首个直播视频流QoE数据集TaoLive QoE,并提出端到端QoE模型Tao-QoE,整合多尺度语义特征和光流运动特征以预测回顾性QoE评分。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏