arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-22 至 2026-04-22 共收录 13
2604.19636 2026-04-22 cs.CV

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation

CoInteract:通过空间结构化共生成实现物理一致的人-物体交互视频合成

Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 CoInteract通过空间结构化共生成方法,在人-物体交互视频合成中提升结构稳定性与物理合理性,采用扩散变换器框架结合人类感知混合专家和双流训练策略,实现更真实的交互效果。

Comments The project page: https://xinxiaozhe12345.github.io/CoInteract_Project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04562 2026-04-22 cs.AI

Reasoning Over Space: Enabling Geographic Reasoning for LLM-Based Generative Next POI Recommendation

空间推理:为基于大语言模型的生成下POI推荐启用地理推理

Dongyi Lv, Qiuyu Ding, Heng-Da Xu, Zhaoxu Sun, Zhi Wang, Feng Xiong, Mu Xu

机构 * School Of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Amap, Alibaba Group(阿里巴巴集团阿地图)

AI总结 本文提出ROS框架,通过地理信息作为决策变量提升生成式推荐的地理推理能力,采用分层空间语义ID和三阶段移动链式推理,结合空间引导强化学习,实现跨城市迁移和命中率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09373 2026-04-22 cs.LG cs.AI cs.CV

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

LPO:通过位置偏好优化实现更准确的GUI代理交互

Jiaqi Tang, Yu Xia, Yi-Feng Wu, Yuwei Hu, Yuhui Chen, Qing-Guo Chen, Xiaogang Xu, Xiangyu Wu, Hao Lu, Yanqing Ma, Shiyin Lu, Qifeng Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Alibaba Group(阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Nanjing University of Science and Technology(南京理工大学) The Hong Kong University of Science and Technology (Guangzhou)(广州香港科学与技术大学)

AI总结 本文提出LPO方法,通过位置偏好优化提升GUI交互精度,利用信息熵预测交互位置并引入动态位置奖励函数,实验表明其在离线和在线评估中均取得最佳性能。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19295 2026-04-22 cs.LG

TEMPO: Scaling Test-time Training for Large Reasoning Models

TEMPO:用于大规模推理模型的测试时训练扩展

Qingyang Zhang, Xinke Kong, Haitao Wu, Qinghua Hu, Minghao Wu, Baosong Yang, Yu Cheng, Yun Luo, Ganqu Cui, Changqing Zhang

机构 * Tianjin University(天津大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Lab(上海人工智能实验室)

AI总结 TEMPO通过交替策略优化和周期性批评者重校准提升测试时训练效果,显著提升模型在AIME 2024任务中的表现并保持高多样性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19262 2026-04-22 cs.CL cs.AI

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19218 2026-04-22 cs.CV

Thinking Before Matching: A Reinforcement Reasoning Paradigm Towards General Person Re-Identification

在匹配前思考:一种针对通用人物重识别的强化推理范式

Quan Zhang, Jingze Wu, Jialong Wang, Xiaohua Xie, Jianhuang Lai, Hongbo Chen

机构 * Sun Yat-sen University(中山大学) Alibaba Cloud Computing(阿里巴巴云 computing)

AI总结 本文提出ReID-R范式,通过引入链式推理提升人物重识别的识别能力与泛化性,在多个基准测试中表现出色。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19149 2026-04-22 cs.CL cs.AI

How Do Answer Tokens Read Reasoning Traces? Self-Reading Patterns in Thinking LLMs for Quantitative Reasoning

思考大语言模型如何读取推理痕迹:自我阅读模式在定量推理中的应用

Haoyang Chen, Yi Liu, Jianzhi Shao, Tao Zhang, Chengfu Huo, Wei Hu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) Alibaba Group, China(阿里巴巴集团,中国) Ant Group, China(蚂蚁集团,中国)

AI总结 研究分析思考大语言模型在定量推理中如何通过自我阅读模式整合推理痕迹,提出基于自我阅读质量的训练无关引导方法,提升推理可靠性。

Comments Accepted in the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19034 2026-04-22 cs.CV

Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents

像人类一样探索:面向具身智能体的在线SG-Memo构建自主探索

Xu Chen, Shichao Xie, Zhining Gu, Lu Jia, Minghua Luo, Fei Liu, Zedong Chu, Yanfen Shen, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出ABot-Explorer框架,通过在线RGB-only过程统一记忆构建与探索,利用VLMs提取语义导航 affordances,生成结构化SG-Memo以提升探索效率和环境覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18791 2026-04-22 cs.LG cs.AI

HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation

HELM:增强型长时程记忆用于视觉-语言-动作操控

Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团) Bengbu University(Bengbu大学)

AI总结 HELM通过解决记忆、验证和恢复三大缺陷,提升长时程视觉-语言-动作任务性能,其核心贡献是学习的State Verifier在任务成功率上显著优于传统方法。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15804 2026-04-22 cs.CL eess.AS

Qwen3.5-Omni Technical Report

Qwen3.5-Omni 技术报告

Qwen Team

机构 * Qwen Team(通义实验室)

AI总结 Qwen3.5-Omni在多模态能力上取得突破,支持256k上下文长度和多语言理解,通过混合注意力MoE架构实现高效推理,并引入ARIA提升语音合成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12735 2026-04-22 cs.CV cs.CL

VimRAG: Navigating Massive Visual Context in Retrieval-Augmented Generation via Multimodal Memory Graph

VimRAG:通过多模态记忆图导航大规模视觉上下文

Qiuchen Wang, Shihang Wang, Yu Zeng, Qiang Zhang, Fanrui Zhang, Zhuoning Guo, Bosi Zhang, Wenxuan Huang, Lin Chen, Zehui Chen, Pengjun Xie, Ruixue Ding

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

AI总结 VimRAG通过多模态记忆图提升检索增强生成在处理大规模视觉上下文中的能力,采用动态有向无环图结构和图调制视觉记忆编码机制,实现高效的信息检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16161 2026-04-22 cs.CV cs.CL

OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models

OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性

Wenwen Yu, Zhibo Yang, Jianqiang Wan, Sibo Song, Jun Tang, Wenqing Cheng, Yuliang Liu, Xiang Bai

机构 * School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出OmniParser V2,通过结构化思维点提示方案统一视觉文本解析任务,简化流程并提升性能,在多个数据集上取得最佳结果,并验证其在多模态大语言模型中的通用性。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏