arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Alibaba(阿里巴巴)

2026-04-10 至 2026-04-10 共收录 9
2604.08545 2026-04-10 cs.CV cs.AI

Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models

明智行动:在代理多模态模型中培养元认知工具使用

Shilin Yan, Jintao Tong, Hongwei Xue, Xiaojun Tang, Yangyang Wang, Kunyu Shi, Guannan Zhang, Ruixuan Li, Yixiong Zou

机构 * Accio Team, Alibaba Group(阿里巴巴集团 Accio 团队) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出HDPO框架,通过解耦优化通道提升代理多模态模型的元认知工具使用能力,减少工具调用并提升推理准确性。

Comments Project Page: https://Accio-Lab.github.io/Metis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08541 2026-04-10 cs.CV cs.AI cs.CL

Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts

视觉而无思维:多模态混合专家中的路由干扰

Haolei Xu, Haiwen Hong, Hongxing Li, Rui Zhou, Yang Zhang, Longtao Huang, Hui Xue, Yongliang Shen, Weiming Lu, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

AI总结 研究揭示多模态混合专家模型在视觉输入时路由机制无法有效激活任务相关专家,导致推理失败,提出路由干扰假说并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08203 2026-04-10 cs.CV cs.AI

MedVR: Annotation-Free Medical Visual Reasoning via Agentic Reinforcement Learning

MedVR:通过代理强化学习实现无标注的医学视觉推理

Zheng Jiang, Heng Guo, Chengyu Fang, Changchen Xiao, Xinyang Hu, Lifeng Sun, Minfeng Xu

机构 * Tsinghua University(清华大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Key Laboratory of Pervasive Computing, Ministry of Education(教育部普适计算重点实验室) Zhejiang University(浙江大学)

AI总结 MedVR通过代理强化学习实现无标注的医学视觉推理,利用熵引导的视觉重定位和基于共识的信用分配机制,在多个公开医学VQA基准上取得最佳性能,提升医疗AI的鲁棒性和透明度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21366 2026-04-10 cs.CV cs.LG

BADiff: Bandwidth Adaptive Diffusion Model

BADiff:带宽自适应扩散模型

Xi Zhang, Hanwei Zhu, Yan Zhong, Jiamang Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出一种带宽自适应扩散模型,通过端到端训练策略使模型根据实时网络带宽调整生成质量,提升带宽受限环境下的图像传输效率。

Comments NeurIPS 2025 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08124 2026-04-10 cs.AI

Beyond Stochastic Exploration: What Makes Training Data Valuable for Agentic Search

超越随机探索:训练数据为何对代理搜索有价值

Chuzhan Hao, Wenfeng Feng, Guochao Jiang, Guofeng Quan, Guohua Liu, Yuewei Zhang

机构 * Alibaba Cloud Computing(阿里云)

AI总结 本文提出Hierarchical Experience框架,通过对比分析和多级聚类机制将原始推理轨迹转化为层次经验知识,提升搜索代理的性能和训练稳定性,实现更高效的策略驱动搜索。

Comments 15 pages, ACL2026 Findings Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08123 2026-04-10 cs.DC cs.AI

LegoDiffusion: Micro-Serving Text-to-Image Diffusion Workflows

LegoDiffusion:微服务文本到图像扩散工作流

Lingyun Yang, Suyi Li, Tianyu Feng, Xiaoxiao Jiang, Zhipeng Di, Weiyi Lu, Kan Liu, Yinghao Yu, Tao Lan, Guodong Yang, Lin Qu, Liping Zhang, Wei Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Alibaba Group(阿里巴巴集团)

AI总结 LegoDiffusion通过将扩散工作流分解为松耦合的模型执行节点,实现高效管理与调度,提升请求率和突发流量容忍度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07559 2026-04-10 cs.AI

Dual-Loop Control in DCVerse: Advancing Reliable Deployment of AI in Data Centers via Digital Twins

双环控制在DCVerse中的应用:通过数字孪生推进AI在数据中心的可靠部署

Qingang Zhang, Yuejun Yan, Guangyu Wu, Siew-Chien Wong, Jimin Jia, Zhaoyang Wang, Yonggang Wen

机构 * Alibaba Group(阿里巴巴集团)

AI总结 本文提出双环控制框架,通过数字孪生技术解决数据中心能源效率与故障风险平衡问题,实现更可靠的AI部署,实验显示能提升能效并满足服务等级协议要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07409 2026-04-10 cs.LG eess.IV

GAN-based Domain Adaptation for Image-aware Layout Generation in Advertising Poster Design

基于GAN的领域适应用于广告海报设计中的图像感知布局生成

Chenchen Xu, Min Zhou, Tiezheng Ge, Weiwei Xu

机构 * Anhui Normal University(安徽师范大学) Zhejiang University(浙江大学) Shenzhen Bay Laboratory(深圳湾实验室) Alibaba Group(阿里巴巴集团)

AI总结 本文提出基于GAN的模型,利用图像生成广告海报布局,引入CGL数据集并设计PDA-GAN模型以提升图像感知布局生成效果。

Comments arXiv admin note: text overlap with arXiv:2303.14377

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13235 2026-04-10 cs.AI cs.CV

Lang2Act: Fine-Grained Visual Reasoning through Self-Emergent Linguistic Toolchains

Lang2Act: 通过自涌现语言工具链实现细粒度视觉推理

Yuqi Xiong, Chunyi Peng, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Yukun Yan, Shuo Wang, Yu Gu, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 Lang2Act通过自涌现语言工具链提升视觉感知与推理能力,采用强化学习框架优化VLMs的视觉感知和下游任务性能,实验显示其在视觉感知能力上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏