arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-06-30 至 2026-06-30 共收录 11
2606.30332 2026-06-30 cs.CV

UniGP: Taming Diffusion Transformer for Prior-Preserved Unified Generation and Perception

UniGP:驯服扩散Transformer以实现先验保留的统一生成与感知

Qin Guo, Hao Luo, Dongxu Yue, Weixuan Jin, Xiao Fu, Fan Wang, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Zeekr Automobile R&D Co., Ltd.(小鹏汽车研发有限公司)

AI总结 提出UniGP框架,基于MMDiT通过简单联合训练统一可控生成与密集预测,无需复杂任务设计,保留骨干先验,在多个任务上超越先前统一方法并与专用方法持平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30185 2026-06-30 cs.AI

Dynamo: Dynamic Skill-Tool Evolution for Vision-Language Agents

Dynamo: 视觉-语言代理的动态技能-工具演化

Yutao Sun, Yanting Miao, Hao-Xuan Ma, Mengyu Zhou, Mingshuai Chen, Tiancheng Zhao, Dexin Wang, Lei Lv, Li Xu, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba Zhejiang University(阿里巴巴浙江大学) University of Waterloo(多伦多大学) Vector Institute(向量研究所) Nanjing University(南京大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院)

AI总结 提出Dynamo,一种无需训练、无需权重更新的框架,通过让冻结的VLM在少量标注数据上自我检查并演化可复用的推理技能和可执行的视觉工具,提升视觉推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30084 2026-06-30 cs.CV

One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位

Chen Liu, Ling Chen, Hanzhang Zhou, Liangyu Chen, Chenglin Cai, Xin Yu, Steven Hoi, Yue Wang

机构 * Alibaba Group(阿里巴巴集团) Tongyi Lab(通义实验室) University of Technology Sydney(悉尼大学) Adelaide University(阿德莱德大学)

AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30019 2026-06-30 cs.CV

OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data

OmniDance: 基于大规模互联网数据的多模态驱动舞蹈视频生成

Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Chubin Chen, Puwei Wang, Jiahong Wu, Xiangxiang Chu, Hongyan Liu, Jun He

机构 * Renmin University of China(中国人民大学) AMAP, Alibaba Group(AMAP,阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Malou Tech Inc(Malou科技公司)

AI总结 提出CIPE-Dance大规模舞蹈视频数据集和OmniDance框架,通过深度感知架构、课程学习和条件引导策略,实现文本、音乐及多模态驱动的舞蹈视频生成,达到最优性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29828 2026-06-30 cs.CV

HomeDiffusion: Zero-Shot Object Customization with Multi-View Representation Learning for Indoor Scenes

HomeDiffusion: 基于多视角表示学习的室内场景零样本对象定制

Guoqiu Li, Jin Song, Yiyun Fei

机构 * Alibaba Group(阿里巴巴集团)

AI总结 针对零样本对象定制中细节失真和姿态不协调问题,提出HomeDiffusion,利用多视角图像和扩散模型,在指定区域生成与背景和谐的对象,并通过交叉注意力保持细节。

Comments 9 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29526 2026-06-30 cs.LG

The Mirage of Optimizing Training Policies: Monotonic Inference Policies as the Real Objective for LLM Reinforcement Learning

优化训练策略的幻象:单调推理策略作为大语言模型强化学习的真正目标

Jing Liang, Hongyao Tang, Yi Ma, Yancheng He, Weixun Wang, Xiaoyang Li, Ju Huang, Wenbo Su, Jinyi Liu, Yan Zheng, Jianye Hao, Bo Zheng

机构 * Tianjin University(天津大学) Alibaba(阿里巴巴)

AI总结 针对LLM强化学习中训练-推理概率不一致导致的策略不稳定问题,提出单调推理策略改进(MIPI)目标及两阶段框架MIPU,通过推理侧间隙代理选择候选更新,提升推理性能与训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28677 2026-06-30 cs.CV

SATB-VR: Training Few-Step Video Restoration Diffusion Model using SNR-Aware Trajectory Blending

SATB-VR:使用信噪比感知轨迹混合训练少步视频恢复扩散模型

Haoran Bai, Xiaoxu Chen, Xiaoyu Liu, Zongsheng Yue, Sibin Deng, Wangmeng Zuo, Ying Chen

机构 * Alibaba Group(阿里巴巴集团) Harbin Institute of Technology(哈尔滨工业大学) Xi’an Jiaotong University(西安交通大学)

AI总结 提出SATB-VR少步视频恢复框架,通过辅助预测器跳过低信噪比步骤,并利用SNR感知轨迹混合策略解决训练-推理不一致,实现高效高质量恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31603 2026-06-30 cs.CV cs.AI

Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models

Lumos-Nexus: 面向视频统一模型的高效频率桥接与同质潜在空间

Jiazheng Xing, Hangjie Yuan, Lingling Cai, Xinyu Liu, Yujie Wei, Fei Du, Tao Feng, Hai Ci, Jiasheng Tang, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎扑实验室) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tsinghua University(清华大学)

AI总结 提出Lumos-Nexus框架,通过两阶段训练和渐进频率桥接,在保持推理能力的同时显著提升视频生成保真度。

Comments ECCV 2026 Camera-Ready Version. Project page (https://jiazheng-xing.github.io/nexus-lumos-home/) and Code (https://github.com/alibaba-damo-academy/Lumos-Custom/) are available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17621 2026-06-30 cs.LG cs.CL

Complementary RL: Towards Efficient Experience-Driven Agent Learning

互补强化学习:迈向高效的基于经验的智能体学习

Dilxat Muhtar, Jiashun Liu, Wei Gao, Weixun Wang, Shaopan Xiong, Ju Huang, Siran Yang, Wenbo Su, Jiamang Wang, Ling Pan, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) HKUST(香港科技大学)

AI总结 本文提出互补强化学习,通过经验提取器与策略智能体的协同进化,提升经验利用效率,实验证明在单任务和多任务场景中均优于传统方法。

Comments 22 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏