arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Alibaba(阿里巴巴)

2026-03-16 至 2026-03-16 共收录 4
2603.12829 2026-03-16 cs.CV

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12586 2026-03-16 cs.IR cs.LG

Deferred is Better: A Framework for Multi-Granularity Deferred Interaction of Heterogeneous Features

延迟更优:一种多粒度延迟交互的异构特征框架

Yi Xu, Moyu Zhang, Chaofan Fan, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

机构 * Alibaba Group(阿里巴巴集团) Alibaba International Digital Commerce Group(阿里巴巴国际数字贸易集团)

AI总结 本文提出MGDIN框架,通过多粒度特征分组和延迟交互机制,解决CTR预测中异构特征的稀疏性和信息含量差异问题,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01550 2026-03-16 cs.RO cs.CV

NavForesee: A Unified Vision-Language World Model for Hierarchical Planning and Dual-Horizon Navigation Prediction

NavForesee: 一种统一的视觉-语言世界模型用于分层规划和双时间尺度导航预测

Fei Liu, Shichao Xie, Minghua Luo, Zedong Chu, Junjun Hu, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

AI总结 NavForesee通过统一的视觉-语言模型实现分层规划和双时间尺度导航预测,结合任务分解与环境预测,提升复杂场景下的导航能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23863 2026-03-16 cs.CL

SPELL: Self-Play Reinforcement Learning for Evolving Long-Context Language Models

SPELL: 自我扮演强化学习用于进化长上下文语言模型

Ziyi Yang, Weizhou Shen, Chenliang Li, Ruijun Chen, Fanqi Wan, Ming Yan, Xiaojun Quan, Fei Huang

机构 * Sun Yat-sen University(中山大学) Tongyi Lab, Alibaba Group(阿里云实验室) Shenzhen Loop Area Institute(深圳河套学院)

AI总结 本文提出SPELL框架,通过自我扮演问答和验证角色实现长上下文推理的无监督优化,实验显示其在多个基准上优于传统微调方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏