arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Xiaomi(小米)

2026-04-21 至 2026-04-21 共收录 4
2503.14324 2026-04-21 cs.CV cs.CL

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17407 2026-04-21 cs.RO

Think before Go: Hierarchical Reasoning for Image-goal Navigation

先思后行:面向图像目标导航的层次推理

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Lin Zhao, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, National Engineering Research Center for Visual Information and Applications, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家实验室、视觉信息与应用国家工程研究中心、人工智能与机器人研究所、西安交通大学) University of Macau(澳门大学) Xiaomi EV(小米电动车) School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学)

AI总结 本文提出HRNav框架,通过分层规划与执行解决图像目标导航问题,利用视觉语言模型生成短期计划并结合在线强化学习策略,引入Wandering Suppression Penalty降低漂移问题,实验验证其有效性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02718 2026-04-21 cs.LG cs.AI

End-to-End Optimization of LLM-Driven Multi-Agent Search Systems via Heterogeneous-Group-Based Reinforcement Learning

通过异质组强化学习实现LLM驱动的多智能体搜索系统的端到端优化

Guanzhong Chen, Shaoxiong Yang, Chao Li, Wei Liu, Jian Luan, Zenglin Xu

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

AI总结 本文提出MHGPO方法,通过估计异质组间的相对优势,优化多智能体系统的整体成功而非单个智能体性能,提升了任务表现和计算效率。

Comments Accepted to ACL 2026 Main Conference. 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏