arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2025-12-02 至 2025-12-02 共收录 12
2512.02013 2025-12-02 cs.RO

ManualVLA: A Unified VLA Model for Chain-of-Thought Manual Generation and Robotic Manipulation

ManualVLA: 一种统一的VLA模型用于链式思维手动生成和机器人操作

Chenyang Gu, Jiaming Liu, Hao Chen, Runzhong Huang, Qingpo Wuwu, Zhuoyang Liu, Xiaoqi Li, Ying Li, Renrui Zhang, Peng Jia, Pheng-Ann Heng, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Project(Simplexity机器人项目)

AI总结 ManualVLA通过融合多模态手册生成与动作执行,提升机器人长周期任务中的规划与操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01827 2025-12-02 cs.CV

CauSight: Learning to Supersense for Visual Causal Discovery

CauSight: 通过因果推理进行视觉因果发现

Yize Zhang, Meiqi Chen, Sirui Chen, Bo Peng, Yanxi Zhang, Tianyu Li, Chaochao Lu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tongji University(同济大学)

AI总结 CauSight通过因果推理进行视觉因果发现,利用因果图数据集和强化学习方法,实现对视觉因果关系的高效发现。

Comments project page: https://github.com/OpenCausaLab/CauSight

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20353 2025-12-02 math.PR cs.AI cs.LG stat.ML

A Unified Theory of $θ$-Expectations

θ-期望的统一理论

Qian Qi

机构 * Peking University, Beijing 100871, China(北京大学)

AI总结 本文提出一种基于混沌动力学的θ-期望理论,揭示了非凸随机控制问题的全新数学框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11842 2025-12-02 cs.CV cs.AI cs.LG

MoH: Multi-Head Attention as Mixture-of-Head Attention

MoH:多头注意力作为专家混合注意力

Peng Jin, Bo Zhu, Li Yuan, Shuicheng Yan

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University, Shenzhen, China(电子与计算机工程系,深圳研究生院,北京大学,深圳,中国) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国) School of AI for Science, Shenzhen Graduate School, Peking University, Shenzhen, China(科学人工智能学院,深圳研究生院,北京大学,深圳,中国) National University of Singapore, Singapore(新加坡国立大学,新加坡)

AI总结 MoH通过将注意力头视为专家,提升推理效率并优化性能,仅使用部分注意力头即可超越传统多头注意力。

Comments Accepted by ICML 2025, code: https://github.com/SkyworkAI/MoH

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00903 2025-12-02 cs.CV cs.RO

SwiftVLA: Unlocking Spatiotemporal Dynamics for Lightweight VLA Models at Minimal Overhead

SwiftVLA: 解锁轻量VLA模型的时空动态以最小的开销

Chaojun Ni, Cheng Chen, Xiaofeng Wang, Zheng Zhu, Wenzhao Zheng, Boyuan Wang, Tianrun Chen, Guosheng Zhao, Haoyun Li, Zhehao Dong, Qiang Zhang, Yun Ye, Yang Wang, Guan Huang, Wenjun Mei

机构 * GigaAI Peking University(北京大学) Moxin (Huzhou) Technology Co., Ltd.(摩西(湖州)科技有限公司) Tsinghua University(清华大学) X-Humanoid Project(X-人形项目)

AI总结 SwiftVLA通过4D视觉几何Transformer和Fusion Tokens提升轻量VLA模型的时空推理能力,实现高效且性能优异的视觉-语言-动作处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00553 2025-12-02 cs.LG cs.AI stat.ML

List Replicable Reinforcement Learning

可复制的强化学习

Bohan Zhang, Michael Chen, A. Pavan, N. V. Vinodchandran, Lin F. Yang, Ruosong Wang

机构 * Peking University(北京大学) Iowa State University(爱荷华州立大学) University of Nebraska–Lincoln(内布拉斯加大学林肯分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种可证明高效的表格RL算法,通过保证列表复杂度保持在多项式范围内,解决强化学习中的可复制性问题,并通过创新的规划策略和状态可达性测试机制提升算法稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00473 2025-12-02 cs.CV cs.AI

RealGen: Photorealistic Text-to-Image Generation via Detector-Guided Rewards

RealGen:通过检测器引导的奖励实现逼真文本到图像生成

Junyan Ye, Leiqi Zhu, Yuncheng Guo, Dongzhi Jiang, Zilong Huang, Yifan Zhang, Zhiyuan Yan, Haohuan Fu, Conghui He, Weijia Li

机构 * Shanghai AI Lab(上海人工智能实验室) Sun Yat-Sen University(中山大学) Nanjing University(南京大学) CUHK MMLab(香港中文大学多模态实验室) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 RealGen通过检测器引导的奖励机制提升文本到图像生成的真实感和细节,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20561 2025-12-02 cs.CV cs.CL

Does Understanding Inform Generation in Unified Multimodal Models? From Analysis to Path Forward

在统一多模态模型中,理解是否会影响生成?从分析到未来路径

Yuwei Niu, Weiyang Jin, Jiaqi Liao, Chaoran Feng, Peng Jin, Bin Lin, Zongjian Li, Bin Zhu, Weihao Yu, Li Yuan

机构 * Peking University(北京大学) Chongqing University(重庆大学) HKU MMLab(香港大学多模态实验室) PengCheng Laboratory(鹏城实验室)

AI总结 研究通过UniSandbox分析统一多模态模型中理解与生成之间的差距,发现显式链式思维和自训练方法能有效弥合这一差距,并揭示查询架构的潜在CoT特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02852 2025-12-02 eess.SY cs.RO cs.SY

Curvature-Constrained Vector Field for Motion Planning of Nonholonomic Robots

具有曲率约束的向量场用于非完整机器人运动规划

Yike Qiao, Xiaodong He, An Zhuo, Zhiyong Sun, Weimin Bao, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(先进制造与机器人学院,北京大学) School of Automation and Electrical Engineering, University of Science and Technology Beijing(自动化与电气工程学院,北京科技大学) China Aerospace Science and Technology Corporation(中国航天科技集团)

AI总结 本文提出了一种具有曲率约束的向量场方法,用于非完整机器人运动规划,通过共同开发向量场和控制律,实现目标配置的收敛与轨迹曲率的限制。

Comments IEEE T-RO accepted, 20 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07338 2025-12-02 cs.RO cs.AI

Delta-Triplane Transformers as Occupancy World Models

Delta-Triplane Transformers 作为占用世界模型

Haoran Xu, Peixi Peng, Guang Tan, Yiqian Chang, Yisen Zhao, Yonghong Tian

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(南方科技大学深圳校区智能系统工程学院) Peng Cheng Laboratory(鹏城实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 Delta-Triplane Transformers 通过紧凑的3D表示和增量预测策略,提升自动驾驶中占用世界模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17808 2025-12-02 cs.LG

Remote Sensing-Oriented World Model

面向遥感的世界模型

Yuxi Lu, Biao Wu, Zhidong Li, Kunqi Li, Chenya Huang, Huacan Wang, Qizhen Lan, Ronghao Chen, Ling Chen, Bin Liang

机构 * University of Technology Sydney (UTS)(悉尼技术大学) University of Chinese Academy of Sciences (UCAS)(中国科学院大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Peking University(北京大学)

AI总结 本文提出首个面向遥感的世界模型框架,通过RemoteBAGEL模型在RSWISE基准上实现空间推理的高效外推。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏