arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-01-27 至 2026-01-27 共收录 9
2601.18524 2026-01-27 cs.LG

From Human Labels to Literature: Semi-Supervised Learning of NMR Chemical Shifts at Scale

从人类标签到文献:大规模半监督学习NMR化学位移

Yongqi Jin, Yecheng Wang, Jun-jie Wang, Rong Zhu, Guolin Ke, Weinan E

机构 * School of Mathematical Sciences, Peking University, Beijing, China(北京大学数学科学学院) Center for Machine Learning Research, Peking University, Beijing, China(北京大学机器学习研究中心) AI for Science Institute, Beijing, China(人工智能科学研究院) College of Chemistry and Molecular Engineering, Peking University, Beijing, China(北京大学化学与分子工程学院)

AI总结 本文提出了一种基于大规模未标记文献光谱的半监督学习方法,用于预测NMR化学位移,实现了更高的准确性和鲁棒性,并首次捕捉了溶剂效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18323 2026-01-27 cs.RO

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09017 2026-01-27 cs.LG cs.AI

Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers

基于价值状态门控的注意力机制用于缓解Transformer中的极端令牌现象

Rui Bu, Haofeng Zhong, Wenzheng Chen, Yangyan Li

机构 * Ant Group(蚂蚁集团) WICT, Peking University(北京大学信息学院)

AI总结 本文提出价值状态门控注意力机制,通过直接打破注意力与价值状态的循环,有效缓解Transformer中的极端令牌现象,提升模型性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15871 2026-01-27 cs.CV cs.MM

Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval

通过视图检索实现3D高斯体的零样本视觉定位

Liwei Liao, Xufeng Li, Xiaoyun Zheng, Boning Liu, Feng Gao, Ronggang Wang

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) City University of Hongkong(香港城市大学)

AI总结 本文提出GVR框架,通过视图检索将3DVG转化为2D检索任务,实现零样本3DGS的视觉定位,无需每场景训练和3D标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02567 2026-01-27 cs.CV

Unified Multimodal Understanding and Generation Models: Advances, Challenges, and Opportunities

统一的多模态理解和生成模型:进展、挑战与机遇

Shanshan Zhao, Xinjie Zhang, Jintao Guo, Jiakui Hu, Lunhao Duan, Minghao Fu, Yong Xien Chng, Guo-Hua Wang, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang

机构 * Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Nanjing University(南京大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文探讨了多模态理解和生成模型的统一进展、挑战与机遇,分析了不同架构范式及未来研究方向。

Comments In this version, we incorporate new papers (after Aug. 2025), datasets, and benchmarks. This work is still in progress; Github project: https://github.com/AIDC-AI/Awesome-Unified-Multimodal-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17673 2026-01-27 cs.CV cs.AI

Uni-RS: A Spatially Faithful Unified Understanding and Generation Model for Remote Sensing

Uni-RS: 一种用于遥感的具有空间忠实性的统一理解和生成模型

Weiyu Zhang, Yuan Hu, Yong Li, Yu Liu

机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学)

AI总结 Uni-RS通过空间布局规划、空间感知查询监督和图像描述空间布局变化,提升遥感文本到图像生成的空间忠实性,同时保持多模态理解任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17449 2026-01-27 cs.LG

DREAM: Dual-Standard Semantic Homogeneity with Dynamic Optimization for Graph Learning with Label Noise

DREAM: 图学习中带标签噪声的双标准语义同质性与动态优化

Yusheng Zhao, Jiaye Xie, Qixin Zhang, Weizhi Zhang, Xiao Luo, Zhiping Xiao, Philip S. Yu, Ming Zhang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University-Anker Embodied AI Lab, Peking University(国家多媒体信息处理重点实验室,计算机科学学院,北京大学-安ker具身AI实验室,北京大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Department of Computer Science, University of Illinois Chicago(计算机科学系,伊利诺伊大学香槟分校) Paul G. Allen School of Computer Science and Engineering, University of Washington(保罗·G·阿伦计算机科学与工程学院,华盛顿大学) Department of Statistics, University of Wisconsin–Madison(统计系,威斯康星大学麦迪逊分校)

AI总结 DREAM通过双标准策略和动态优化解决图学习中标签噪声问题,提升图结构中节点可靠性与关系信息的利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18624 2026-01-27 cs.CV

GeneMAN: Generalizable Single-Image 3D Human Reconstruction from Multi-Source Human Data

GeneMAN: 从多源人类数据中通用的单图像3D人体重建

Wentao Wang, Hang Ye, Fangzhou Hong, Xue Yang, Jianfu Zhang, Yizhou Wang, Ziwei Liu, Liang Pan

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Nanyang Technological University(南洋理工大学) SAIS & SCS, Shanghai Jiao Tong University(上海交通大学SAIS与SCS)

AI总结 GeneMAN通过多源高质量数据集和深度学习方法,实现从单张图像到高保真3D人体的通用重建。

Comments Accepted by NeurIPS 2025; Project page: https://roooooz.github.io/GeneMAN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17027 2026-01-27 cs.CV cs.AI

Scientific Image Synthesis: Benchmarking, Methodologies, and Downstream Utility

科学图像合成:基准测试、方法论与下游应用

Honglin Lin, Chonghan Qin, Zheng Liu, Qizhi Pei, Yu Li, Zhanping Zhong, Xin Gao, Yanfeng Wang, Conghui He, Lijun Wu

机构 * Shanghai Jiao Tong University(上海交通大学) OpenDataLab, Shanghai Artificial Intelligence Laboratory(OpenDataLab,上海人工智能实验室) The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 本文提出ImgCoder框架和SciGenBench基准,通过逻辑驱动方法提升科学图像生成的结构精度,并展示微调LMMs在科学图像上的效果,验证了高保真合成在多模态推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏