arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-03-31 至 2026-03-31 共收录 21
2603.28493 2026-03-31 cs.CV

ConceptWeaver: Weaving Disentangled Concepts with Flow

ConceptWeaver: 通过流模型编织解耦的概念

Jintao Chen, Aiming Hao, Xiaoqing Chen, Chengyu Bai, Chubin Chen, Yanxun Li, Jiahong Wu, Xiangxiang Chu, Shanghang Zhang

机构 * Peking University(北京大学) AMAP, Alibaba Group(阿里巴巴集团高德地图)

AI总结 ConceptWeaver通过三阶段框架实现单次概念解耦,利用阶段感知优化策略学习语义偏移并在推理中注入,实现高保真合成与编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28346 2026-03-31 cs.LG stat.ML

Machine Learning-Assisted High-Dimensional Matrix Estimation

基于机器学习的高维矩阵估计

Wan Tian, Hui Yang, Zhouhui Lian, Lingyue Zhang, Yijie Peng

机构 * Advanced Institute of Information Technology, Peking University(北京大学先进信息技术研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) School of Statistics, Dongbei University of Finance and Economics(东北财经大学统计学院) PKU-Wuhan Institute for Artificial Intelligence(北大-武汉人工智能研究院) Xiangjiang Laboratory(湘江实验室) Guanghua School of Management, Peking University(北京大学光华管理学院)

AI总结 本文提出基于机器学习的高维矩阵估计方法,利用LADMM优化算法和神经网络改进估计精度与收敛速度,理论证明了其收敛性和加速效果,适用于高维协方差和精度矩阵估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28120 2026-03-31 cs.CV

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度

Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Peking University(北京大学) Shandong University(山东大学)

AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28116 2026-03-31 cs.RO cs.CV

$AutoDrive\text{-}P^3$: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)

AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。

Comments Accepted at ICLR 2026 (International Conference on Learning Representations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28105 2026-03-31 cs.CV

RAWIC: Bit-Depth Adaptive Lossless Raw Image Compression

RAWIC:位深度自适应无损RAW图像压缩

Chunhang Zheng, Tongda Xu, Mingli Xie, Yan Wang, Dou Li

机构 * School of Electronics, Peking University(北京大学电子学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 RAWIC提出一种位深度自适应的无损RAW图像压缩框架,通过转换Bayer数据并自适应位深度估计,实现对不同相机和位深度的高效压缩,实验表明其在JPEG-XL基础上平均提升7.7%的压缩率。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28101 2026-03-31 cs.LG

Heddle: A Distributed Orchestration System for Agentic RL Rollout

Heddle:一种用于代理强化学习 rollout 的分布式编排系统

Zili Zhang, Yinmin Zhong, Chengxu Yang, Chao Jin, Bingyang Wu, Xinming Wei, Yuliang Liu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Independent Researcher(独立研究员)

AI总结 Heddle通过轨迹中心化设计优化代理rollout执行的时机、地点和方式,解决长尾轨迹生成中的队列延迟、干扰开销和单位令牌时间问题,提升rollout吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28095 2026-03-31 cs.CV

Octree-based Learned Point Cloud Geometry Compression: A Lossy Perspective

基于八叉树的学得点云几何压缩:一种有损视角

Kaiyu Zheng, Wei Gao, Huiming Zheng

机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 本文提出针对不同点云的有损压缩方法,针对物体点云改进叶节点压缩,针对LiDAR点云提出变率控制方法,实验显示方法在物体点云上表现更优,在LiDAR点云上实现约1%的比特误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23227 2026-03-31 cs.CV

PointCNN++: Performant Convolution on Native Points

PointCNN++: 针对原始点的高效卷积

Lihan Li, Haofeng Zhong, Rui Bu, Mingchao Sun, Wenzheng Chen, Baoquan Chen, Yangyan Li

机构 * Peking University(北京大学) Ant Group(蚂蚁集团) AMAP(高德地图)

AI总结 PointCNN++提出了一种新的架构设计,通过将稀疏卷积从体素扩展到点,解决了精度与性能之间的权衡问题,实现了高保真和高效3D学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16216 2026-03-31 cs.AI cs.LG

FlipVQA: Scaling Multi-modal Instruction Tuning via Textbook-to-Knowledge Synthesis

FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展

Zhen Hao Wong, Jingwen Deng, Yuzhao Wang, Wenkai Yu, Jihao Huang, Runming He, Chengyu Shen, Hao Liang, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院)

AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23919 2026-03-31 cs.RO

Goal-VLA: Image-Generative VLMs as Object-Centric World Models Empowering Zero-shot Robot Manipulation

Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作

Haonan Chen, Jingxiang Guo, Bangjun Wang, Tianrui Zhang, Xuchuan Huang, Boren Zheng, Yiwen Hou, Chenrui Tie, Jiajun Deng, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) Yuanpei College, Peking University(北京大学元培学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27670 2026-03-31 cs.RO cs.AI

ProgressVLA: Progress-Guided Diffusion Policy for Vision-Language Robotic Manipulation

ProgressVLA: 用于视觉-语言机器人操控的进展引导扩散策略

Hongyu Yan, Qiwei Li, Jiaolong Yang, Yadong Mu

机构 * Peking University(北京大学) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 本文提出ProgressVLA模型,通过鲁棒的进展估计和可微进展引导方法提升机器人操控任务的成功率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27646 2026-03-31 cs.CL hep-lat hep-ph physics.comp-ph physics.optics

PRBench: End-to-end Paper Reproduction in Physics Research

PRBench: 物理研究中的端到端论文复现

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi Lv, Zihan Mo, Yadi Niu, Yiyang Peng, Yu Tian, Yili Wang, Ziyu Wang, Zi-Yu Wang, Jiashen Wei, Liuheng Wu, Aoran Xue, Leyi Yang, Guanglu Yuan, Xiarui Zhan, Jingjun Zhang, Zifan Zheng, Pengfei Liu, Linrui Zhen, Kaiyang Li, Qichang Li, Ziheng Zhou, Guo-En Nian, Yunwei Xiao, Qing-Hong Cao, Linjie Dai, Xu Feng, Peng Gao, Ying Gu, Chang Liu, Jia Liu, Ming-xing Luo, Yan-Qing Ma, Liang-You Peng, Huichao Song, Shufeng Wang, Chenxu Wang, Tao Wang, Yi-Nan Wang, Chengyin Wu, Pengwei Zhao, Hua Xing Zhu

机构 * School of Physics, Peking University(北京大学物理学院) Beijing Computational Science Research Center(北京计算科学研究中心)

AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27630 2026-03-31 cs.AR cs.LG

RTLSeek: Boosting the LLM-Based RTL Generation with Multi-Stage Diversity-Oriented Reinforcement Learning

RTLSeek: 通过多阶段多样性导向强化学习提升基于LLM的RTL生成

Xinyu Zhang, Zhiteng Chao, Yonghao Wang, Bin Sun, Tianyun Ma, Tianmeng Yang, Jianan Mu, Jing Justin Ye, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) CASTEST Co., Ltd.(中科芯测科技有限公司)

AI总结 RTLSeek通过多阶段多样性导向强化学习提升基于LLM的RTL生成,结合专家知识与EDA反馈,改进RTL的正确性和多样性,实验表明其在RTLLM基准上优于现有方法。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27527 2026-03-31 cs.LG

Visualization of Machine Learning Models through Their Spatial and Temporal Listeners

通过空间和时间监听器可视化机器学习模型

Siyu Wu, Lei Shi, Lei Xia, Cenyang Wu, Zipeng Liu, Yingchaojie Feng, Liang Zhou, Wei Chen

机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) School of Software, Beihang University(北京航空航天大学软件学院) National University of Singapore(新加坡国立大学) State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27240 2026-03-31 cs.CV cs.AI

Diagnosing and Repairing Unsafe Channels in Vision-Language Models via Causal Discovery and Dual-Modal Safety Subspace Projection

通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道

Jinhu Fu, Yihang Lou, Qingyi Si, Shudong Zhang, Yan Bai, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huawei Technologies Ltd.(华为技术有限公司) Peking University(北京大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。

Comments Accepted by CVPR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27114 2026-03-31 cs.LG stat.ME

Maximin Learning of Individualized Treatment Effect on Multi-Domain Outcomes

多领域结果上的最大化学习个性化治疗效应

Yuying Lu, Wenbo Fei, Yuanjia Wang, Molei Liu

机构 * Department of Biostatistics, Columbia Mailman School of Public Health(哥伦比亚大学梅尔曼公共卫生学院生物统计系) Department of Biostatistics, Peking University Health Science Center(北京大学医学部生物统计系) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心)

AI总结 本文提出DRIFT框架,通过潜在因子表示和对抗学习,从高维数据中稳健估计个性化治疗效应,提升对未测量但临床相关领域的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08503 2026-03-31 cs.CV cs.AI

Disrupting Hierarchical Reasoning: Adversarial Protection for Geographic Privacy in Multimodal Reasoning Models

破坏层次推理:多模态推理模型中地理隐私的对抗保护

Jiaming Zhang, Che Wang, Yang Cao, Longtao Huang, Wei Yang Bryan Lim

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Institute of Science Tokyo(东京科学大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07704 2026-03-31 cs.CV

SEEC: Segmentation-Assisted Multi-Entropy Models for Learned Lossless Image Compression

SEEC:基于分割的多熵模型用于学习无损图像压缩

Chunhang Zheng, Zichang Ren, Dou Li

机构 * School of Electronics, Peking University(北京大学电子学院)

AI总结 SEEC通过分割指导多熵模型选择,提升不同语义区域的概率分布估计精度,实现更优的无损图像压缩性能。

Comments Accpeted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26831 2026-03-31 cs.CV cs.AI

Envisioning global urban development with satellite imagery and generative AI

用卫星影像和生成式AI展望全球城市发展

Kailai Sun, Yuebing Liang, Mingyi He, Yunhan Zheng, Alok Prakash, Shenhao Wang, Jinhua Zhao, Alex "Sandy'' Pentland

机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) Department of Urban Planning, Tsinghua University(清华大学城市规划系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)

AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26787 2026-03-31 cs.CV

Brain-Inspired Multimodal Spiking Neural Network for Image-Text Retrieval

脑启发式多模态脉冲神经网络用于图像-文本检索

Xintao Zong, Xian Zhong, Wenxuan Liu, Jianhao Ding, Zhaofei Yu, Tiejun Huang

机构 * Hubei Key Laboratory of Transportation Internet of Things, Wuhan University of Technology(武汉理工大学交通物联网湖北省重点实验室) State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理全国重点实验室)

AI总结 本文提出脑启发式跨模态脉冲融合网络(CMSF),用于图像-文本检索,通过融合单模态特征提升多模态表示,实现高效检索与低能耗。

详情

展开后加载摘要…

URL PDF HTML 收藏