ConceptWeaver: Weaving Disentangled Concepts with Flow
ConceptWeaver: 通过流模型编织解耦的概念
机构 * Peking University(北京大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
AI总结 ConceptWeaver通过三阶段框架实现单次概念解耦,利用阶段感知优化策略学习语义偏移并在推理中注入,实现高保真合成与编辑。
高校专区
ConceptWeaver: 通过流模型编织解耦的概念
机构 * Peking University(北京大学) ; AMAP, Alibaba Group(阿里巴巴集团高德地图)
AI总结 ConceptWeaver通过三阶段框架实现单次概念解耦,利用阶段感知优化策略学习语义偏移并在推理中注入,实现高保真合成与编辑。
基于机器学习的高维矩阵估计
机构 * Advanced Institute of Information Technology, Peking University(北京大学先进信息技术研究院) ; Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) ; School of Statistics, Dongbei University of Finance and Economics(东北财经大学统计学院) ; PKU-Wuhan Institute for Artificial Intelligence(北大-武汉人工智能研究院) ; Xiangjiang Laboratory(湘江实验室) ; Guanghua School of Management, Peking University(北京大学光华管理学院)
AI总结 本文提出基于机器学习的高维矩阵估计方法,利用LADMM优化算法和神经网络改进估计精度与收敛速度,理论证明了其收敛性和加速效果,适用于高维协方差和精度矩阵估计。
MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Emory University(埃默里大学) ; Peking University(北京大学) ; Shandong University(山东大学)
AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。
Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)
$AutoDrive\text{-}P^3$:通过强化微调实现感知-预测-规划统一链式推理
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
AI总结 本文提出$AutoDrive\text{-}P^3$框架,通过结构化推理整合感知、预测和规划,引入$P^3\text{-}CoT$数据集和$P^3\text{-}GRPO$算法,实现端到端自动驾驶的高效决策与安全规划。
Comments Accepted at ICLR 2026 (International Conference on Learning Representations)
RAWIC:位深度自适应无损RAW图像压缩
机构 * School of Electronics, Peking University(北京大学电子学院) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 RAWIC提出一种位深度自适应的无损RAW图像压缩框架,通过转换Bayer数据并自适应位深度估计,实现对不同相机和位深度的高效压缩,实验表明其在JPEG-XL基础上平均提升7.7%的压缩率。
Comments Accepted by ICME 2026
Heddle:一种用于代理强化学习 rollout 的分布式编排系统
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; Independent Researcher(独立研究员)
AI总结 Heddle通过轨迹中心化设计优化代理rollout执行的时机、地点和方式,解决长尾轨迹生成中的队列延迟、干扰开销和单位令牌时间问题,提升rollout吞吐量。
基于八叉树的学得点云几何压缩:一种有损视角
机构 * School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)
AI总结 本文提出针对不同点云的有损压缩方法,针对物体点云改进叶节点压缩,针对LiDAR点云提出变率控制方法,实验显示方法在物体点云上表现更优,在LiDAR点云上实现约1%的比特误差。
PointCNN++: 针对原始点的高效卷积
机构 * Peking University(北京大学) ; Ant Group(蚂蚁集团) ; AMAP(高德地图)
AI总结 PointCNN++提出了一种新的架构设计,通过将稀疏卷积从体素扩展到点,解决了精度与性能之间的权衡问题,实现了高保真和高效3D学习。
FlipVQA: 通过教科书到知识合成实现多模态指令微调的扩展
机构 * Peking University(北京大学) ; Zhongguancun Academy(中关村学院)
AI总结 本文提出FlipVQA-Miner自动化流程,解决OCR文档中的长距离逻辑依赖和跨页断续问题,构建了包含83K问答对的FlipVQA-83K数据集,在保持高结构保真度的同时节省50倍成本,提升了模型推理能力和跨领域泛化能力。
SciEGQA:一个用于科学证据基础问题回答与推理的数据集
机构 * Beihang University(北京航空航天大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学) ; Baidu Inc.(百度公司)
AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。
Comments 8 pages, 4 figures, 3 tables
Goal-VLA: 图像生成视觉语言模型作为对象中心世界模型,赋能零样本机器人操作
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; The HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学数据科学研究院) ; Yuanpei College, Peking University(北京大学元培学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
AI总结 本文提出Goal-VLA框架,利用图像生成视觉语言模型生成目标状态,通过对象状态表示分离高阶与低阶策略,提升机器人操作的泛化能力。
ProgressVLA: 用于视觉-语言机器人操控的进展引导扩散策略
机构 * Peking University(北京大学) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
AI总结 本文提出ProgressVLA模型,通过鲁棒的进展估计和可微进展引导方法提升机器人操控任务的成功率和泛化能力。
PRBench: 物理研究中的端到端论文复现
机构 * School of Physics, Peking University(北京大学物理学院) ; Beijing Computational Science Research Center(北京计算科学研究中心)
AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。
Comments 17 pages, 3 figures
RTLSeek: 通过多阶段多样性导向强化学习提升基于LLM的RTL生成
机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; CASTEST Co., Ltd.(中科芯测科技有限公司)
AI总结 RTLSeek通过多阶段多样性导向强化学习提升基于LLM的RTL生成,结合专家知识与EDA反馈,改进RTL的正确性和多样性,实验表明其在RTLLM基准上优于现有方法。
Comments 8 pages, 6 figures
通过空间和时间监听器可视化机器学习模型
机构 * School of Computer Science & Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Institute of Medical Technology, Peking University Health Science Center and National Institute of Health Data Science, Peking University(北京大学医学部医学技术研究院与北京大学健康数据科学国家研究所) ; School of Software, Beihang University(北京航空航天大学软件学院) ; National University of Singapore(新加坡国立大学) ; State Key Laboratory of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)
AI总结 本文提出一种以模型为中心的两阶段框架,通过抽象监听器捕捉模型的空间和时间行为,并将其连接到经典信息可视化流程,分析显示可视化模型结果、定量/名义数据类型和统计图表是主要关注点。
通过因果发现和双模态安全子空间投影诊断和修复视觉-语言模型中的不安全通道
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; Peking University(北京大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学)
AI总结 本文提出CARE框架,通过因果分析和双模态安全子空间投影修复视觉-语言模型中的不安全通道,提升安全性而不影响多模态能力。
Comments Accepted by CVPR 2026 main conference
多领域结果上的最大化学习个性化治疗效应
机构 * Department of Biostatistics, Columbia Mailman School of Public Health(哥伦比亚大学梅尔曼公共卫生学院生物统计系) ; Department of Biostatistics, Peking University Health Science Center(北京大学医学部生物统计系) ; Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心)
AI总结 本文提出DRIFT框架,通过潜在因子表示和对抗学习,从高维数据中稳健估计个性化治疗效应,提升对未测量但临床相关领域的泛化能力。
破坏层次推理:多模态推理模型中地理隐私的对抗保护
机构 * Nanyang Technological University(南洋理工大学) ; Peking University(北京大学) ; Institute of Science Tokyo(东京科学大学) ; Alibaba Group(阿里巴巴集团)
AI总结 本文提出ReasonBreak框架,通过概念感知扰动破坏多模态推理模型中的层次推理,利用GeoPrivacy-6K数据集验证其在提升地理隐私保护效果上的优势。
Comments ICLR 2026
SEEC:基于分割的多熵模型用于学习无损图像压缩
机构 * School of Electronics, Peking University(北京大学电子学院)
AI总结 SEEC通过分割指导多熵模型选择,提升不同语义区域的概率分布估计精度,实现更优的无损图像压缩性能。
Comments Accpeted by ICME 2026
用卫星影像和生成式AI展望全球城市发展
机构 * Singapore–MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工学院研究与技术联盟中心) ; Department of Urban Planning, Tsinghua University(清华大学城市规划系) ; Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) ; College of Urban and Environmental Sciences, Peking University(北京大学城市与环境学院) ; Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) ; Stanford Institute for Human-Centered Artificial Intelligence, Stanford University(斯坦福大学以人为本人工智能研究所)
AI总结 本文提出一种多模态生成式AI框架,通过整合提示和地理空间控制,生成全球500个最大都会区的高保真城市卫星影像,支持可持续城市发展和场景规划。
脑启发式多模态脉冲神经网络用于图像-文本检索
机构 * Hubei Key Laboratory of Transportation Internet of Things, Wuhan University of Technology(武汉理工大学交通物联网湖北省重点实验室) ; State Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理全国重点实验室)
AI总结 本文提出脑启发式跨模态脉冲融合网络(CMSF),用于图像-文本检索,通过融合单模态特征提升多模态表示,实现高效检索与低能耗。