$R^2$-Mesh: Reinforcement Learning Powered Mesh Reconstruction via Geometry and Appearance Refinement
$R^2$-Mesh:基于几何和外观细化的强化学习驱动网格重建
机构 * Peking University(北京大学)
AI总结 $R^2$-Mesh通过强化学习结合NeRF渲染和在线视角选择,提升网格重建的几何和外观精度。
高校专区
$R^2$-Mesh:基于几何和外观细化的强化学习驱动网格重建
机构 * Peking University(北京大学)
AI总结 $R^2$-Mesh通过强化学习结合NeRF渲染和在线视角选择,提升网格重建的几何和外观精度。
MathScape:在现实数学情境中评估多模态大语言模型
机构 * Peking University(北京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nankai University(南开大学) ; Beijing Institute of Technology(北京理工大学) ; Baichuan Inc.(百度文心)
AI总结 MathScape是一个评估多模态大语言模型在现实数学情境中推理能力的新基准,揭示了现有模型在现实任务中的局限性。
ApET:基于近似误差的令牌压缩用于高效的视觉语言模型
机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) ; Peng Cheng Laboratory(鹏城实验室) ; University of Chinese Academy of Sciences(中国科学院大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Peking University(北京大学)
AI总结 ApET通过近似误差指导的令牌压缩,在不使用注意力机制的情况下高效压缩视觉语言模型的令牌预算,提升推理效率。
Comments CVPR2026
三子空间解耦用于多模态情感分析
机构 * Fudan University(复旦大学) ; Peking University(北京大学) ; University of Macau(澳门大学)
AI总结 本文提出三子空间解耦框架,通过分解多模态特征为公共、子模态共享和私人子空间,提升多模态情感分析的性能和鲁棒性。
Comments This study has been Accepted by CVPR 2026
基于接近性的多轮优化:LLM代理训练中的实用信用分配
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Lanzhou University(兰州大学) ; Tencent Inc.(腾讯公司) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 ProxMO通过动态调整梯度强度和连续语义加权,提升LLM代理在多轮训练中的信用分配效率与稳定性。
如何分配,如何学习?动态回放分配与优势调节用于策略优化
机构 * Meituan(美团) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Peking University(北京大学)
AI总结 DynaMO通过动态回放分配和梯度感知优势调节,优化策略学习中的资源分配与梯度更新稳定性,提升数学推理任务的性能。
CRCC: 基于对比的跨受试者和跨站点表示学习
机构 * Tsinghua Laboratory of Brain(清华大学脑科学实验室) ; School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Weixian College, Tsinghua University(清华大学魏先学院) ; School of Artificial Intelligence, Beijing University of Posts(北京邮电大学人工智能学院) ; School of Computer Science(计算机科学学院) ; Technology, Northwestern Polytechnical University, Xi'an, China(技术,西北工业大学,西安,中国) ; Beijing Huilongguan Hospital, Capital Medical University(北京回龙观医院,首都医科大学) ; Peking University Huilongguan Clinical Medical School(北京大学回龙观临床医学院)
AI总结 CRCC通过对比学习和对抗优化提升跨站点EEG表示学习的泛化能力,实现10.7个百分点的准确率提升。
Comments First edition
DesignAsCode:在图形设计生成中弥合结构可编辑性与视觉保真度
机构 * School of Software and Microelectronics, Peking University, Beijing, China(软件与微电子学院,北京大学,北京,中国) ; Microsoft(微软公司) ; ShanghaiTech University, Shanghai, China(上海交通大学,上海,中国)
AI总结 DesignAsCode 通过 HTML/CSS 程序化合成方法,实现了图形设计生成中结构可编辑性与视觉保真度的平衡,提升了设计质量和生成能力。
快速追上,后期切换:通过函数缩放定律进行最优批量大小调度
机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) ; Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) ; Meituan, Beijing(美团(北京)) ; AI for Science Institute, Beijing(北京人工智能科学研究院)
AI总结 本文通过函数缩放定律揭示了大规模深度学习中最优批量大小调度的理论机制,表明在困难任务中后期切换大批次可提升效率并减少数据消耗。
Comments 34 pages, accepted by ICLR 2026 as a conference paper
基于视频扩散先验的生成神经视频压缩
机构 * School of Information and Communication Engineering, Communication University of China(信息与通信工程学院,通信大学) ; School of Computer Science, Peking University(计算机学院,北京大学)
AI总结 GNVC-VD通过结合视频扩散先验和序列级去噪,实现了高效的生成神经视频压缩,显著减少了闪烁伪影并提升了感知质量。
Comments accept by CVPR2026
通过动态专家跳过加速混合专家多模态大语言模型
机构 * Hong Kong University of Science and Technology(香港科技大学) ; Beihang University(北航) ; Peking University(北京大学)
AI总结 MoDES通过动态专家跳过机制提升多模态大语言模型的推理效率和准确性。
Comments Accepted by CVPR 2026
PhoenixCodec: 镇压神经语音编码以应对极端低资源场景
机构 * Audio Innovation Technology Department, Anker Inc(安ker公司音频创新技术部) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; Peking University(北京大学)
AI总结 PhoenixCodec通过优化架构和训练策略,在极端低资源条件下实现了高效的语音编码与解码,尤其在1 kbps速率下表现出色。
Comments Accepted by ICASSP 2026; 5 pages, 1 figure, 4 tables
DEFNet:基于多任务的深度证据融合网络用于盲图像质量评估
机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)教育部) ; School of Computer Science, Peking University(计算机学院(北京大学))
AI总结 DEFNet通过多任务优化和证据学习改进盲图像质量评估,提升鲁棒性和泛化能力。
MoVieS: 一秒钟内基于运动感知的4D动态视角合成
机构 * Peking University(北京大学) ; ByteDance(字节跳动) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 MoVieS通过一秒钟内从单目视频重建4D动态场景,实现外观、几何和运动的统一建模,并支持多种零样本应用。
Comments Project page: https://chenguolin.github.io/projects/MoVieS; Accepted to CVPR 2026
利用时空对比学习街道视图表示
机构 * Institute of Remote Sensing and Geographic Information System, School of Earth and Space Sciences, Peking University(遥感与地理信息系统研究所,地球与空间科学学院,北京大学) ; Department of Civil and Environmental Engineering, The Hong Kong University of Science and Technology(土木与环境工程系,香港科学与技术大学) ; SEAI Lab, Department of Geography and the Environment, University of Texas at Austin(SEAI实验室,地理与环境系,德克萨斯大学奥斯汀分校)
AI总结 本文提出一种基于时空对比学习的街道视图表示学习方法,以提升城市环境相关下游任务的性能。
RoboMIND:机器人操作多躯体智能规范数据集基准
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
AI总结 RoboMIND是一个大规模多躯体机器人操作数据集,包含107万条演示轨迹和5000条失败示例,用于提升机器人模仿学习和多任务性能。
Comments 21 pages, 17 figures, Robotics: Science and Systems 2025
Journal ref Robotics: Science and Systems XXI (RSS 2025)
通过自监督学习从不完美示范中学习用于机器人操作
机构 * Syracuse University(苏利文大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; Peking University(北京大学) ; Shanghai University(上海大学)
AI总结 本文提出SSDF框架,通过自监督学习利用不完美示范数据提升机器人操作任务的性能。
Comments 8 pages, 4 figures
Journal ref 2025 IEEE International Conference on Robotics and Automation (ICRA)
空间-时间状态传播自回归模型用于4D物体生成
机构 * Macau University of Science and Technology(澳门科技大学) ; TeleAI ; Peking University(北京大学)
AI总结 4DSTAR通过空间-时间状态传播自回归模型和4D VQ-VAE生成具有时间-空间一致性的4D物体,实现高质量的4D物体生成。
UFO: 解锁超高效的量化隐私推理与协议和算法联合优化
机构 * Institute for Artificial Intelligence, Peking University, China(人工智能研究院,北京大学) ; School of Software and Microelectronics, Peking University, China(软件与微电子学院,北京大学) ; School of Integrated Circuits, Peking University, China(集成电路学院,北京大学) ; Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院)
AI总结 UFO通过联合优化协议和算法,解决了隐私推理中卷积层的通信和精度问题,实现高效量化推理。
ConfSpec:通过置信度门控验证实现高效的步骤级推测推理
机构 * Peking University(北京大学) ; ScitiX AI
AI总结 ConfSpec通过置信度门控验证框架,在保持准确性的同时,实现高效步骤级推测推理,达到2.24倍的端到端加速。
TestExplora: 通过仓库级测试生成对LLMs进行主动bug发现的基准测试
机构 * Microsoft(微软公司) ; School of ECE, Peking University(北京大学电子工程学院) ; Tsinghua University(清华大学) ; Chinese Academy of Sciences(中国科学院)
AI总结 TestExplora通过仓库级测试生成评估LLMs在主动bug发现中的能力,揭示了当前模型在复杂交互和代理探索方面的不足。
面向一致视频世界模型的几何感知旋转位置嵌入
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、BNRist中心、THBI实验室、清华-博世联合机器学习中心、清华大学) ; Gaoling School of Artificial Intelligence, Renmin University of China(北京人民大学人工智能学院) ; National University of Singapore(新加坡国立大学) ; Peking University(北京大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)
AI总结 本文提出ViewRope和几何感知帧稀疏注意力,通过引入相机射线方向提升视频世界模型的长期一致性与效率。