arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-08-25 至 2026-08-25 共收录 14
2608.16647 2026-08-25 cs.CL 版本更新

Every Coin Has Two Sides: On the Dual Nature of Generalization in On-Policy Distillation of Large Language Models

硬币皆有两面:关于大型语言模型的策略内蒸馏中泛化的双重性质

Zhaoyi Li, Deyang Kong, Yuan Wei, Evan Yang, Ranran Shen, Mahardika Krisna Ihsani, Ming Yang, Wei Zhang, Chuan Hao, Jian Yang, Ran Tao, Bryan Dai, Shikun Zhang, Wei Ye, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) IQuest Research(IQuest研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Zhejiang University(浙江大学)

AI总结 本研究探究大型语言模型策略内蒸馏(OPD)的泛化特性,发现其迁移教师推理行为而非答案,同源配对泛化性强,异源配对适配性有限,多教师组合存在能力跷跷板效应,为诊断多教师OPD提供了视角。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14935 2026-08-25 cs.CV 版本更新

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16673 2026-08-25 cs.RO cs.AI cs.LG 版本更新

When Should a Robot Think? Resource-Aware Reasoning via Reinforcement Learning for Embodied Robotic Decision-Making

机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用

Jun Liu, Pu Zhao, Zhenglun Kong, Xuan Shen, Peiyan Dong, Fan Yang, Lin Cui, Hao Tang, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Gaowen Liu, Yanzhi Wang, Dong Huang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Northeastern University(东北大学) Harvard University(哈佛大学) Cornell University(康奈尔大学) MIT(麻省理工学院) Fujitsu Research of America(美国富士通研究) Tsinghua University(清华大学) Peking University(北京大学) University of Georgia(佐治亚大学) Florida International University(佛罗里达国际大学) EmbodyX Inc(EmbodyX公司) Cisco Systems(思科系统)

AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25698 2026-08-25 cs.LG cs.AI 版本更新

How Should LLMs Consume High-Quality Data? Optimal Data Scheduling via Quality-Aware Functional Scaling Laws

LLM应如何消费高质量数据?通过质量感知的功能缩放定律实现最优数据调度

Zhitao Zhu, Xili Wang, Shizhe Wu, Jiawei Fu, Xiaoqing Liu

机构 * Peking University(北京大学) Meituan(美团)

AI总结 本文通过引入数据质量维度扩展功能缩放定律,解析求解了联合数据质量和批次大小调度问题,揭示了高质量数据的双重角色,并提出了Drop-Stable-Rampup调度策略,在15B MoE模型上相比WSD和余弦衰减分别提升平均准确率+1.70和+2.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08875 2026-08-25 cs.AI cs.SI physics.soc-ph 版本更新

Online design of dynamic networks

动态网络的在线设计

Duo Wang, Andrea Araldo, Mounim El Yacoubi

机构 * Peking University(北京大学) Institut Polytechnique de Paris(巴黎理工学院)

AI总结 本文提出一种基于蒙特卡洛树搜索的滚动时间规划方法,用于动态网络的在线设计,通过实时调整公交线路以适应随机需求,提升系统性能。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22225 2026-08-25 cs.CV cs.AI 版本更新

ExtrinSplat: Decoupling Geometry and Semantics for Open-Vocabulary Understanding in 3D Gaussian Splatting

ExtrinSplat:解耦几何与语义以实现3D高斯散射中的开放词汇理解

Jiayu Ding, Xinpeng Liu, Zhiyi Pan, Shiqiang Long, Ge Li

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Guangdong Bohua UHD Innovation Center Co., Ltd.(广东博华超高清创新中心有限公司)

AI总结 ExtrinSplat通过解耦几何与语义,利用视觉语言模型生成轻量文本假设,提升3D高斯散射中开放词汇物体选择和语义分割的性能和效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13095 2026-08-25 cs.CV cs.LG 版本更新

ADHint: Adaptive Hints with Difficulty Priors for Reinforcement Learning

ADHint: 基于难度先验的自适应提示用于强化学习

Feng Zhang, Zezhong Tan, Xinhong Ma, Ziqiang Dong, Xi Leng, Jianfei Zhao, Xin Sun, Yang Yang, Guanjun Jiang

机构 * Alibaba Group(阿里巴巴集团) Beijing Institute of Technology(北京理工大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhongguancun Academy(中关村学院)

AI总结 ADHint通过整合难度先验,改进强化学习中的探索与模仿平衡,提升推理能力和分布外泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09555 2026-08-25 cs.CL 版本更新

Adaptive Test-Time Compute Allocation for Block Diffusion Language Models in Complex Reasoning

推进块扩散语言模型用于测试时间扩展

Yi Lu, Deyang Kong, Jianing Wang, Linsen Guo, Xue Wang, Qi Guo, Tao Gui, Xuanjing Huang, Wei Ye, Shikun Zhang, Wei Wang

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文提出BACD和TCCF方法,提升块扩散语言模型在测试时间扩展中的推理效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00612 2026-08-25 cs.CL 版本更新

Lookahead-then-Verify: Reliable Constrained Decoding for Diffusion LLMs under Context-Free Grammars

前瞻性验证:用于扩散大语言模型在无上下文自由文法下的可靠约束解码

Yitong Zhang, Yongmin Li, Yuetong Liu, Jia Li, Xiaoran Jia, Zherui Li, Ge Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) School of Computer Science, Peking University(北京大学计算机学院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 LAVE通过并行预测标记分布实现可靠的约束解码,提升扩散大语言模型在上下文无关文法下的生成准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11250 2026-08-25 cs.CR cs.CV 版本更新

Environmental Injection Attacks against GUI Agents in Realistic Dynamic Environments

针对现实动态环境中的GUI代理的环境注入攻击

Yitong Zhang, Ximo Li, Liyi Cai, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 本文提出Chameleon框架,通过LLM驱动的环境模拟和注意力黑洞机制,有效暴露GUI代理在动态环境中的隐藏漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18484 2026-08-25 cs.CV cs.CL 版本更新

Benchmarking and Boosting Multilingual Capabilities of LVLMs via OCR-Centric Reinforcement Learning

PM4Bench: 通过平行多语言多模态多任务语料库对大型视觉-语言模型进行基准测试

Junyuan Gao, Jiahe Song, Jiang Wu, Runchuan Zhu, Guanlin Shen, Shasha Wang, Xingjian Wei, Haote Yang, Weijia Li, Bin Wang, Lijun Wu, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) Chinese University of Hong Kong(香港中文大学)

AI总结 PM4Bench通过平行多语言多模态多任务语料库评估大型视觉-语言模型,揭示跨语言性能差异与OCR能力的关系。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04001 2026-08-25 cs.CV 版本更新

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos

Sa2VA:将SAM2与多模态大语言模型结合用于图像与视频的密集接地理解

Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Bytedance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

AI总结 本研究提出Sa2VA,结合SAM2与MLLM实现图像视频密集接地理解,引入Ref-SAV数据集,在多任务中表现优异且可扩展至多款开源MLLM,代码模型已公开。

Comments Accepted by IEEE TPAMI. Code: this https URL (https://github.com/Bytedance/Sa2VA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07173 2026-08-25 cs.CL 版本更新

Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models

Omni-SafetyBench:视听大语言模型安全评估基准

Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix Henry, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) Peking University(北京大学) OpenRL Lab(OpenRL实验室)

AI总结 研究针对现有OLLM安全基准的不足,构建Omni-SafetyBench基准,提出定制化评估指标,发现多数OLLM存在安全漏洞,为该领域研究提供重要支撑。

Comments ACM MM 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14424 2026-08-25 stat.ML cs.AI cs.LG stat.ME 版本更新

Bringing Generative Learning to Representation Learning: Self-Supervised Transfer Learning as Distribution Matching

将生成式学习引入表征学习:作为分布匹配的自监督迁移学习

Yuling Jiao, Wensen Ma, Defeng Sun, Hansheng Wang, Yang Wang

机构 * School of Artificial Intelligence and School of Mathematics and Statistics, Wuhan University(人工智能学院和数学与统计学学院,武汉大学) School of Mathematics and Statistics, Wuhan University(数学与统计学学院,武汉大学) Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学) Guanghua School of Management, Peking University(光华管理学院,北京大学) Department of Mathematics, The Hong Kong University of Science and Technology(数学系,香港科技大学)

AI总结 该研究将表征学习建模为分布匹配,采用Mallows距离作为差异度量,关联总体目标与类中心分离及分类误差并证明非渐近神经筛保证,经模拟和图像基准验证其具备流形校正等优势。

Comments 70 pages, 5 figures, and 6 tables. Substantially revised version with a new title, an explicit distribution-matching formulation linking generative learning and representation learning, expanded theoretical treatment, additional transfer experiments, and appendices integrated into the main file. Code is available at this https URL (https://github.com/vincen-github/DM)

详情

展开后加载摘要…

URL PDF HTML 收藏