arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-02-05 至 2026-02-05 共收录 12
2602.04706 2026-02-05 cs.CL

LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers

LiteToken: 从BPE分词器中移除中间合并残余

Yike Sun, Haotong Yang, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学)

AI总结 LiteToken通过移除BPE分词器中的低频残余标记,减少标记碎片化和参数,提升对噪声输入的鲁棒性,同时保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04607 2026-02-05 cs.CL cs.LG

Focus-LIME: Surgical Interpretation of Long-Context Large Language Models via Proxy-Based Neighborhood Selection

Focus-LIME: 通过基于代理的邻域选择实现长上下文大语言模型的手术解释

Junhao Liu, Haonan Yu, Zhenyu Yan, Xin Zhang

机构 * Key Lab of High Confidence Software Technologies (Peking University)(高可信软件技术重点实验室(北京大学)) School of Computer Science, Peking University(计算机学院(北京大学))

AI总结 Focus-LIME通过基于代理的邻域选择方法,实现长上下文大语言模型的手术级解释,解决了高维特征空间下的归因稀释问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20322 2026-02-05 cs.CV

Dynamic Pyramid Network for Efficient Multimodal Large Language Model

动态金字塔网络用于高效多模态大语言模型

Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室) KAUST(卡塔尔大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University Of Denmark(丹麦技术大学) Nanjing University of Science and Technology(南京理工大学) Peking University(北京大学) Xiaohongshu Inc(小红书公司)

AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04337 2026-02-05 cs.CV cs.AI

Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner

无需人工标注的预训练视觉-语言模型微调

Qian-Wei Wang, Guanghao Meng, Ren Cai, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)

AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04315 2026-02-05 cs.RO cs.CV

GeneralVLA: Generalizable Vision-Language-Action Models with Knowledge-Guided Trajectory Planning

GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型

Guoqing Ma, Siheng Wang, Zeyu Zhang, Shan Yu, Hao Tang

机构 * CASIA(中国科学院自动化研究所) Peking University(北京大学)

AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04294 2026-02-05 cs.CL cs.AI cs.CR

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04290 2026-02-05 cs.CL

Guided Verifier: Collaborative Multimodal Reasoning via Dynamic Process Supervision

引导验证器:通过动态过程监督实现协作多模态推理

Lingzhuang Sun, Ruitong Liu, Yuxia Zhu, Xiaohan Xu, Jingxuan Wei, Xiangxiang Zhang, Bihui Yu, Wentao Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学) The University of Hong Kong(香港大学)

AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04246 2026-02-05 cs.CL

CoLT: Reasoning with Chain of Latent Tool Calls

CoLT:基于链式潜在工具调用的推理

Fangwei Zhu, Zhifang Sui

机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)

AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04228 2026-02-05 cs.RO

Reshaping Action Error Distributions for Reliable Vision-Language-Action Models

重塑动作误差分布以实现可靠的视觉-语言-动作模型

Shuanghao Bai, Dakai Wang, Cheng Chi, Wanqi Zhou, Jing Lyu, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Lei Xing, Shanghang Zhang, Badong Chen

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation(自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Artificial Intelligence(人工智能学院) Peking University(北京大学)

AI总结 本研究通过重塑动作误差分布,提出基于最小误差熵的VLA模型训练方法,提升模型在不同任务中的成功率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03893 2026-02-05 cs.CV

GPAIR: Gaussian-Kernel-Based Ultrafast 3D Photoacoustic Iterative Reconstruction

GPAIR: 基于高斯核的超快三维光电声迭代重建

Yibing Wang, Shuang Li, Tingting Huang, Yu Zhang, Chulhong Kim, Seongwook Choi, Changhui Li

机构 * Department of Biomedical Engineering, College of Future Technology, Peking University(生物医学工程系,未来技术学院,北京大学) Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH) Department of Convergence IT Engineering, Pohang University of Science and Technology(融合IT工程系,POSTECH) Department of Mechanical Engineering, Pohang University of Science and Technology(机械工程系,POSTECH) Department of Medical Science and Engineering, Pohang University of Science and Technology(医学科学与工程系,POSTECH) Medical Device Innovation Center, Pohang University of Science and Technology(医疗设备创新中心,POSTECH) National Biomedical Imaging Center, Peking University(国家生物医学成像中心,北京大学)

AI总结 GPAIR通过基于高斯核的超快迭代重建方法,实现大规模三维光电声成像的亚秒级重建速度,显著提升了3D PACT的临床应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03887 2026-02-05 eess.IV cs.CV

To What Extent Do Token-Level Representations from Pathology Foundation Models Improve Dense Prediction?

病理基础模型的标记级表示在密集预测中有多大的提升作用?

Weiming Chen, Xitong Ling, Xidong Wang, Zhenyang Cai, Yijia Guo, Mingxi Fu, Ziyi Zeng, Minxi Ouyang, Jiawen Li, Yizhi Wang, Tian Guan, Benyou Wang, Yonghong He

机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) Peking University, Beijing, China(北京大学)

AI总结 本文提出PFM-DenseBench,通过评估17个病理基础模型在18个数据集上的表现,揭示不同模型和调优策略在异构数据集上的性能差异及适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏