LiteToken: Removing Intermediate Merge Residues From BPE Tokenizers
LiteToken: 从BPE分词器中移除中间合并残余
机构 * Peking University, Beijing, China(北京大学)
AI总结 LiteToken通过移除BPE分词器中的低频残余标记,减少标记碎片化和参数,提升对噪声输入的鲁棒性,同时保持模型性能。
高校专区
LiteToken: 从BPE分词器中移除中间合并残余
机构 * Peking University, Beijing, China(北京大学)
AI总结 LiteToken通过移除BPE分词器中的低频残余标记,减少标记碎片化和参数,提升对噪声输入的鲁棒性,同时保持模型性能。
Focus-LIME: 通过基于代理的邻域选择实现长上下文大语言模型的手术解释
机构 * Key Lab of High Confidence Software Technologies (Peking University)(高可信软件技术重点实验室(北京大学)) ; School of Computer Science, Peking University(计算机学院(北京大学))
AI总结 Focus-LIME通过基于代理的邻域选择方法,实现长上下文大语言模型的手术级解释,解决了高维特征空间下的归因稀释问题。
动态金字塔网络用于高效多模态大语言模型
机构 * Beihang University(北航大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; KAUST(卡塔尔大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Technical University Of Denmark(丹麦技术大学) ; Nanjing University of Science and Technology(南京理工大学) ; Peking University(北京大学) ; Xiaohongshu Inc(小红书公司)
AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。
无需人工标注的预训练视觉-语言模型微调
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) ; Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)
AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。
GeneralVLA:具备知识引导轨迹规划的通用视觉-语言-动作模型
机构 * CASIA(中国科学院自动化研究所) ; Peking University(北京大学)
AI总结 GeneralVLA通过知识引导轨迹规划,实现无需真实数据或示范的通用视觉-语言-动作模型,提升机器人零样本操作和数据生成能力。
少样本演示如何影响基于提示的对抗LLM劫持攻击防御
机构 * Peking University(北京大学)
AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。
Comments 13 pages, 4 figures, 6 tables
引导验证器:通过动态过程监督实现协作多模态推理
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Peking University(北京大学) ; The University of Hong Kong(香港大学)
AI总结 本文提出引导验证器框架,通过动态过程监督实现多模态推理的协作优化,提升模型性能。
CoLT:基于链式潜在工具调用的推理
机构 * School of Computer Science, State Key Laboratory of Multimedia Information Processing, Peking University(计算机学院、多媒体信息处理国家重点实验室、北京大学)
AI总结 CoLT通过将潜在推理转化为工具调用,实现高效推理,提升模型效率与准确性,适用于多种解码器结构和强化学习算法。
重塑动作误差分布以实现可靠的视觉-语言-动作模型
机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Automation(自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Artificial Intelligence(人工智能学院) ; Peking University(北京大学)
AI总结 本研究通过重塑动作误差分布,提出基于最小误差熵的VLA模型训练方法,提升模型在不同任务中的成功率与鲁棒性。
GPAIR: 基于高斯核的超快三维光电声迭代重建
机构 * Department of Biomedical Engineering, College of Future Technology, Peking University(生物医学工程系,未来技术学院,北京大学) ; Department of Electrical Engineering, Pohang University of Science and Technology(电气工程系,POSTECH) ; Department of Convergence IT Engineering, Pohang University of Science and Technology(融合IT工程系,POSTECH) ; Department of Mechanical Engineering, Pohang University of Science and Technology(机械工程系,POSTECH) ; Department of Medical Science and Engineering, Pohang University of Science and Technology(医学科学与工程系,POSTECH) ; Medical Device Innovation Center, Pohang University of Science and Technology(医疗设备创新中心,POSTECH) ; National Biomedical Imaging Center, Peking University(国家生物医学成像中心,北京大学)
AI总结 GPAIR通过基于高斯核的超快迭代重建方法,实现大规模三维光电声成像的亚秒级重建速度,显著提升了3D PACT的临床应用潜力。
病理基础模型的标记级表示在密集预测中有多大的提升作用?
机构 * Tsinghua University, Shenzhen, China(清华大学深圳研究院) ; Peking University, Beijing, China(北京大学)
AI总结 本文提出PFM-DenseBench,通过评估17个病理基础模型在18个数据集上的表现,揭示不同模型和调优策略在异构数据集上的性能差异及适用性。
LoVR:一种多模态背景下长视频检索的基准
机构 * East China Normal University Shanghai China ; Peking University \& Zhongguancun Academy Beijing China ; Huazhong University of Science ; Beihang University Beijing China ; Peking University Beijing China ; East China Normal University ; Peking University \& Zhongguancun Academy ; Beihang University ; Peking University
AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。