arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 138791 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12393 篇

2409.16005 2024-09-25 cs.CL cs.SD eess.AS 78%

Bridging Speech and Text: Enhancing ASR with Pinyin-to-Character Pre-training in LLMs

Yang Yuhang, Peng Yizhou, Eng Siong Chng, Xionghu Zhong

专题命中 预训练与数据 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted by ISCSLP2024-Special session-Speech Processing in LLM Era

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09264 2026-08-11 cs.CV 新提交 78%

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining

基于场条件内容-风格预训练的任务自适应3D跨场MRI转换

Haowen Pang, Yingqi Hao, Pengli Zhu

机构 * School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程学院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对跨场MRI转换的域偏移问题,提出基于场条件内容-风格预训练的3D非配对转换框架,适配三项挑战赛任务,可保留三维解剖结构。

Comments MICCAI 2026 Workshop on MRIxFields

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08191 2026-08-11 cs.CV 新提交 78%

BAP-MOS: Bandit-Based Adaptive Prompting for Boundary-Sensitive Multi-Organ Segmentation

BAP-MOS:面向边界敏感型多器官分割的基于多臂老虎机的自适应提示

Satvik Praveen, Shengji Jin, Ahmed Lamidi, Xin Qian, Yi Sheng

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 该研究提出BAP-MOS自适应提示框架,将提示选择转化为多臂老虎机问题,在多器官超声分割基准上显著降低边界误差,泛化能力良好且无需修改模型主干。

Comments 9 pages, 5 figures. Source code available at https://github.com/SatvikPraveen/BAP-MOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07984 2026-08-11 cs.CV 新提交 78%

AgriField-40K: Adapting Vision Models to Agriculture With Efficient Continual Pretraining

AgriField-40K:通过高效持续预训练使视觉模型适配农业场景

Vasileios Tzouras, Paraskevas Pegios, Lazaros Nalpantidis

机构 * Technical University of Denmark (DTU)(丹麦技术大学(DTU)) Pioneer Centre for Artificial Intelligence(人工智能先锋中心)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 针对农业计算机视觉依赖昂贵标注与模型适配成本高的问题,构建含17种公开资源的AgriField-40K数据集,提出参数高效的AgriMAE方法,可少用9倍可训练参数实现与全微调相当甚至更优的下游性能,为农业视觉持续预训练提供实用资源。

Comments Accepted at the Computer Vision in Plant Phenotyping and Agriculture (CVPPA) Workshop at the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17746 2026-08-05 cs.NI 版本更新 78%

FlowCLIP: Contrastive Pretraining Using Domain Names for Encrypted Traffic Classification

FlowCLIP: 使用域名的对比预训练进行加密流量分类

Eun Hun Choi

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出FlowCLIP框架,利用数据包侧信道特征(间隔、大小、方向)和CLIP对比目标对齐流量与域名表示,在QUIC流量数据集上跨周评估,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01535 2026-08-04 cs.CV cs.RO 新提交 78%

STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision

STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计

Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai, Hemanth Murali, Yi Liu, Rui-Yu Lin, Katherine A. Skinner

机构 * University of Michigan(密歇根大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00231 2026-08-04 cs.CV 新提交 78%

Learning How Much, Not Just What: Cross-Patient Burden Order for CT Vision-Language Pretraining

学习多少,而非仅学习是什么:用于CT视觉-语言预训练的跨患者负担顺序

Guoliang You, Haifan Gong, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究提出Spectrum框架,利用跨患者弱负担顺序补充解剖感知对应关系,无需纵向数据即可学习负担感知CT表示,在CT-RATE和RAD-ChestCT数据集上取得良好性能。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新 78%

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26346 2026-07-30 math.ST cs.SI stat.ME stat.ML stat.TH 新提交 78%

Toward a Unified Statistical Theory of Unsupervised Pretraining and Supervised Neural Knowledge Graph Learning

迈向无监督预训练与监督神经知识图谱学习的统一统计理论

Jifan Zhang, Miklos Racz, Suqi Liu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究针对知识图谱学习中数据与理论问题,提出含无监督预训练与监督学习的两阶段框架,建立非渐近风险界,经合成与真实实验验证其有效性。

Comments 49 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21953 2026-07-27 cs.CV eess.SP 新提交 78%

Low-Altitude Channel Multipath Prediction via Panoramic Perception and Vision-Language Model

通过全景感知和视觉语言模型进行低空信道多径预测

Zihang Zeng, Shu Sun, Meixia Tao, Zhiyong Chen, Jianhua Mo, Xiangwen Gu

专题命中 预训练与数据 :language model(title,abstract)

AI总结 针对无人机通信中传统信道预测方法的局限,提出基于全景感知和视觉语言模型的PanoLAMP框架,利用预训练模型及全景观测捕捉特征预测多径参数,实验显示其在多径参数、统计指标及泛化性上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16257 2026-07-27 cs.CV 版本更新 78%

Quality Text, Robust Vision: The Role of Language in Enhancing Visual Robustness of Vision-Language Models

高质量文本,稳健视觉:语言在增强视觉语言模型视觉稳健性中的作用

Futa Waseda, Saku Sugawara, Isao Echizen

机构 * The University of Tokyo(东京大学) National Institute of Informatics(日本信息处理研究所) The University of Tokyo, National Institute of Informatics(东京大学、日本信息处理研究所)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 研究针对视觉语言模型对抗攻击问题,提出质量文本引导的对抗微调方法QT-AFT,利用高质量字幕提升视觉编码器对抗鲁棒性,在多个零样本数据集上实现了最先进的零样本对抗鲁棒性和纯净准确率,并揭示了语言增强视觉鲁棒性的关键见解。

Comments ACMMM 2025 Accepted. Codes are available at: https://github.com/futakw/QTAFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24566 2026-07-17 cs.CV 版本更新 78%

TokenSwap: Backdoor Attack on the Compositional Understanding of Large Vision-Language Models

TokenSwap:对大型视觉语言模型组合理解的后门攻击

Zhifang Zhang, Qiqi Tao, Jiaqi Lv, Na Zhao, Lei Feng, Joey Tianyi Zhou

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) School of Electrical Engineering and Computer Science, University of Queensland, Australia(昆士兰大学电气工程与计算机科学学院) Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学设计学院) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR), Singapore(前沿人工智能研究中心(CFAR)) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC))

专题命中 预训练与数据 :language model(title,abstract)

AI总结 研究针对大型视觉语言模型的后门攻击,提出TokenSwap方法,通过注入视觉触发器和交换文本答案中关键令牌语法角色,并采用自适应加权损失,在多基准和不同架构上实现高成功率且隐蔽性强的后门攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13892 2026-07-16 cs.CV 新提交 78%

Fine-Grained Vision-Language Pretraining with Organ-Conditioned Pattern Tokens for CT Understanding

用于CT理解的基于器官条件模式令牌的细粒度视觉语言预训练

Guoliang You, Xiaomeng Chu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 研究从CT扫描和报告进行视觉语言预训练的难题,提出OCP-CT框架,通过保留全局对比分支、引入器官模式接口等方法,在公开基准上实现零样本异常诊断,相比先前结果有显著AUROC增益。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08765 2026-07-14 cs.CV 版本更新 78%

Enhancing In-context Panoramic Generation via Geometric-aware Pretraining

通过几何感知预训练增强上下文全景生成

Haoran Feng, Ruiyang Zhang, Longyi Zhang, Dizhe Zhang, Lu Qi

机构 * Insta360 Research(影石创新研究院) Tsinghua University(清华大学) Beihang University(北京航空航天大学) Wuhan University(武汉大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 该研究提出两阶段框架Canvas360用于上下文全景生成,结合几何感知预训练与微调。通过构建数据集及特定建模方法,增强文本到全景生成,经实验验证其能提高全景图像保真度,在相关指标上表现优异。

Comments Project page: https://zry000.github.io/Canvas360/ Github: https://github.com/Insta360-Research-Team/Canvas360

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21511 2026-07-14 cs.CV 版本更新 78%

Back to Point: Exploring Point-Language Models for Zero-Shot 3D Anomaly Detection

回到点:探索用于零样本3D异常检测的点语言模型

Kaiqiang Li, Gang Li, Mingle Zhou, Min Li, Delong Han, Jin Wan

机构 * Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences), Jinan, China(计算机功率网络与信息安全重点实验室,教育部,山东计算机科学中心(济南国家超级计算机中心),齐鲁大学(山东科学院),济南,中国) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science, Jinan, China(山东省计算功率互联网与服务计算重点实验室,山东省计算机科学基础研究中心,济南,中国)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出BTP框架,通过结合3D点云和文本嵌入,提升零样本3D异常检测的性能,实验表明其在Real3D-AD和Anomaly-ShapeNet上表现优异。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01594 2026-07-03 eess.AS 新提交 78%

Enhancing Acoustic-to-Articulatory Inversion with Multi-Target Pretraining for Low-Resource Settings

面向低资源场景的声学-发音反演的多目标预训练增强方法

Jesuraj Bandekar, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出一种多目标预训练方法,利用音素标签、发音特征标签和关键发音器官标签,在低资源场景下提升声学-发音反演性能,同时降低推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28896 2026-07-03 cs.CV 版本更新 78%

Fisheye3R: Adapting Unified 3D Feed-Forward Foundation Models to Fisheye Lenses

Fisheye3R:将统一的3D前馈基础模型适应于鱼眼镜头

Ruxiao Duan, Erin Hong, Dongxu Zhao, Eric Turner, Alex Wong, Yunwen Zhou

机构 * Yale University(耶鲁大学) Google XR(谷歌XR)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出Fisheye3R框架,通过灵活学习方案在不退化性能的前提下,使多视角3D重建模型适应高径向畸变的鱼眼图像。

Comments European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00038 2026-07-02 cs.SE 新提交 78%

Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting

停止手把手指导你的编码智能体:设计替代逐步提示的循环机制

Sandeco Macedo

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 本文提出循环规范作为替代逐步提示的编码智能体新范式,定义其结构、分类与设计原则,并通过真实语料分析验证其成熟度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交 78%

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 78%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29089 2026-06-30 cs.RO 78%

TAP-VLA: Tactile Annotation Prompting for Vision Language Action Models

TAP-VLA:面向视觉语言动作模型的触觉标注提示

Mark Van der Merwe, Mohamad Louai Shehab, Jayjun Lee, Youngsun Wi, Yinpei Dai, Dmitry Berenson, Nima Fazeli

机构 * Robotics Department, University of Michigan(密歇根大学机器人系) Computer Science and Engineering Department, University of Michigan(密歇根大学计算机科学与工程系)

专题命中 预训练与数据 :prompting(title,abstract)

AI总结 提出TAP-VLA框架,通过将触觉剪切场叠加到RGB图像上作为视觉增强,无需修改架构或触觉预训练,即可将触觉反馈融入VLA模型,在接触丰富任务中成功率78%,显著优于基线。

Comments 8 pages + references

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06891 2026-06-30 cs.CV 78%

CLIMP: Contrastive Language-Image Mamba Pretraining

CLIMP:对比语言-图像Mamba预训练

Nimrod Shabtay, Itamar Zimerman, Eli Schwartz, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 预训练与数据 :pretraining(title);language model(abstract)

AI总结 CLIMP是首个全Mamba架构的对比视觉语言模型,通过Mamba替代视觉和文本编码器,提升跨模态检索和鲁棒性,优于CLIP-ViT-B 7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27295 2026-06-29 cs.RO 新提交 78%

LA4VLA: Learning to Act without Seeing via Language-Action Pretraining

LA4VLA:通过语言-动作预训练实现无视觉行动学习

Tao Lin, Yuxin Du, Yiran Mao, Zewei Ye, Yilei Zhong, Bing Cheng, Yiming Wang, Jiting Liu, Yang Tian, Junchi Yan, Feiran Wu, Zenan Meng, Hu Wei, Yuqian Fu, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学) KAUST(阿卜杜拉国王科技大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出LA4VLA框架,通过语言-动作预训练学习动作先验,减少对视觉线索的依赖,提升VLA策略的鲁棒性,在仿真和真实任务中成功率显著提升。

Comments Github: https://github.com/MINT-SJTU/LA4VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16947 2026-06-29 cs.CV cs.RO 版本更新 78%

Image-based Geo-localization for Robotics: Are Black-box Vision-Language Models there yet?

基于图像的机器人地理定位:黑盒视觉语言模型是否已经足够?

Sania Waheed, Bruno Ferrarini, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * University of Southampton(南安普顿大学) MyWay srl Queensland University of Technology(昆士兰科技大学) University of Essex(埃塞克斯大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文首次系统研究黑盒生成式视觉语言模型作为独立零样本地理定位系统的潜力,发现其在粗粒度定位上表现良好,但在细粒度定位上因现实变化而显著退化。

Comments Accepted to the ICRA 2026 Workshop on Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding (MM-SpatialAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24080 2026-06-24 eess.AS 新提交 78%

Audio--Image Alignment as a Continued-Pretraining Stage Improves Low-Resource ASR

音频-图像对齐作为持续预训练阶段改善低资源ASR

Sujith Pulikodan, Nihar Desai, Prasanta Kumar Ghosh

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 提出在预训练和监督微调之间引入音频-图像表示对齐阶段,利用Vaani数据集中的配对数据,无需转录即可提升低资源ASR性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24120 2026-06-24 cs.CV eess.IV 新提交 78%

Flood Mapping from RGB imagery using a Vision Foundation Model

使用视觉基础模型从RGB图像进行洪水制图

Vladyslav Polushko, Tilman Bucher, Ronald Rösch, Thomas März, Markus Rauhut, Andreas Weinmann

机构 * ACIDA Lab(ACIDA实验室)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 研究利用卫星预训练的地球观测基础模型Prithvi-2.0-UPN,通过微调适应厘米级RGB洪水制图,在零样本和少量样本迁移中取得优于CNN和小型ViT的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23113 2026-06-23 cs.CV 新提交 78%

Technical Report for the ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Pretraining-Diverse Ensemble of Foundation Vision Encoders for Robust Outdoor Scene Understanding

ICRA 2026 GOOSE 2D细粒度语义分割挑战赛技术报告:面向鲁棒户外场景理解的预训练多样化基础视觉编码器集成

Boyan Wang, Yongxi Huang, Wenjing Li, Tianrui Hui, Shaofei Huang, Nan Pu, Zhun Zhong

机构 * LION Lab, Hefei University of Technology(合肥工业大学 LION 实验室) University of Macau(澳门大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本方案集成DINOv3、SigLIP2和InternImage三种预训练互补的视觉编码器,搭配Mask2Former解码器及长训练、EMA等策略,在GOOSE挑战赛56类细粒度分割中获75.40% mIoU,夺得第二名,并发现编码器预训练策略是精度主导因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02370 2026-06-23 cs.CV 版本更新 78%

Cultural Counterfactuals: Evaluating Cultural Biases in Large Vision-Language Models with Counterfactual Examples

文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(Ottawa大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12879 2026-06-23 cs.LG cs.AI cs.CL 版本更新 78%

Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition

通过可扩展归因图分解从十亿参数语言模型中提取分层稀疏电路

Mohammed Mudassir Uddin, Shahnawaz Alam, Mohammed Kaif Pasha

机构 * Department of CSE, Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系,穆法卡姆·贾赫工程与技术学院(MJCET))

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出分层归因图分解(HAGD)方法,通过跨层编码器训练、谱粗化、GNN引导分层遍历和因果干预验证,将电路提取复杂度降至O(n² log n),在多个大模型上实现高行为保留。

详情

展开后加载摘要…

URL PDF HTML 收藏