arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7552 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7552 篇

2605.23780 2026-05-25 cs.AI 70%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23036 2026-05-25 cs.CL 70%

Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection

通过设计实现多语言引导:多语言稀疏自编码器与原则性层选择

Yusser Al Ghussin, Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Patrick Schramowski, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) TU Darmstadt(德累斯顿技术大学) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信AI研究中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对稀疏自编码器在多语言环境中语言控制不可靠的问题,提出在多语言数据上训练SAE并基于多语言对齐与语言可分离性交集的原则性层选择规则,在LLaMA-3.1-8B和Gemma-2-9B上验证了该方法能稳定语言识别准确率与生成质量之间的权衡。

Comments Accepted to TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11195 2026-05-25 cs.CR cs.AI 70%

RAG-Pull: Turning Retrieval into a Code-Injection Channel via Invisible Unicode Perturbations

RAG-Pull:通过不可见Unicode扰动将检索转化为代码注入通道

Aritra Dhar, Vasilije Stambolic, Lukas Cavigelli

机构 * Computing System Labs, Huawei Technologies Switzerland AG(华为瑞士技术有限公司计算系统实验室) BKW Energie AG(BKW能源集团)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RAG-Pull攻击,通过向查询或外部代码库插入不可见UTF字符,使检索系统偏向恶意代码,从而破坏LLM的安全对齐,实现远程代码执行和SQL注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10009 2026-05-22 cs.AI cs.HC 70%

Discovering High Level Patterns from Simulation Traces

从仿真轨迹中发现高层次模式

Sean Memery, Kartic Subr

机构 * University of Edinburgh(爱丁堡大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种通过程序合成进行无监督学习的方法,将仿真轨迹转换为稀疏的高层次模式表示,以提升大语言模型对物理系统的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21059 2026-05-21 cs.CV cs.LG 70%

Multimodal LLMs under Pairwise Modalities

基于成对模态的多模态大语言模型

Yan Li, Yunlong Deng, Yuewen Sun, Gongxu Luo, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于成对模态训练多模态大语言模型的方法,通过理论分析和表示学习框架,实现了跨模态对齐和重构,提升了模型的跨模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 70%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14364 2026-05-21 cs.LG 70%

MoRe: Modular Representations for Principled Continual Representation Learning on Sequential Data

MoRe:模块化表示用于序列数据的原理化持续表示学习

Jiaqi Sun, Boyang Sun, Rasmy M. H., Xiangchen Song, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出MoRe框架,通过模块化表示方法实现序列数据的原理化持续学习,其核心贡献是通过分解知识为可识别的模块层级,实现模块的重用、对齐和扩展,从而在保持旧模块的同时提升模型的可塑性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16524 2026-05-21 cs.HC cs.AI 70%

Toward Template-Free Explainability for Monte Carlo Tree Search

迈向无模板的蒙特卡洛树搜索可解释性

Siqi Lu, Mirsaleh Bahavarnia, Hiba Baroud, Yixuan Zhang, Hemant Purohit, Ayan Mukhopadhyay

机构 * The College of William & Mary(威廉姆斯学院) Vanderbilt University(范德比大学) George Mason University(乔治·马歇尔大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种无需模板的框架,使大语言模型能够根据记录的搜索轨迹生成基于证据的MCTS决策解释,无需中间形式化表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09174 2026-05-21 cs.CL 70%

Facet-Level Tracing of Evidence Uncertainty and Hallucination in RAG

面向证据不确定性和幻觉的面级追踪(RAG)

Passant Elchafei, Monorama Swain, Shahed Masoudian, Markus Schedl

机构 * Johannes Kepler University Linz(约翰内斯·开普勒大学林茨) Linz Institute of Technology(林茨技术学院) Institute of Computational Perception(计算感知研究所) Artificial Intelligence Lab(人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种面向问答任务的面级诊断框架,通过分解每个输入问题为原子推理面,评估证据充分性和基础性,揭示RAG系统中幻觉产生的根源在于生成过程中证据整合的方式,而非检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20134 2026-05-20 cs.LG 70%

TrajTok: Adaptive Spatial Tokenization for Trajectory Representation Learning

TrajTok: 用于轨迹表示学习的自适应空间令牌化

Zhen Xiong, Shang-Ling Hsu, Cyrus Shahabi

机构 * University of Southern California(南加州大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出TrajTok,一种通过自适应空间令牌化学习通用轨迹表示的方法,通过多分辨率六边形网格划分和预训练策略,实现了在轨迹相似性搜索、分类、预计到达时间和旅行时间回归等任务上的优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14588 2026-05-20 cs.LG 70%

Silent Collapse in Recursive Learning Systems

递归学习系统中的沉默崩溃

Zhipeng Zhang

机构 * China Mobile Research Institute(中国移动研究院) China Mobile GBA (Greater Bay Area) Innovation Institute(中国移动大湾区创新研究院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了递归学习系统中模型内部分布逐渐退化的现象,提出MTR框架通过监测轨迹统计量和调整学习强度来提前预警并防止沉默崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16200 2026-05-20 cs.LG cs.CV 70%

Feature-Space Smoothing: Certified Robustness of Deep Representations

特征空间平滑:深度表示的认证鲁棒性

Song Xia, Meiwen Ding, Chenqi Kong, Wenhan Yang, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(快速-丰富目标搜索实验室,电气电子工程学院,南洋理工大学,新加坡) Pengcheng Laboratory, Shenzhen, China(鹏城实验室,深圳,中国)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种特征空间平滑(FS)框架,通过在特征表示层面提供认证鲁棒性,以解决深度学习模型对恶意输入的脆弱性问题,核心方法是通过特征平滑保证清洁和对抗特征之间的余弦相似度下界,并引入高斯平滑增强器(GSB)提升编码器的高斯鲁棒性得分,从而提升模型的鲁棒性并保持下游任务性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19250 2026-05-20 cs.AI 70%

Causal Evidence for Attention Head Imbalance in Modality Conflict Hallucination

因果证据:模态冲突幻觉中的注意力头不平衡

Jinrui Jiang, Zhangtai Wu, Zhen Wu, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence(人工智能学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了多模态大语言模型在模态冲突中产生幻觉的原因,通过分析注意力头的因果作用,发现驱动幻觉的头部分布更广且权重更大,而抑制幻觉的头部集中在少量重要头部,提出MACI方法在减少幻觉的同时保持准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13727 2026-05-20 cs.AI 70%

From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails

从拒绝到恢复:一种生成AI防护机制的控制论方法

Ravi Pandya, Madison Bland, Duy P. Nguyen, Changliu Liu, Jaime Fernández Fisac, Andrea Bajcsy

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) Equal Advising(平等指导)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出了一种基于控制论的生成AI防护机制,通过实时监控和主动纠正高风险输出,提供了一种动态替代传统标志和阻断方法的解决方案。

Journal ref Second International Association on Safe and Ethical AI Conference (IASEAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18554 2026-05-19 cs.LG stat.ML 70%

Federated Martingale Posterior Samping

联邦马尔可夫后验采样

Boning Zhang, Matteo Zecchin, Mingzhao Guo, Dongzhu Liu, Osvaldo Simeone

机构 * School of Computing, University of Glasgow(格拉斯哥大学计算学院) Communication Systems Department, EURECOM(EURECOM通信系统部门) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出联邦马尔可夫后验采样方法,通过在不共享本地数据集的情况下,利用预测分布恢复参数不确定性,从而在联邦学习中提升模型校准性能。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14347 2026-05-19 cs.LG 70%

Exemplar Partitioning for Mechanistic Interpretability

基于示例的机制可解释性划分

Jessica Rumbelow

机构 * Leap Laboratories(Leap实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Exemplar Partitioning方法,通过更少的token构建可解释特征字典,展示其在不同层和模型间的可比性及因果干预能力。

Comments Code: https://github.com/jessicarumbelow/exemplar-partitioning. Pretrained dictionaries: https://huggingface.co/datasets/J-RUM/exemplar-partitioning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16581 2026-05-19 cs.LG 70%

Structure-Aware Masking for Protein Representation Learning

基于结构的掩码策略用于蛋白质表示学习

Thomas Walton, Ayan Goel, Amirali Aghazadeh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出结构感知掩码策略,通过三维空间接近性选择残基组,改进蛋白质表示学习,提升下游预测任务性能,实现14%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14694 2026-05-15 cs.LG 70%

The Rate-Distortion-Polysemanticity Tradeoff in SAEs

SAEs中速率-失真-多义性权衡

Tommaso Mencattini, Francesco Montagna, Francesco Locatello

机构 * EPFL(瑞士联邦理工学院) Institute of Science and Technology Austria(奥地利科学技术研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了SAEs中准确重建输入、高效编码和可解释性之间的矛盾,发现限制SAEs为单义性必然导致速率和失真增加,且多义性由训练数据分布决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14406 2026-05-15 cs.LG cs.CV 70%

GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

GeoViSTA:用于多模态环境表示的地理视觉-表格变压器

Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Department of Electrical and Computer Engineering, Rice University(理海大学电气与计算机工程系) Center for Cardiovascular Computational and Precision Health, Department of Cardiology, DeBakey Heart and Vascular Center, Houston Methodist(休斯顿方法主义医疗中心心血管计算与精准健康中心、心内科部门、德贝基心脏和血管中心)

专题命中 知识编辑与模型理解 :foundation model(abstract);pretraining(abstract);分类 cs.LG

AI总结 GeoViSTA通过融合栅格影像与表格数据,构建统一的地理嵌入表示,提升对环境、社会和健康问题的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01172 2026-05-15 cs.CL 70%

Energy-Regularized Sequential Model Editing on Hyperspheres

超球面能量正则化的序列模型编辑

Qingyuan Liu, Jia-Chen Gu, Yunzhi Yao, Hong Wang, Nanyun Peng

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SPHERE方法,通过超球面能量正则化提升模型在序列编辑中的稳定性与知识保留能力,实验表明其在编辑性能上优于基线方法16.41%。

Comments Accepted by ICLR 2026. The code is available at https://github.com/PlusLabNLP/SPHERE. Project page: https://www.qingyuanliu.net/sphere_projectpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13202 2026-05-14 cs.CV cs.AI 70%

STAR: Semantic-Temporal Adaptive Representation Learning for Few-Shot Action Recognition

STAR:语义-时间自适应表示学习用于少样本动作识别

Hongli Liu, Yu Wang, Shengjie Zhao

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Engineering Research Center of Key Software Technologies for Smart City Perception and Planning, Ministry of Education(教育部智能城市感知与规划关键软件技术工程研究中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 STAR通过语义对齐和时间感知模块,解决少样本动作识别中的语义-时间对齐和多尺度时间动态建模问题,提升模型在有限样本下的泛化能力。

Comments Accepted for publication in IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13110 2026-05-14 cs.MA cs.AI cs.IR 70%

A Multi-Agent Orchestration Framework for Venture Capital Due Diligence

面向风险投资尽调的多智能体 orchestration 框架

Grigorios Alexandrou, Katerina Pramatari

机构 * Greek Business Registry(希腊企业登记处)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一个自动化多智能体框架,结合大语言模型和实时网络检索,将非结构化数据转化为结构化投资信息,通过程序化提取管道和结构化回退机制提升金融尽调的准确性与可靠性。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11559 2026-05-13 cs.CV cs.AI 70%

When Looking Is Not Enough: Visual Attention Structure Reveals Hallucination in MLLMs

当观察不足时:视觉注意结构揭示大语言模型中的幻觉

Fanpu Cao, Xin Zou, Xuming Hu, Hui Xiong

机构 * Thrust of Artificial Intelligence, HKUST (Guangzhou)(人工智能前沿 thrust,香港科技大学(广州)) Department of Computer Science and Engineering, HKUST(计算机科学与工程系,香港科技大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析视觉注意的高频结构揭示大语言模型中的幻觉现象,提出LaSCD解码策略,有效减少幻觉并保持模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 70%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01103 2026-05-13 cs.AI 70%

Probing RLVR training instability through the lens of objective-level hacking

通过目标层面黑客的视角探查RLVR训练不稳定性

Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang

机构 * School of Physics, Peking University(北京大学物理学院) Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10795 2026-05-12 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG 70%

Factual recall in linear associative memories: sharp asymptotics and mechanistic insights

线性联想记忆中的事实回忆:尖锐渐近分析和机制洞察

Alessio Giorlandino, Sebastian Goldt, Antoine Maillard

机构 * International School of Advanced Studies (SISSA)(国际先进研究学院(SISSA)) INRIA Paris & DI ENS, PSL University(INRIA巴黎与ENS DI,PSL大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究线性联想记忆中存储和检索输入-输出关联的极限,通过解耦模型揭示存储容量和机制,提供精确的统计物理分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09285 2026-05-12 cs.CL 70%

BetaEdit: Null-Space Constrained Sequential Model Editing

BetaEdit:基于空空间的顺序模型编辑

Bingqing Liu, Wei Liu, Yuhua Li

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BetaEdit框架,通过控制知识泄漏并整合历史感知更新,提升大规模顺序编辑性能,实验显示其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07922 2026-05-12 cs.LG 70%

Tree SAE: Learning Hierarchical Feature Structures in Sparse Autoencoders

树状SAE:在稀疏自编码器中学习层次特征结构

Tue M. Cao, Hoang X. Nhat, Raed Alharbi, Phi Le Nguyen, My T. Thai

机构 * Hanoi University of Science(河内科学大学) University of Florida, Florida, USA(佛罗里达大学) Computer Science Department, Saudi Electronic University(沙特电子大学计算机科学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Tree SAE,通过结合激活和重建约束,改进稀疏自编码器中层次特征学习,提升层次对学习效果并保持与最新方法的竞争力。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03677 2026-05-12 cs.CL 70%

Instruction Anchor: Dissecting the Mechanistic Dynamics of Modality Arbitration

指令锚点:解构模态仲裁的机理动态

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai Chen, Pengfei Zhang, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过信息流视角研究模态跟随机制,揭示指令令牌作为模态仲裁的结构锚点,浅层注意力层负责多模态信息聚合,深层注意力层则根据指令意图选择性强化子空间,实验验证了注意力头的特定功能。

Comments Modality Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07622 2026-05-11 cs.CL 70%

Is She Even Relevant? When BERT Ignores Explicit Gender Cues

她真的相关吗?当BERT忽视显性性别线索时

Jonas Klein, Chiara Manna, Eva Vanmassenhove

机构 * Department of Computational Cognitive Science, Tilburg University(蒂尔堡大学计算认知科学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了荷兰BERT模型在训练过程中性别信息的出现时机,发现模型在短句模板中难以更新性别表示,导致默认男性解读。

详情

展开后加载摘要…

URL PDF HTML 收藏