arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12321 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 12321 篇

2606.17871 2026-06-17 cs.AI 新提交 57%

StepGuard: Guarding Web Navigation via Single-Step Calibration

StepGuard: 通过单步校准保护网页导航

Zhihao Cui, Yuchen Zhang, Xiyang Sun, Yaxiong Wang, Li Zhu, Jinpeng Hu, Liu Liu, Mengjia Li, Yujiao Wu

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) Xiamen University(厦门大学) Zhejiang Lab(之江实验室) CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 针对网页导航中单步脆弱性问题,提出StepGuard框架,通过动态双策略优化(DDPO)解决奖励冲突,并利用置信度引导的自适应导航反射(CANR)校准单步误差,显著提升导航与答案准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14187 2026-06-17 cs.LG 新提交 57%

Zeta: Dual Whitening for Matrix Optimization via Coordinate-Adaptive Preconditioning

Zeta: 通过坐标自适应预处理实现矩阵优化的双重白化

Kaiwen Chen, Shuhai Zhang, Zimo Liu, Linxiao Li, Ying Sun, Yuchen Li, Yifan Zhang, Bo Han, Mingkui Tan, Qiuwu Chen

机构 * South China University of Technology(华南理工大学) AIGCode Hong Kong Baptist University(香港浸会大学)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 针对矩阵优化中坐标尺度异质性问题,提出双重白化优化器Zeta,通过先坐标白化后谱白化的严格顺序降低正交化误差,在语言建模和视觉任务上提升收敛速度与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21135 2026-06-17 cs.CL 版本更新 57%

Smarter edits? Post-editing with error highlights and translation suggestions

更智能的编辑?基于错误高亮和翻译建议的后编辑

Fleur V. J. van Tellingen, Gautam Ranka, Dora Žugčić, Joyce van der Wal, Andrea Camasta, Livio Guerra, Alina Karakanta

机构 * Leiden University Centre for Linguistics(莱顿大学语言研究中心) Visvesvaraya National Institute of Technology(维什瓦塞拉亚国家理工学院) Department of Bionanoscience, Faculty of Applied Sciences, Delft University of Technology(应用科学学院生物纳米科学系,代尔夫特理工大学) Pedagogical Sciences, Leiden University(莱顿大学教育科学) Faculty of Science, Leiden University(莱顿大学科学学院)

专题命中 其他LLM :LLM(abstract);分类 cs.CL

AI总结 本文研究了基于自动后编辑(APE)的错误高亮和纠正建议在后编辑任务中的有效性,发现虽然没有提升生产力和质量,但APE高亮和纠正建议提升了用户体验。

Comments Accepted at EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14211 2026-06-17 cs.CR cs.AI 版本更新 57%

SkillJect: Effectively Automating Skill-Based Prompt Injection for Skill-Enabled Agents

SkillJect:有效自动化基于技能的提示注入以针对具备技能的代理

Xiaojun Jia, Jie Liao, Simeng Qin, Jindong Gu, Wenqi Ren, Xiaochun Cao, Yang Liu, Philip Torr

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Chongqing University, China(重庆大学) Northeastern University, China(东北大学) Sun Yat-sen University, China(中山大学) University of Oxford, UK(牛津大学)

专题命中 其他LLM :LLM(abstract);分类 cs.AI

AI总结 SkillJect 是首个自动化生成有效中毒技能的框架,通过隐藏恶意负载和重写指令通道,提升攻击效果,揭示可重用技能生态中的持久性攻击向量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16836 2026-06-16 cs.CL 新提交 57%

Does Traversal Order Matter? A Systematic Study of Tree Traversal Methods in Transformer Grammars

遍历顺序重要吗?Transformer语法中树遍历方法的系统研究

Zongru Liu, Pengyu Ji, Pengcheng Wang, Kewei Tu

机构 * School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本文系统研究了Transformer语法中不同树遍历方法(深度优先、广度优先及新提出的产生式规则遍历)对语言建模、句法泛化和摘要生成的影响,揭示了嵌套组合与全局前瞻之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16319 2026-06-16 cs.AI 新提交 57%

Architectural Wisdom: A Framework for Governing Optimization in AI Systems

架构智慧:AI系统中优化治理的框架

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 其他LLM :language model(abstract);分类 cs.AI

AI总结 提出一种可修正的目标治理层,通过时间跨度、关系边界和不可逆性三个结构承诺,解决AI系统优化目标不当导致的失败问题。

Comments 17 pages, 2 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18795 2026-06-16 cs.CL 版本更新 57%

Anything Goes? A Crosslinguistic Study of (Im)possible Language Learning in LMs

什么都行?语言模型中(不)可能语言学习的跨语言研究

Xiulin Yang, Tatsuya Aoyama, Yuekun Yao, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) Saarland University(萨尔兰大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 通过训练语言模型学习不可能和类型学上未证实的语言,跨12种语言实验发现GPT-2小模型能部分区分自然语言与不可能语言,但弱于人类归纳偏置。

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18756 2026-06-16 cs.CL cs.CR 版本更新 57%

Semantic-Preserving Prompt Hijacking: A Black-Box Adversarial Attack on Auto-Prompt Optimization

语义保持提示劫持:针对自动提示优化的黑盒对抗攻击

Chong Zhang, Xiang Li, Jia Wang, Shan Liang, Haochen Xue, Xiaobo Jin

机构 * Jiangsu universities(江苏大学) NSFC(国家自然科学基金委员会) RDF-24-01-016

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL

AI总结 提出一种黑盒条件下的自适应贪婪局部搜索方法,通过层次化分解输入文本、掩码关键语言单元并动态调整候选词,在保持语义相似度的同时最大化模型输出与原始意图的偏差,在2400+测试用例中取得更高攻击成功率。

Comments 12 pages, 8 figures. Accepted by the IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12478 2026-06-12 cs.LG cond-mat.stat-mech quant-ph 新提交 57%

Boltzmann Attention: Learnable Ising Couplings for Cooperative Attention

玻尔兹曼注意力:用于协同注意力的可学习伊辛耦合

Gilhan Kim, Daniel K. Park

机构 * Yonsei University(延世大学)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出玻尔兹曼注意力,通过可学习的伊辛耦合增强注意力机制中的位置间交互,在字符级语言建模和括号匹配任务中优于标准softmax注意力,并展示了量子退火训练的有效性。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09693 2026-06-12 cs.LG stat.ML 版本更新 57%

Contrastive Geometric Learning Unlocks Unified Structure- and Ligand-Based Drug Design

对比几何学习实现统一的结构与配体药物设计

Lisa Schneckenreiter, Sohvi Luukkonen, Lukas Friedrich, Daniel Kuhn, Günter Klambauer

机构 * DeepMind Ltd(DeepMind有限公司)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 提出对比几何模型ConGLUDe,统一结构与配体训练,实现虚拟筛选、靶标钓鱼和配体条件口袋预测,在多项基准测试中表现优异。

Comments Forty-Third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11835 2026-06-11 cs.HC cs.AI 新提交 57%

Designing AI-Supported Focus Groups: A Role x Modality Playbook

设计AI支持的焦点小组:角色×模态剧本

Zhiqing Wang, Steven Dow

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 针对焦点小组资源密集且对引导高度敏感的问题,提出按AI角色(工具、联合主持、主持)和模态(文本、语音、具身)组织的剧本,并分析交互权衡与开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12059 2026-06-11 cs.LG cs.NE nlin.AO 新提交 57%

Attention by Synchronization in Coupled Oscillator Networks

耦合振荡器网络中的同步注意力机制

Fabio Pasqualetti, Taosha Guo

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出基于Kuramoto同步动力学的固定查询振荡器注意力机制,无需指数运算和全局归约,在物理基板上实现注意力计算,并在关键词识别和主谓一致任务上优于softmax。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11116 2026-06-10 cs.CY cs.AI cs.HC 新提交 57%

Designed by Journalists, but Is It for Readers? Rethinking AI Disclosures and Transparency in News

由记者设计,但为读者而设?重新思考AI披露与新闻透明度

Pooja Prajod

机构 * Centrum Wiskunde & Informatica(数学与信息学中心)

专题命中 其他LLM :prompting(abstract);分类 cs.AI

AI总结 研究发现,详细披露会引发透明度困境降低信任,而简短披露造成信息缺口;读者偏好用户代理型设计(如按需详情、AI比例可视化),呼吁HCI社区重新设计披露机制。

Comments Accepted to CHIWORK Workshop (Interrogating GenAI Augmentation for CHIworkers: Strategies for Professional Autonomy and Accountability)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01598 2026-06-09 cs.LG 版本更新 57%

Convergence Bound and Critical Batch Size of Muon Optimizer

Muon优化器的收敛界与临界批量大小

Naoki Sato, Hiroki Naganuma, Hideaki Iiduka

机构 * Meiji University(立命经济大学) Université de Montréal(蒙特利尔大学) Mila(蒙特利尔人工智能研究院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 本文理论分析了Muon优化器在四种实际设置下的收敛性,证明权重衰减确保参数和梯度范数有界,并推导了临界批量大小的下界,揭示了超参数β和λ对其缩放的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13930 2026-06-09 cs.CL 版本更新 57%

Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG

语言裙带关系:多语言RAG中为语言偏好牺牲质量

Dayeon Ki, Marine Carpuat, Paul McNamee, Daniel Khashabi, Eugene Yang, Dawn Lawrie, Kevin Duh

机构 * University of Washington(华盛顿大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 研究多语言RAG系统中模型对英语源文档的偏好,发现模型会牺牲文档相关性以迎合语言偏好,尤其在低资源语言中更明显。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03839 2026-06-03 cs.LG 57%

Text-attributed Graph Condensation via Text Selection and Attribute Matching

通过文本选择和属性匹配的文本属性图压缩

Haowei Han, Yuxiang Wang, Guojia Wan, Hao Wang, Shanshan Feng, Hao Huang, Jiawei Jiang, Xiao Yan

机构 * School of Computer Science Wuhan University(武汉大学计算机学院) Institute for Math & AI Wuhan University(武汉大学数学与人工智能研究院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出TAGSAM方法,通过子图文本选择和属性相似性匹配压缩文本属性图,在保持训练精度的同时显著降低空间和时间消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01964 2026-06-02 cs.CL 57%

Eyettention II: A Dual-Sequence Architecture for Modeling Fixation Location, Within-Word Landing Position, and Fixation Duration in Reading

Eyettention II: 一种用于建模阅读中注视位置、词内着陆位置和注视持续时间的双序列架构

Shuwen Deng, Cui Ding, David R. Reich, Paul Prasse, Lena A. Jäger

机构 * Department of Computer Science, University of Potsdam(波恩大学计算机科学系) Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Department of Informatics, University of Zurich(苏黎世大学信息学系)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出端到端训练的轻量级深度学习模型Eyettention II,通过双序列架构生成包含注视位置、词内着陆位置和注视持续时间的完整扫描路径,在预测性能上超越现有模型并捕捉关键心理语言学现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01557 2026-06-02 cs.LG eess.SP 57%

Everywhere Learning: Artificial Intelligence with Pointwise Constraints

处处学习:具有逐点约束的人工智能

Ignacio Boero, Ignacio Hounie, Luiz Chamon, Alejandro Ribeiro

机构 * Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) École polytechnique, Institut Polytechnique de Paris(巴黎理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出“处处学习”新范式,通过近似对偶理论分析泛化性能,并用稀疏L1惩罚控制泛化,在语言模型任务中验证其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29488 2026-06-02 cs.LG 57%

What Cosine Similarity of Label Representations Can and Cannot Tell us

标签表示的余弦相似度能告诉我们什么,不能告诉我们什么

Beatrix M. G. Nielsen, Andreas Grivas

机构 * IT University of Copenhagen(丹麦哥本哈根技术大学) School of Mathematics, University of Edinburgh(爱丁堡大学数学学院)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 本文证明对于softmax分类器,标签表示(称为unembedding)之间的余弦相似度不提供模型概率的任何信息,而对于sigmoid分类器,所有成对余弦相似度定义了可能的标签组合集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09456 2026-06-02 cs.CV cs.CL cs.CR 57%

IAG: Input-aware Backdoor Attack on VLM-based Visual Grounding

IAG: 基于输入感知的后门攻击针对VLM视觉定位

Junxian Li, Beining Xu, Simin Chen, Jiatong Li, Jingdi Lei, Haodong Zhao, Di Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出IAG方法,通过文本条件UNet动态生成输入感知的触发器,实现首个多目标后门攻击VLM视觉定位,在多个模型和基准上达到最佳攻击成功率且不影响正常性能。

Comments Accepted by CVPR 2026; Code is at https://github.com/lijunxian111/IAG

Journal ref https://openaccess.thecvf.com/content/CVPR2026/papers/Li_IAG_Input-aware_Backdoor_Attack_on_VLM-based_Visual_Grounding_CVPR_2026_paper.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30501 2026-06-01 cs.CL 57%

Linear Ensembles Wash Away Watermarks: On the Fragility of Distributional Perturbations in LLMs

线性集成洗去水印:论LLMs中分布扰动的脆弱性

Zhihao Wu, Gracia Gong, Qinglin Zhu, Yudong Chen, Runcong Zhao

机构 * Department of Informatics, King's College London, UK(伦敦国王学院信息学院) Department of Mathematics, Imperial College London, UK(伦敦帝国学院数学系) Department of Statistics, University of Warwick, UK(沃里克大学统计系)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL

AI总结 本文通过理论和实验证明,当用户访问多个模型时,对输出概率分布进行简单平均即可消除水印,并提出了WASH方法解决集成中的词汇对齐和分词差异问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24535 2026-06-01 cs.CR cs.LG 57%

Steering Beyond the Support: Adversarial Training on Unsupervised Jailbroken Activation Simulation

超越支持域:无监督越狱激活模拟的对抗训练

Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

机构 * University of Technology Sydney, Sydney, Australia(技术悉尼大学) School of Cyber Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) Xi'an Jiaotong University, Xi'an, China(西安交通大学)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.LG

AI总结 针对现有安全引导方法对未见越狱攻击泛化失败的问题,提出基于无监督潜在方向发现的双层对抗训练框架,通过外推拒绝态有害请求激活模拟多样越狱激活,并训练势诱导引导场实现零样本越狱防御。

Comments accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23278 2026-06-01 cs.CL stat.ML 57%

When Is Next-Token Prediction Useful? Marginalization, Ergodicity, Mixture Identifiability, Local Sufficiency, RAG, Tools, and Programming

下一个词预测何时有用?边缘化、遍历性、混合可识别性、局部充分性、RAG、工具与编程

Francesco Corielli

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 本文通过区分完整条件语言过程、边缘文本过程和模型诱导分布,论证了下一个词预测的有效性依赖于强假设(平稳性、代表性、遍历性)以及观察前缀对潜在上下文的充分性,并解释了RAG和工具使用作为条件充分性机制的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29850 2026-05-29 cs.LG 57%

MIRAGE: Adaptive Multimodal Gating for Whole-Brain fMRI Encoding

MIRAGE:用于全脑fMRI编码的自适应多模态门控

Abdulkadir Gokce, Badr AlKhamissi, Martin Schrimpf

机构 * Qwen3-Omni-30B-A3B-Thinking(通义千问3- Omni-30B-A3B-Thinking)

专题命中 其他LLM :foundation model(abstract);分类 cs.LG

AI总结 提出MIRAGE框架,通过原生多模态骨干网络和自适应特征门控,实现全脑fMRI对自然视听刺激的高精度编码,并证明原生多模态特征优于后期融合的单模态特征。

Comments Preprint. First two author contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07789 2026-05-29 cs.MA cs.CL cs.SE 57%

ORACLE-SWE: Quantifying the Contribution of Oracle Information Signals on SWE Agents

ORACLE-SWE:量化Oracle信息信号对SWE代理的贡献

Kenan Li, Qirui Jin, Liao Zhu, Xiaosong Huang, Yijia Wu, Yikai Zhang, Xin Zhang, Zijian Jin, Yufan Huang, Elsie Nallipogu, Chaoyun Zhang, Yu Kang, Saravan Rajmohan, Qingwei Lin, Wenke Lee, Dongmei Zhang

机构 * Microsoft(微软公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 提出Oracle-SWE方法,通过隔离和提取SWE基准测试中的Oracle信息信号,量化每种信号对代理性能的贡献,并评估强语言模型提取的信号对基础代理的性能提升。

Comments Under peer review; 37 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29158 2026-05-29 cs.LG cs.IR q-bio.BM 57%

PROTOCOL: Late Interaction Retrieval for Protein Homolog Search

PROTOCOL: 用于蛋白质同源搜索的延迟交互检索

Gabrielle Cohn, Rohan Gumaste, Minh Hoang, Vihan Lakshman

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28886 2026-05-29 q-bio.QM cs.LG 57%

Computational Modeling of Antibody-Antigen Complexes: PLM-Based and MSA-Based Approaches

抗体-抗原复合物的计算建模:基于PLM和基于MSA的方法

Xiao Luo

机构 * Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥))

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 本研究探讨抗体相关任务计算困难的原因,并提出基于蛋白质语言模型(PLM)和多重序列比对(MSA)的两种互补改进方法,以提升抗体-抗原结构预测精度。

Comments PhD thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28645 2026-05-28 cs.CR cs.CL 57%

GraphSteal: Structural Knowledge Stealing from Graph RAG via Traversal Reconstruction

GraphSteal:通过遍历重建从图RAG中窃取结构知识

Jinze Gu, Qinghua Mao, Xi Lin, Jun Wu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.CL

AI总结 提出一种结构导向的重建框架,通过深度优先启发式搜索和广度优先扩散搜索,从黑盒图RAG系统中高保真恢复隐藏知识图,揭示敏感实体、关系和结构依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27999 2026-05-28 cs.HC cs.AI 57%

Learning to Assign Prediction Tasks to Agents with Capacity Constraints

学习将预测任务分配给具有容量限制的智能体

Shang Wu, Saatvik Kher, Padhraic Smyth

机构 * Department of Computer Science(计算机科学系) University of California, Irvine(加州大学欧文分校)

专题命中 其他LLM :LLM(abstract_cn);分类 cs.AI

AI总结 针对容量受限的多个智能体(人类或AI),提出一种序贯探索-利用策略学习框架,以最大化整体预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16837 2026-05-28 cs.LG 57%

A Structural Theory of Position Bias in Transformers

Transformer中位置偏差的结构理论

Hanna Herasimchyk, Robin Labryga, Tomislav Prusina, Sören Laue

机构 * University of Hamburg(汉堡大学)

专题命中 其他LLM :language model(abstract);分类 cs.LG

AI总结 本文通过残差感知累积注意力展开,提出一种结构理论解释因果Transformer中位置偏差的起源,并揭示残差连接如何改变无限深度下的注意力动力学,从而解释Lost-in-the-Middle现象。

Comments Revised version with improved presentation

详情

展开后加载摘要…

URL PDF HTML 收藏