arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8044 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8044 篇

2603.15547 2026-03-17 cs.CL cs.AI cs.HC 62%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15183 2026-03-17 cs.DC cs.AI cs.LG cs.MA 62%

Token Coherence: Adapting MESI Cache Protocols to Minimize Synchronization Overhead in Multi-Agent LLM Systems

令牌一致性:适应MESI缓存协议以最小化多智能体大语言模型系统中的同步开销

Vladyslav Parakhin

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出令牌一致性理论,通过将MESI协议应用于多智能体系统,减少同步开销,验证了在多智能体大语言模型中同步成本与缓存一致性问题的对应关系,并通过形式化验证协议确保安全性与一致性。

Comments 25 pages. Code and reproduction scripts at https://github.com/hipvlady/agent-coherence

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06107 2026-03-17 cs.CL cs.AI cs.CE 62%

Distributional Semantics Tracing: A Framework for Explaining Hallucinations in Large Language Models

分布语义追踪:一种解释大语言模型幻觉的框架

Gagan Bhatia, Somayajulu G Sripada, Kevin Allan, Jacobo Azcona

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分布语义追踪框架,通过解码残差流状态构建语义图谱,揭示大语言模型幻觉源于表征漂移,通过轻量因果追踪验证假设,实验显示其解释效果优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13301 2026-03-17 cs.IR cs.AI cs.LG 62%

Not All Queries Need Rewriting: When Prompt-Only LLM Refinement Helps and Hurts Dense Retrieval

并非所有查询都需要重写:当仅提示的LLM细化在密集检索中帮助和损害时

Varun Kotte

机构 * Adobe(Adobe公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了仅提示的LLM查询重写对密集检索的影响,发现其效果高度依赖领域,通过实验发现重写在不同数据集上产生不同效果,并指出领域适应性后训练比单纯重写更安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12298 2026-03-16 cs.LG cs.AI 62%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 62%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11950 2026-03-13 cs.AI cs.LG 62%

Learning Transferable Sensor Models via Language-Informed Pretraining

通过语言引导预训练学习可迁移的传感器模型

Yuliang Chen, Arvind Pillai, Yu Yvonne Wu, Tess Z. Griffin, Lisa Marsch, Michael V. Heinz, Nicholas C. Jacobson, Andrew Campbell

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 SLIP通过语言引导预训练学习可迁移的传感器模型,整合对比对齐与传感器条件标注,支持不同时间分辨率和输入长度,实现跨领域任务的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05598 2026-03-13 cs.LG astro-ph.IM cs.AI physics.comp-ph 62%

On the Value of Tokeniser Pretraining in Physics Foundation Models

在物理基础模型中tokenizer预训练的价值

Hadi Sotoudeh, Payel Mukhopadhyay, Ruben Ohana, Michael McCabe, Neil D. Lawrence, Shirley Ho, Miles Cranmer

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。

Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09527 2026-03-11 cs.LG cs.AI 62%

Efficiently Aligning Draft Models via Parameter- and Data-Efficient Adaptation

通过参数和数据高效适应实现草稿模型的高效对齐

Luxi Lin, Zhihang Lin, Zhanpeng Zeng, Yuhao Chen, Qingyu Zhang, Jixiang Luo, Xuelong Li, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Shanghai Innovation Institute(上海创新研究院) Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI)) University of Science and Technology of China (USTC)(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出高效草稿适应框架EDA,通过解耦架构、数据再生策略和样本选择机制,实现草稿模型在特定领域微调时的高效适应,降低训练成本并提升推测解码性能。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 62%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21735 2026-03-11 cs.SE cs.AI cs.CL cs.MA 62%

GateLens: A Reasoning-Enhanced LLM Agent for Automotive Software Release Analytics

GateLens: 一种增强推理能力的LLM代理用于汽车软件发布分析

Arsham Gholamzadeh Khoee, Shuai Wang, Robert Feldt, Dhasarathy Parthasarathy, Yinan Yu

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 GateLens是一种基于LLM的代理,通过引入关系代数作为中间表示,提升复杂表格数据分析的效率与准确性,适用于汽车软件发布分析领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08425 2026-03-10 cs.AI cs.HC cs.LG cs.MA cs.SY eess.SY 62%

IronEngine: Towards General AI Assistant

IronEngine:迈向通用AI助手

Xi Mo

机构 * NiusRobotLab(尼乌斯机器人实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IronEngine通过统一编排核心实现通用AI助手,具备多阶段流程、智能工具路由和高效执行能力,适用于个人助手和自动化框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 62%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03992 2026-03-09 cs.CY cs.AI 62%

Measuring AI R&D Automation

衡量人工智能研发自动化

Alan Chan, Ranay Padarath, Joe Kwon, Hilary Greaves, Markus Anderljung

机构 * GovAI University of Oxford(牛津大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出衡量人工智能研发自动化的指标,以评估其对AI进展和监督的影响,并建议企业和政府采取行动跟踪和管理相关指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04805 2026-03-06 cs.CL cs.AI 62%

Attention's Gravitational Field:A Power-Law Interpretation of Positional Correlation

注意力的引力场:位置相关性的幂律解释

Edward Zhang

机构 * Edward Zhang 1(Edward Zhang)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04516 2026-03-06 cs.LG astro-ph.IM cs.AI 62%

Augmenting representations with scientific papers

用科学论文增强表示

Nicolò Oreste Pinciroli Vago, Rocco Di Tella, Carolina Cuesta-Lázaro, Michael J. Smith, Cecilia Garraffo, Rafael Martínez-Galarza

机构 * Department of Electronics, Information and Bioengineering, Politecnico di Milano(电子工程与信息学院,米兰理工学院) Osservatorio Astronomico di Roma, INAF(罗马天文台,INAF) AstroAI, Center for Astrophysics | | Harvard & Smithsonian(AstroAI,哈佛与史密松尼天体物理中心) Center for Computational Astrophysics, Institute for Advanced Study/The Flatiron Institute(计算天文学中心,高级研究院/Flatiron研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种对比学习框架,通过将X射线光谱与科学文献中的领域知识对齐,提升多模态表示的性能,并在天体物理领域实现了显著的变量估计改进。

Comments Accepted at the 2nd Workshop on Foundation Models for Science (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04045 2026-03-05 cs.LG cs.AI 62%

Inference-Time Toxicity Mitigation in Protein Language Models

蛋白质语言模型中的推理时间毒性缓解

Manuel Fernández Burda, Santiago Aranguri, Iván Arcuschin Moreno, Enzo Ferrante

机构 * Laboratory of Applied Artificial Intelligence (LIAA), Institute of Computer Sciences (ICC), CONICET - Universidad de Buenos(应用人工智能实验室(LIAA)、计算机科学研究所(ICC)、CONICET - 布宜诺斯艾利斯大学) AI Safety Argentina (AISAR)(阿根廷人工智能安全(AISAR)) Goodfire APOLO Biotech(APOLO生物技术)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LDA方法,通过放大logit差异在推理阶段缓解蛋白质语言模型的毒性生成问题,同时保持生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03304 2026-03-05 cs.LG cs.AI 62%

Knowledge Graph and Hypergraph Transformers with Repository-Attention and Journey-Based Role Transport

知识图谱与超图变换器与仓库注意力和基于旅程的角色传输

Mahesh Godavarti

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合句子和结构化数据的模型,通过仓库注意力和基于旅程的角色传输实现语言和知识表示的分离,并支持多任务学习。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03298 2026-03-05 cs.CL cs.AI 62%

TATRA: Training-Free Instance-Adaptive Prompting Through Rephrasing and Aggregation

TATRA: 无需训练的实例自适应提示法通过重述与聚合

Bartosz Dziuba, Kacper Kuchta, Paweł Batorski, Przemysław Spurek, Paul Swoboda

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究机构)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 TATRA通过重述与聚合生成实例特定的少量示例提示,无需训练数据和优化循环,在文本分类和数学推理任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02765 2026-03-04 cs.LG cs.AI 62%

Next Embedding Prediction Makes World Models Stronger

下一步嵌入预测使世界模型更强大

George Bredis, Nikita Balagansky, Daniil Gavrilov, Ruslan Rakhimov

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06084 2026-03-04 cs.CL cs.AI 62%

Spectrum Tuning: Post-Training for Distributional Coverage and In-Context Steerability

频谱调节:面向分布覆盖和上下文可引导性的后训练

Taylor Sorensen, Benjamin Newman, Jared Moore, Chan Park, Jillian Fisher, Niloofar Mireshghallah, Liwei Jiang, Yejin Choi

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Spectrum Tuning方法,通过Spectrum Suite提升模型在多样化分布下的引导能力和输出空间覆盖性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01438 2026-03-03 cs.CL cs.AI 62%

Enhancing Persona Following at Decoding Time via Dynamic Importance Estimation for Role-Playing Agents

通过动态重要性估计增强解码时的个性跟随以用于角色扮演代理

Yuxin Liu, Mingye Zhu, Siyuan Liu, Bo Hu, Lei Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于理论的动态重要性估计方法,通过加权奖励引导解码提升角色扮演代理在动态场景中的个性跟随能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01274 2026-03-03 cs.LG cs.AI 62%

GlassMol: Interpretable Molecular Property Prediction with Concept Bottleneck Models

GlassMol:通过概念瓶颈模型实现可解释的分子属性预测

Oscar Rivera, Ziqing Wang, Matthieu Dagommer, Abhishek Pandey, Kaize Ding

机构 * Northwestern University(西北大学) AbbVie(阿比维)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 GlassMol通过自动化概念整理和LLM引导的概念选择,解决分子属性预测中的可解释性与性能权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14760 2026-03-03 cs.CL cs.AI 62%

Residual Connections and the Causal Shift: Uncovering a Structural Misalignment in Transformers

残差连接与因果偏移:揭示变换器中的结构性不一致

Jonathan Lys, Vincent Gripon, Bastien Pasdeloup, Axel Marmoret, Lukas Mauch, Fabien Cardinaux, Ghouthi Boukli Hacene

机构 * IMT Atlantique, Lab-STICC, UMR CNRS 6285, Brest, France(IMT Atlantique,Lab-STICC,CNRS 6285研究所,布列塔尼,法国) Sony Europe Ltd. Stuttgart Technology Center, EUREC, Germany(索尼欧洲有限公司,斯图加特技术中心,EUREC,德国)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究揭示了自回归变换器中残差连接与因果偏移的结构性不一致,并提出基于残差衰减的轻量级缓解方法,通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05296 2026-03-03 cs.AI cs.LG 62%

Control Tax: The Price of Keeping AI in Check

控制税:保持AI受控的成本

Mikhail Terekhov, Zhen Ning David Liu, Caglar Gulcehre, Samuel Albanie

机构 * EPFL(瑞士联邦理工学院) MATS

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出控制税概念,通过理论框架量化控制成本,评估语言模型在对抗性环境下的安全性,并开发优化的监控策略以平衡安全与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17692 2026-03-03 cs.LG cs.AI 62%

Agentic Unlearning: When LLM Agent Meets Machine Unlearning

代理反学习:当大语言模型代理遇见机器反学习

Bin Wang, Fan Wang, Pingping Wang, Jinyu Cong, Yang Yu, Yilong Yin, Zhongyi Han, Benzheng Wei

机构 * Center for Medical Artificial Intelligence, Shandong University of Traditional Chinese Medicine(山东中医药大学中医人工智能中心) School of Software, Shandong University(山东大学软件学院) School of Medical Information Engineering, Shandong University of Traditional Chinese Medicine(山东中医药大学医学信息工程学院) Shandong Huazhi Talent Technology Co., Ltd.(山东华智人才科技有限公司)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SBU框架,通过同步双更新协议实现参数与记忆路径的联合反学习,有效减少敏感信息痕迹并保持数据保留质量。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22611 2026-03-03 cs.LG cs.AI 62%

Quantile Advantage Estimation: Stabilizing RLVR for LLM Reasoning

分位数优势估计:稳定LLM推理的RLVR

Junkang Wu, Kexin Huang, Jiancan Wu, An Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过分位数优势估计方法,稳定RLVR训练过程,提升LLM推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24174 2026-03-02 cs.CL cs.AI cs.IT math.IT 62%

Task-Centric Acceleration of Small-Language Models

面向任务的小型语言模型加速

Dor Tsur, Sharon Adar, Ran Levy

机构 * Amazon(亚马逊)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TASC框架,通过任务自适应序列压缩方法提升小型语言模型的推理效率,同时保持任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24081 2026-03-02 cs.LG cs.AI 62%

Adaptive Correlation-Weighted Intrinsic Rewards for Reinforcement Learning

自适应相关加权内在奖励用于强化学习

Viet Bac Nguyen, Phuong Thai Nguyen

机构 * Institute for Artificial Intelligence(人工智能研究所) VNU-University of Engineering and Technology(越南工程与技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ACWI通过自适应相关加权内在奖励机制提升稀疏奖励强化学习中的探索效率和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23387 2026-03-02 cs.SD cs.AI cs.CL eess.AS 62%

Hello-Chat: Towards Realistic Social Audio Interactions

Hello-Chat: 向真实社交音频交互迈进

Yueran Hou, Peilei Jia, Zihan Sun, Qihang Lu, Wenbing Yang, Yingming Gao, Ya Li, Jun Gao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Hello-Chat通过大规模真实对话数据和模态交错训练策略,实现了在拟人化生成和情感一致性方面的突破,推动 empathetic AI 的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏