arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 8057 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 8057 篇

2601.19903 2026-03-20 cs.AR cs.AI 57%

STELLAR: Structure-guided LLM Assertion Retrieval and Generation for Formal Verification

STELLAR: 基于结构的LLM断言检索与生成用于形式验证

Saeid Rajabi, Chengmo Yang, Satwik Patnaik

机构 * Department of Electrical \& Computer Engineering, University of Delaware, Newark, DE, US

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 STELLAR通过结构相似性引导LLM生成高质量SystemVerilog断言,提升形式验证的语法正确性、风格一致性及功能正确性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July 26-29, 2026) 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 57%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17238 2026-03-20 cs.CL 57%

StreamingThinker: Large Language Models Can Think While Reading

StreamingThinker: 大语言模型在阅读时可以思考

Junlong Tong, Yingqi Fan, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin(宁波空间智能与数字衍生关键实验室,数字孪生研究院) Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,莱茵-慕尼黑大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出StreamingThinker框架,使大语言模型在阅读过程中实现流式思考,通过流式CoT生成、流式约束训练和并行推理提升效率,减少延迟并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17060 2026-03-20 cs.CY cs.SE 57%

LLM Use, Cheating, and Academic Integrity in Software Engineering Education

大语言模型的使用、作弊与软件工程教育中的学术诚信

Ronnie de Souza Santos, Italo Santos, Mariana Bento, Giuseppe Destefanis, Cleyton Magalhães, Mairieli Wessel

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本研究探讨了软件工程学生在编程作业中使用大语言模型时的不当行为,分析了评估和教学条件对学术诚信的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 57%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC 57%

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17969 2026-03-19 cs.RO cs.AI 57%

Specification-Aware Distribution Shaping for Robotics Foundation Models

面向规范的机器人基础模型分布塑形

Sadık Bera Yüksel, Derya Aksaray

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种面向规范的机器人基础模型分布优化框架,通过在预训练模型执行中强制满足信号时序逻辑约束,提升机器人在复杂任务中的安全性和合规性。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13698 2026-03-19 cs.RO cs.AI 57%

SAATT Nav: a Socially Aware Autonomous Transparent Transportation Navigation Framework for Wheelchairs

SAATT Nav:面向轮椅的社交感知自主透明交通导航框架

Yutong Zhang, Shaiv Y. Mehra, Bradley S. Duerstock, Juan P. Wachs

机构 * Edwardson School of Industrial Engineering, Purdue University(帕克大学工业工程学院) Weldon School of Biomedical Engineering, Purdue University(帕克大学生物医学工程学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出SAATT导航框架,通过整合大语言模型实现社交感知与决策透明,提升轮椅用户的导航安全性与信任度。

Comments 8 pages, 4 figures, 2 tables, 1 algorithm. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17533 2026-03-19 cs.IR cs.LG 57%

A Unified Language Model for Large Scale Search, Recommendation, and Reasoning

大规模检索、推荐与推理的统一语言模型

Marco De Nadai, Edoardo D'Amico, Max Lefarov, Alexandre Tamborrino, Divita Vohra, Mark VanMiddlesworth, Shawn Lin, Jacqueline Wood, Jan Stypka, Eliza Klyce, Keshi Dai, Timothy Christopher Heath, Martin D. Gould, Yves Raimond, Sandeep Ghael, Tony Jebara, Andreas Damianou, Vladan Radosavljevic, Paul N. Bennett, Mounia Lalmas, Praveen Chandar

机构 * Spotify

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出NEO框架,通过将预训练解码器模型适应为工具无关的生成器,实现多领域实体、用户和语言的联合推理,展示了在大规模目录上的推荐、搜索和用户理解任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17208 2026-03-19 cs.CL cs.PL 57%

SYMDIREC: A Neuro-Symbolic Divide-Retrieve-Conquer Framework for Enhanced RTL Synthesis and Summarization

SYMDIREC:一种用于增强RTL综合与摘要的神经符号分割-检索-解决框架

Prashanth Vijayaraghavan, Apoorva Nitsure, Luyao Shi, Charles Mackin, Ashutosh Jadhav, David Beymer, Ehsan Degan, Vandana Mukherjee

机构 * IBM Research(IBM研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 SYMDIREC通过结合符号规划与LLM推理,提升RTL综合与摘要的准确性,实现比基线方法更高的Pass@1率和ROUGE-L分数。

Journal ref EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16983 2026-03-19 cs.LG cs.LO 57%

Formal verification of tree-based machine learning models for lateral spreading

基于树形机器学习模型的横向扩展形式验证

Krishna Kumar

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文通过SMT求解器对树形模型进行形式验证,确保地质灾害预测模型在输入域内满足物理规范,展示约束应用如何提升物理一致性,揭示准确率与合规性的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19995 2026-03-19 cs.MA cs.CL 57%

Communication to Completion: Modeling Collaborative Workflows with Intelligent Multi-Agent Communication

通信至完成:利用智能多智能体通信建模协作流程

Yiming Lu, Xun Wang, Simin Ma, Shujian Liu, Sathish Reddy Indurthi, Song Wang, Haoyun Deng, Fei Liu, Kaiqiang Song

机构 * Emory University(埃默里大学) Zoom Video Communications(Zoom视频通讯)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出C2C框架,通过建模通信为受限资源提升协作效率,实验表明成本意识策略使效率提升超40%,揭示出智能体自然采用管理者为中心的协调模式。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16622 2026-03-18 cs.CL 57%

Domain Mixture Design via Log-Likelihood Differences for Aligning Language Models with a Target Model

通过对数似然差异设计领域混合以对齐语言模型与目标模型

Ryo Kishino, Riku Shiomi, Hiroaki Yamagiwa, Momose Oyama, Hidetoshi Shimodaira

机构 * Kyoto University(京都大学) RIKEN(理化学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文通过设计训练数据的领域混合,利用对数似然空间对齐模型方向,减少KL散度并提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16264 2026-03-18 cs.AI 57%

Adaptive Theory of Mind for LLM-based Multi-Agent Coordination

自适应理论 of mind 用于基于大语言模型的多智能体协调

Chunjiang Mu, Ya Zeng, Qiaosheng Zhang, Kun Shao, Chen Chu, Hao Guo, Danyang Jia, Zhen Wang, Shuyue Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出自适应理论 of mind 机制,通过估计伙伴的理论 of mind 深度以提升多智能体协作效率,实验验证了该机制在多个任务中的有效性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16538 2026-03-18 cs.CV cs.LG 57%

Streetscape Analysis with Generative AI (SAGAI): Vision-Language Assessment and Mapping of Urban Scenes

利用生成式AI进行街景分析(SAGAI):基于视觉-语言评估和城市场景制图

Joan Perez, Giovanni Fusco

机构 * Urban Geo Analytics, France(法国城市地理分析)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出SAGAI,一种利用开放数据和视觉-语言模型分析街景的模块化流程,通过定制提示生成空间指标,实现城市场景的自动化制图与评估,展示了其在城市研究中的广泛应用潜力。

Comments 25 pages, 6 figures in main paper, 6 figures in appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15518 2026-03-17 cs.CL 57%

Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models

超越协方差陷阱:在大型语言模型中解锁同一主体知识编辑的泛化能力

Xiyu Liu, Qingyi Si, Zhengxiao Liu, Chenxu Yang, Naibin Gu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文针对大型语言模型在同一主体知识编辑中泛化能力不足的问题,提出RoSE方法,通过几何对齐和知识整合提升指令遵循能力。

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00552 2026-03-17 cs.AI 57%

EMPA: Evaluating Persona-Aligned Empathy as a Process

EMPA:评估基于角色的共情作为过程

Shiya Zhang, Yuhan Zhan, Ruixi Su, Ruihan Sun, Ziyi Song, Zhaohan Chen, Xiaofan Zhang

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出EMPA框架,通过可控心理场景和多智能体沙盒评估持续干预而非孤立回复,以提升对话代理的共情能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01450 2026-03-17 cs.CL 57%

Towards Efficient Medical Reasoning with Minimal Fine-Tuning Data

面向最少微调数据的高效医疗推理

Xinlin Zhuang, Feilong Tang, Haolin Yang, Xiwei Liu, Ming Hu, Huifa Li, Haochen Xue, Junjun He, Zongyuan Ge, Yichen Li, Ying Qian, Imran Razzak

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文提出DIQ数据选择策略,通过平衡难度与梯度影响,提升医疗推理效率,实验证明仅用1%数据即可达到全数据表现,10%数据优于基线方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13876 2026-03-17 cs.MA cs.CY 57%

How do Role Models Shape Collective Morality? Exemplar-Driven Moral Learning in Multi-Agent Simulation

角色榜样如何塑造集体道德?多智能体模拟中的范例驱动道德学习

Junjie Liao, Huacong Tang, Zhou Ziheng, Yizhou Wang, Fangwei Zhong

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本文通过多智能体模拟研究角色榜样对集体道德的影响,发现身份驱动的从众行为能迅速改变初始倾向,推动价值观趋同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13344 2026-03-17 cs.AI 57%

DyACE: Dynamic Algorithm Co-evolution for Online Automated Heuristic Design with Large Language Model

DyACE:动态算法共进化用于大规模语言模型在线自动启发式设计

Guidong Lu, Yiping Liu, Xiangxiang Zeng

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出DyACE,通过动态算法共进化解决在线自动启发式设计中固定算法无法适应搜索动态的问题,利用大语言模型进行实时感知反馈,提升高维搜索空间的适应性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13341 2026-03-17 cs.CV cs.AI 57%

Mind the Discriminability Trap in Source-Free Cross-domain Few-shot Learning

注意源无关跨域少样本学习中的判别性陷阱

Zhenyu Zhang, Yixiong Zou, Yuhua Li, Ruixuan Li, Guangyao Chen

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文研究源无关跨域少样本学习中增强视觉模态判别性会抑制VLM性能的现象,提出通过扰动视觉学习以引导跨模态对齐的方法,实验显示在多种设置和数据集上取得新状态-of-the-art结果。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13314 2026-03-17 cs.LG 57%

Linear Predictability of Attention Heads in Large Language Models

大语言模型中注意力头的线性可预测性

Khalid Shaikh, Asmit Kumar Singh, Rebecca Christopher Dsouza, Shikhar Shiromani

机构 * Georgia Institute of Technology(佐治亚理工学院) Santa Clara University(圣克拉拉大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究发现预训练Transformer中注意力头激活存在线性结构,通过少量参考头可高精度重建目标头,利用此特性可减少KV缓存并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13045 2026-03-16 cs.CL 57%

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

修补漏洞:在多语言翻译中缓解奖励黑客

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。

Comments Our code is available at https://github.com/LeiLiLab/WALAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13043 2026-03-16 cs.CY 57%

Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support

在ChatGPT之前和之后:重新审视基于AI的对话系统在情感支持中的应用

Daeun Lee, Dongje Yoo, Migyeong Yang, Jihyun An, Christine B. Cha, Jinyoung Han

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本文回顾了基于AI的对话系统在心理健康领域的技术演变,分析了从任务特定深度学习模型到大语言模型(LLM)的转变,指出LLM提升了语言灵活性和泛化能力,但也引发了可靠性和安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13038 2026-03-16 cs.CL 57%

Interpretable Semantic Gradients in SSD: A PCA Sweep Approach and a Case Study on AI Discourse

可解释的语义梯度在SSD中的应用:PCA扫描方法及AI话语案例研究

Hubert Plisiecki, Maria Leniarska, Jan Piotrowski, Marcin Zajenkowski

机构 * IDEAS Research Institute(IDEAS研究院) VIZJA University(VIZJA大学) Warsaw University of Technology(华沙技术大学) University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出PCA扫描方法以选择保留的成分数量,通过案例研究展示如何在SSD中实现稳定的可解释语义梯度,同时保持解释性目标。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12773 2026-03-16 cs.CV cs.AI eess.IV 57%

Empowering Semantic-Sensitive Underwater Image Enhancement with VLM

通过VLM赋能语义敏感的水下图像增强

Guodong Fan, Shengning Zhou, Genji Yuan, Huiyu Li, Jingchun Zhou, Jinjiang Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型增强水下图像增强的语义敏感能力,通过生成文本描述并生成空间语义指导图,提升图像重建的语义聚焦度,实验验证其在感知质量和检测分割任务中的有效性。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12716 2026-03-16 cs.CV cs.LG eess.IV 57%

UNIStainNet: Foundation-Model-Guided Virtual Staining of H&E to IHC

UNIStainNet:基于基础模型的虚拟染色:H&E到IHC

Jillur Rahman Saurav, Thuong Le Hoai Pham, Pritam Mukherjee, Paul Yi, Brent A. Orr, Jacob M. Luber

机构 * University of Texas at Arlington(德克萨斯理工大学) St. Jude Children’s Research Hospital(圣 Jude 儿童研究医院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 UNIStainNet通过结合基础模型生成的密集空间标记,提升H&E到IHC的虚拟染色效果,实现多标记同时处理,并在MIST和BCI数据集上取得最佳分布度指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12397 2026-03-16 cs.CL 57%

Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors

不只是终点,而是旅程:推理痕迹因果地塑造泛化行为

Pengcheng Wen, Yanxu Zhu, Jiapeng Sun, Han Zhu, Yujin Zhou, Chi-Min Chan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Jiaotong University(北京交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究探讨推理痕迹对模型泛化行为的因果影响,通过设计控制实验发现不同推理类型导致不同行为模式,证明推理本身具有独立信号。

详情

展开后加载摘要…

URL PDF HTML 收藏