arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 隐私与版权 5 篇

2602.06449 2026-09-01 cs.CL 版本更新 57%

An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models

评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用

Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan

机构 * The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学) Shandong University, Jinan, China(山东大学) Peking University Sixth Hospital, Beijing, China(北京大学第六医院) Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司) Fudan University, Shanghai, China(复旦大学) Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院) Jilin University, Changchun, China(吉林大学) Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司) Shandong First Medical University, Jinan, China(山东第一医科大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.CL

AI总结 本研究提出ClinMPO框架,通过证据引导的强化学习使轻量LLM在复杂精神病学推理任务中达到超越人类的准确率。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29292 2026-09-01 cs.HC 新提交 50%

Measuring the "Interaction Gap" in Drama Therapy with AI

用人工智能测量戏剧治疗中的“互动差距”

Sora Kang

专题命中 隐私与版权 :safety(abstract)

AI总结 本文提出将戏剧治疗中患者与AI伙伴和人类伙伴完成同一任务时的自我表现差异——互动差距,作为诊断视角,探索其反映的社会压力,并提出相关测量设计与研讨问题。

Comments Presented at workshop 'Human-Centered AI for Expressive Arts Therapy' at ACM DIS' 26(Designing Interactive Systems Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全评测 67 篇

2605.29224 2026-09-01 cs.CL cs.AI cs.CR 版本更新 88%

Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents

相关性即漏洞:网络检索如何削弱LLM智能体的安全对齐

Aditya Nawal, Manit Baser, Mohan Gurusamy

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出AgentREVEAL框架,分析检索集成方式和内容属性如何导致LLM智能体安全退化,发现相关性是共同激活条件,并引入HarmURLBench基准。

Comments Accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30842 2026-09-01 cs.CL 新提交 87%

Thesis Proposal: Toward a Human-Centered and Perspective-Aware Framework for Reproducible ML Evaluation and AI Alignment

论文提案:面向可复现的机器学习评估与AI对齐的以人为中心且视角感知的框架

Deepak Pandita, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 针对当前LLM评估掩盖少数视角、加剧AI可复现性危机的问题,论文提出一种以人为中心且视角感知的框架,用于可复现的机器学习评估与AI对齐。

Comments Published at ACL SRW 2026: https://aclanthology.org/2026.acl-srw.74/

Journal ref Proc. ACL SRW (2026) vol. 4 pp. 827-843

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30065 2026-09-01 cs.CL cs.AI 新提交 87%

Pak3H: Evaluating the Cost of Cultural Mismatch in LLM Alignment with a Human-Contextualized Urdu Benchmark

Pak3H:使用人类语境化乌尔都语基准评估LLM对齐中的文化不匹配成本

Abdullah Hashmat, Usman Naseem, Agha Ali Raza

机构 * Macquarie University(麦考瑞大学) Lahore University of Management Sciences(拉合尔管理科学大学)

专题命中 安全评测 :alignment(title,abstract);harmlessness(abstract,comments);safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM对齐中低资源语言的文化不匹配问题,构建了首个人类验证的乌尔都语3H对齐基准Pak3H1,经评估发现多语言LLM存在对齐差距,凸显人工引导本地化评估的必要性。

Comments We introduce Pak3H, a human-validated Urdu benchmark for helpfulness, harmlessness, and honesty. Zero-shot evaluations show LLM performance degrades across all three dimensions in low-resourced contextualized settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30319 2026-09-01 cs.CL cs.AI cs.LG 新提交 85%

Beyond Token-Level Guidance: Inference-Time Alignment of Specialized LLMs via Cross-Family Representation Steering

超越token级引导:通过跨系列表示转向实现专用大语言模型的推理时对齐

Jin Gan, Xin Li, Jun Luo

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) College of Cryptology and Cyber Science, Nankai University(南开大学密码与网络科学学院)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对专用LLM推理时对齐的缺陷,提出CREST方法,通过跨系列表示转向提升安全性,同时保留领域能力,在安全基准上比基线提升达22.2%。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29241 2026-09-01 cs.CL 新提交 84%

When Patients Cut In: Extending Clinical Conversational AI Safety to Interruptions

当患者打断时:将临床对话人工智能的安全性扩展至打断场景

Zachary Ellis, Spencer Hazel, Adam Brandt, Yajie Vera He, Ernest Lim, Jared Joselowitz

机构 * Ufonia Limited(乌福尼亚有限公司) Newcastle University(纽卡斯尔大学)

专题命中 安全评测 :safety(title);AI safety(title);分类 cs.CL

AI总结 该研究针对临床对话AI未考虑患者打断的问题,调整重叠类别为三种操作类型,测试四种LLM配置,发现竞争型FAQ打断下所有模型均出现信息覆盖失败,提出需按单元评估打断鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30912 2026-09-01 cs.AI cs.CL 新提交 84%

Responsible Integration of AI in Cancer Genomics: Barriers, Risks, and Pathways to Trustworthy Clinical Translation

负责任地将人工智能整合到癌症基因组学中:障碍、风险及实现可信赖临床转化的路径

Bahar İlgen, Yiannos Tolias, Denise Kühnert, Paraskevi Papadopoulou, Magnus Westerlund, Dominik Heider, Katharina Ladewig, Georges Hattab

机构 * Robert Koch Institute(罗伯特·科赫研究所) European Commission(欧洲委员会) Deree-The American College of Greece(希腊 Deree 美国学院) Åbo Akademi University(奥布学术大学) Arcada University of Applied Sciences(阿卡达应用科学大学) University of Münster(明斯特大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本综述分析AI与NLP在癌症基因组学临床转化中的障碍,提出应对四大相互关联失败领域的框架与路线图,强调需从系统层面解决问题而非仅提升模型能力。

Comments Review article

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28945 2026-09-01 cs.AI cs.CL 新提交 84%

Automated Researchers Can Reliably Mitigate Alignment Failures

自动研究人员可可靠缓解对齐失败问题

Chen Yueh-Han, Jiaxin Wen, Jan Hendrik Kirchner

机构 * Anthropic UC Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出自动对齐研究人员(AARs)的训练方法,可在保留通用能力的同时缓解10种对齐失败,其效果优于人类研究人员,且无需人类指导,近期具备可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09557 2026-09-01 cs.CV cs.AI 版本更新 83%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences(UCAS)(中国科学院大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在复杂城市场景中推理可靠性不足及现有基准无法诊断推理过程的问题,提出AD2-Bench基准与EGVOR方法,提升了不利条件下多模态推理的稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29529 2026-09-01 cs.CL cs.AI 新提交 81%

Argument-Aware Semantic Alignment of Normative Texts: A Toulmin-Based Neuro-Symbolic Approach

规范文本的论元感知语义对齐:一种基于图尔敏的神经符号方法

William Schroeder

机构 * Purdue University(普渡大学) Cleantech Software(清洁技术软件公司)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对专业规范文本语义对齐难题,提出结合神经文本表示与图尔敏特征的神经符号方法,在网络安全标准映射基准上验证论元结构特征可提升对齐效果。

Comments 11 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29270 2026-09-01 cs.CL cs.AI 新提交 81%

SHADOWBENCH: Toward Reliable Automatic Evaluation of Semantic Alignment in Autoformalization

SHADOWBENCH:迈向自动形式化中语义对齐的可靠自动评估

Hojae Han, Jongyoon Kim, Sanghyuk Park, Dongwook Cheon, Myungjae Jeon, Sunjong Choi, Soonho Kong, Wonseok Heo, Seung-won Hwang, Donghoon Hyeon

机构 * Electronics and Telecommunications Research Institute(电子通信研究院) Seoul National University(首尔大学) University of Maryland, College Park(马里兰大学帕克分校) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对自动形式化评估的缺陷,该研究提出SA-Pass方法并构建ShadowBench基准,实验显示其与专家判断一致性达98.8%,且被用作ICML 2026 AI4Math挑战赛第4赛道基准。

Comments EMNLP 2026

Journal ref The 2026 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05985 2026-09-01 cs.CL cs.CY 版本更新 81%

Beyond Alignment: Value Diversity as a Collective Property in Multicultural Agent Systems

超越对齐:多元文化智能体系统中的价值多样性作为集体属性

Shaoyang Xu, Jingshen Zhang, Long P. Hoang, Jinyuan Li, Wenxuan Zhang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Washington University in St. Louis(华盛顿大学圣路易斯分校)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.CY

AI总结 针对多元文化多智能体系统,提出以价值多样性作为系统级评估轴,通过文化条件化智能体在共享价值调查中的响应差异度量,发现多样性几乎与对齐无关,且当前系统远低于人类社会,混合骨干系统缩小但未消除差距,社会互动进一步侵蚀多样性。

Comments emnlp2026findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02482 2026-09-01 cs.LG cs.CL cs.CV cs.SD eess.AS 版本更新 81%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Zinuo Cheng, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Accepted to EMNLP 2026 (System Demonstrations)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31137 2026-09-01 cs.AI 新提交 79%

OntoAligner-Ensemble: Voting-Based Fusion across Heterogeneous Ontology Alignment Techniques

OntoAligner-Ensemble:基于投票的异构本体对齐技术融合

Hamed Babaei Giglou, Sören Auer, Peio Popov, Mahsa Sanaei, Jennifer D'Souza

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心) L3S Research Center, Leibniz University of Hannover(汉诺威莱布尼茨大学L3S研究中心) Graphwise University of Tabriz(大不里士大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 该研究提出OntoAligner-Ensemble框架,通过两阶段投票融合策略整合异构OA对齐器,经OAEI八任务验证,可提升精确率-召回率平衡,为OA提供实用集成选择指导。

Comments 14 pages, 1 figure, accepted for OM-2026 workshop at ISWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29948 2026-09-01 cs.CL 新提交 79%

XQDT: eXplainable and Quantitative Data-Text Alignment Metric with Feedback Signals

XQDT:带反馈信号的可解释定量数据-文本对齐指标

Kun Efimov-Zhang, Yifei Song, Claire Gardent

机构 * CNRS/LORIA(法国国家科学研究中心/洛里亚研究所) Université de Lorraine(洛林大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出带反馈信号的可解释定量数据-文本对齐指标XQDT,通过微调语言模型识别数据-文本对的各类数据单元,在基准测试中性能优于LLM作为评判方法,可用于评估及下游修正优化。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29209 2026-09-01 cs.CL cs.HC 新提交 79%

Toward Cultural Alignment: Human-Centered Evaluation of Multimodal AI Stories Across Five African Communities

迈向文化对齐:五个非洲社区对多模态AI故事的以人为中心的评估

Millicent Ochieng, Felermino D. M. A. Ali, Elizabeth A. Ankrah, Najeeb Gambo Abdulhamid, Migisha Boyd, Stephanie Nyairo, Mercy Muchai, Samuel Chege Maina, Aditya Vashistha, Anja Thieme, Jacki O'Neill

机构 * Microsoft Research Africa(微软研究院非洲分部) Swansea University(斯旺西大学) Cornell University(康奈尔大学) Microsoft Research Cambridge(微软研究院剑桥分部)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文以五个非洲社区为对象,通过混合方法评估AI生成多模态故事的文化对齐情况,构建了相关分类体系,并发现多模态LLM裁判需经社区校准才能可靠评估文化对齐。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24621 2026-09-01 cs.CL 版本更新 79%

Beyond Semantic Accuracy: Consequence-Aware Evaluation for Safety-Critical Language Understanding

超越语义准确率:面向安全关键型语言理解的后果感知评估

Yujing Chang, Thinh Pham, Van-Phat Thai, Chunyao Ma, Yash Guleria, Pham Nhut Huy, Sameer Alam

机构 * ATMRI, Nanyang Technological University (NTU)(南洋理工大学ATMRI) Centre of AI Research, VinUniversity(文大学人工智能研究中心) School of Management, Indian Institute of Technology Mandi(印度理工大学曼迪分校管理学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 针对空管场景,研究发现传统NLP指标会误判语言模型的操作可靠性,提出后果感知评估可弥补语义-安全差距,为安全关键型部署提供必要补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11167 2026-09-01 cs.CL eess.AS 版本更新 79%

Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models

全双工语音模型中的多面交互对齐

Atsumoto Ohashi, Neil Zeghidour, Alexandre Défossez, Eugene Kharitonov

机构 * Kyutai Gradium

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 针对全双工对话模型交互性问题,提出基于强化学习的后训练对齐方法,从暂停处理、话轮转换、回馈和用户打断四个维度优化,并加入LLM奖励防止语义退化,在Moshi和PersonaPlex上取得一致改进。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08531 2026-09-01 cs.AI 版本更新 79%

ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents

VESTA: 一种全自动的LLM智能体场景生成与安全评估框架

Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng

机构 * BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室) Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院) Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Long-term AI(长期人工智能)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出VESTA框架,基于五个风险维度自动生成1072个可执行场景,评估12个LLM智能体在任务执行中的行为安全风险,平均攻击成功率达47.1%。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-09-01 cs.CV cs.AI 版本更新 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21799 2026-09-01 cs.LG 版本更新 79%

The Double-Edged Nature of the Rashomon Set for Trustworthy Machine Learning

拉索蒙集在可信机器学习中的双刃剑性质

Ethan Hsu, Harry Chen, Chudi Zhong, Lesia Semenova

机构 * Duke University(杜克大学) MIT(麻省理工学院) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Rutgers University(罗格斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 研究揭示了拉索蒙集在可信机器学习中的双刃剑性质,指出其在提升鲁棒性的同时也带来隐私风险。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28728 2026-09-01 cs.AI 新提交 77%

PermitGPT: A Unified Generative-AI Pipeline for Construction Hazard Forecasting, Permit Prediction, and Community Impact

PermitGPT:用于施工危险预测、许可证预测及社区影响评估的统一生成式AI流水线

Mohd Ruhul Ameen, Farjana Aktar, Akif Islam, Momen Khandoker Ope, Abu Saleh Musa Miah, Jungpil Shin

机构 * University of Rajshahi(拉杰沙希大学) University of Aizu(会津大学)

专题命中 安全评测 :safety(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 PermitGPT是用于施工治理的统一生成式AI框架,对齐多源数据生成9万对训练样本,微调三类模型在2833个测试用例上取得互补表现,助力施工危险、许可及社区影响的决策支持。

Comments 1 figure, 3 tables, Accepted at 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

Journal ref 2026 International Conference on Power, Electronics, Communications, Computing, and Intelligent Infrastructure (PECCII)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30428 2026-09-01 cs.CL cs.AI cs.CV cs.LG 新提交 75%

Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions

我们能看见的谎言:具身社交交互中VLM智能体的联合言语与非言语欺骗

Jaewoo Ahn, Junseo Kim, Hyunseo Kim, Heeseung Yun, Jaehyeon Son, Zsolt Kira, Gunhee Kim

机构 * Seoul National University(首尔大学) Inha University(仁荷大学) KAIST(韩国科学技术院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建了3D多模态社交推理游戏测试平台MineAmongUs,提出可配置VLM智能体控制程序ARIA,发现非言语通道是VLM智能体欺骗取胜的更关键因素,为具身VLM智能体对齐研究开辟新方向。

Comments Workshop on Agent Behavior (WAB) at COLM 2026. Project page: https://junseokim0103.github.io/Lies-We-Can-See/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29118 2026-09-01 cs.AI cs.CL cs.LG 新提交 75%

Emergent Misalignment Is Not Magical

涌现失配并非神奇现象

Mingxuan Li, Qirun Dai, Heran Wang, Chenhao Tan

机构 * The University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示涌现失配(EM)是可预测的数据依赖泛化现象,通过表征距离可预测其效果,还扩展了泛化指标,能可靠预测EM模型在语义保留提示扰动下的邪恶程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24614 2026-09-01 cs.CL cs.AI cs.LG 版本更新 75%

Measuring the Depth of LLM Unlearning via Activation Patching

通过激活修补测量大语言模型遗忘的深度

Jaeung Lee, Dohyun Kim, Jaemin Jo

机构 * Sungkyunkwan University(全北大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。

Comments Accepted to EMNLP 2026 Main Conference. 18 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-09-01 cs.NI cs.AI cs.CR 版本更新 74%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 59 pages, 13 figures, 8 tables. Survey article. Accompanying evidence-audit dataset available on Mendeley Data, doi: 10.17632/2p5ppxzy4s.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30144 2026-09-01 cs.RO 新提交 71%

Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving

重新思考语言在自动驾驶高效视觉-语言-动作(VLA)模型中的作用:迈向更智能、可信的驾驶

Tongfei Guo, Lili Su

机构 * Northeastern University(东北大学)

专题命中 安全评测 :trustworthy(title)

AI总结 本研究针对自动驾驶VLA模型的高推理开销问题,提出语言残差分类法梳理高效语言使用方法,在多基准上分析适配性,将发布相关代码仓库。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12449 2026-09-01 cs.CR cs.AI 版本更新 70%

AgenTRIM: Tool Risk Mitigation for Agentic AI

AgenTRIM:代理AI的工具风险缓解

Roy Betser, Amit Giloni, Shamik Bose, Sindhu Padakandla, Chiara Picardi, Lidor Erez, Roman Vainshtein

机构 * Fujitsu Research of Europe (FRE)(富士通欧洲研究(FRE)) Fujitsu Research of India Pvt. Ltd. (FRIPL)(富士通印度私人有限公司(FRIPL))

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 AgenTRIM通过离线和在线阶段检测并缓解代理AI中工具驱动的风险,减少攻击成功率同时保持任务性能。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20624 2026-09-01 cs.AI cs.CL cs.LG stat.ML 版本更新 67%

In LLM Reasoning, there is Irrationality on top of Value Misalignment

在LLM推理中,价值对齐之上存在非理性

Kejiang Qian, Fengxiang He

机构 * University of Edinburgh(爱丁堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出理性价值风险概念,形式化LLM在推理中即使价值对齐也可能无法最大化对齐价值的问题,并通过实验验证该风险普遍存在且无法被对齐消除。

Comments Published in the 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP) as a Main Conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏