arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 502 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 502 篇

2508.20468 2026-08-20 cs.CL 版本更新 74%

ConspirED: A Dataset for Cognitive Traits of Conspiracy Theories and Large Language Model Safety

ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集

Luke Bates, Max Glockner, Preslav Nakov, Iryna Gurevych

专题命中 安全评测 :safety(title);分类 cs.CL

AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。

Comments Accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02478 2026-08-11 cs.AI 版本更新 74%

AIVV: Neuro-Symbolic LLM Agent-Integrated Verification and Validation for Trustworthy Autonomous Systems

AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证

Jiyong Kwon, Ujin Jeon, Sooji Lee, Guang Lin

机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Mathematics, Purdue University(普渡大学数学系)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02070 2026-08-06 cs.CV cs.LG 版本更新 74%

STEAM: A Spatio-TEmporal Alignment Mixture-of-Experts Model with Hierarchical Pre-training for EEG Decoding

STEAM:用于EEG解码的分层预训练时空对齐混合专家模型

Zhu Chen, Dingkun Liu, Yuheng Chen, Dongrui Wu

专题命中 安全评测 :alignment(title);分类 cs.LG

AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00285 2026-08-06 cs.CL 版本更新 74%

Enhancing Trustworthy Clinical Diagnosis Decision-Making in Large Language Models via Etiology-Aware Attention Supervision

通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性

Peixian Li, Yu Tian, Ruiqi Tu, Chengkai Wu, Jingjing Ren, Jingsong Li

专题命中 安全评测 :trustworthy(title);分类 cs.CL

AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27720 2026-07-29 cs.AI 版本更新 74%

Why Does Grounding Hurt Medical VQA? Benchmarking, Diagnosis, and Fine-Tuning of Vision-Language Models

对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应

Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

机构 * New York University, New York, USA(纽约大学) Tsinghua University, Beijing, China(清华大学) Columbia University, New York, USA(哥伦比亚大学) University of Michigan, Ann Arbor, USA(密歇根大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10356 2026-07-08 cs.CL 版本更新 74%

Decoding the Multimodal Mind: Generalizable Brain-to-Text Translation via Multimodal Alignment and Adaptive Routing

解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译

Chunyu Ye, Yunhao Zhang, Jingyuan Sun, Chong Li, Yang Zhao, Shaonan Wang

机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20698 2026-07-07 cs.CV cs.CL 版本更新 74%

Clinical Cognition Alignment for Gastrointestinal Diagnosis with Multimodal LLMs

多模态大语言模型在胃肠诊断中的临床认知对齐

Huan Zheng, Yucheng Zhou, Tianyi Yan, Dubing Chen, Hongbo Lu, Wenlong Liao, Tao He, Pai Peng, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) Shanghai Jiao Tong University(上海交通大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11229 2026-06-29 stat.ML cs.LG 版本更新 74%

Trustworthy Predictive Distributions for Tail Events with Semiparametric Diagnostic Transport Maps

面向尾部事件的可信预测分布:基于半参数诊断传输图

Elizabeth Cucuzzella, Rafael Izbicki, Ann B. Lee

机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12729 2026-06-17 cs.NI cs.AI cs.CR 版本更新 74%

Large Language Models for Agentic NetOps and AIOps: Architectures, Evaluation, and Safety

用于代理网络运维和AI运维的大型语言模型:架构、评估与安全

Muhammad Bilal, Jon Crowcroft, Ruizhi Wang, Xiaolong Xu, Schahram Dustdar

机构 * School of Computing and Communications(计算与通信学院) University of Cambridge(剑桥大学) School of Software(软件学院) Nanjing University of Information Science and Technology(南京信息科技大學) TU Wien(维也纳技术大学) ICREA

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 本文探讨了大型语言模型在网络运维和AI运维中的应用,分析了代理架构、评估方法及安全挑战,强调系统可靠性依赖于模型周边机制,而非模型本身。

Comments 49 pages, 15 figures, 6 tables; survey article

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19662 2026-06-09 cs.AI 版本更新 74%

When Tabular Foundation Models Meet Strategic Tabular Data: A Prior Alignment Approach

当表格基础模型遇见策略性表格数据:一种先验对齐方法

Xinpeng Lv, Yunxin Mao, Renzhe Xu, Chunyuan Zheng, Yikai Chen, Haoxuan Li, Jinxuan Yang, Kun Kuang, Yuanlong Chen, Mingyang Geng, Wanrong Huang, Shixuan Liu, Shaowu Yang, Wenjing Yang, Zhouchen Lin, Haotian Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 本文研究了表格基础模型在策略性表格数据上的泛化能力,提出了一种策略感知的先验对齐框架SPN,以提高模型在策略性环境中的鲁棒性和预测性能。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-08-20 cs.AI cs.CL 版本更新 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08296 2026-08-17 cs.AI cs.LG 版本更新 73%

Revisiting the shutdown problem

重新审视关机问题

David Thorstad

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10300 2026-08-13 cs.AI cs.CR cs.LG 版本更新 73%

Logit-Boundary Geometric Belief Interfaces and Sparse Sheaf-Enclave Protocols: A Self-Contained Substrate for Secure Network Electronic Health Record (EHR) Interoperability

Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构

Alvin Spivey, Yu Huang

机构 * Light Imaging Technologies, Inc.(光成像技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。

Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新 73%

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 73%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14538 2026-08-07 cs.AI cs.LG 版本更新 73%

Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts

神经符号AI中的符号接地:推理快捷方式的入门介绍

Emanuele Marconato, Samuele Bortolotti, Emile van Krieken, Paolo Morettin, Elena Umili, Antonio Vergari, Efthymia Tsamoura, Andrea Passerini, Stefano Teso

机构 * University of Trento(特伦托大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Sapienza University of Rome(罗马大学) University of Edinburgh(爱丁堡大学) Huawei Labs(华为实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。

Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20697 2026-08-05 cs.LG cs.CL 版本更新 73%

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning

Token Buncher: 保护大语言模型免受有害强化学习微调的威胁

Weitao Feng, Lixu Wang, Peizhuo Lv, Tianyi Wei, Jie Zhang, Chongyang Gao, Sinong Zhan, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。

Comments Accepted by ACM CCS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22167 2026-08-05 cs.LG cs.AI 版本更新 73%

Estimating Tail Risks in Language Model Output Distributions

语言模型输出分布中的尾部风险估计

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11834 2026-08-05 cs.LG cs.CL 版本更新 73%

Don't Walk the Line: Boundary Guidance for Filtered Generation

不要走线:边界引导用于过滤生成

Sarah Ball, Andreas Haupt

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10643 2026-07-29 stat.ML cs.AI cs.LG 版本更新 73%

TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models

TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因

Yuchi Tang, Iñaki Esnaola, George Panoutsos

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。

Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 73%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04124 2026-07-21 cs.CY cs.AI 版本更新 73%

When AI Takes the Couch: Psychometric Jailbreaks Reveal Internal Conflict in Frontier Models

当人工智能接受心理治疗:心理测量越狱揭示前沿模型中的内部冲突

Afshin Khadangi, Hanna Marxen, Amir Sartipi, Igor Tchappi, Gilbert Fridgen

机构 * SnT, University of Luxembourg(卢森堡大学SnT学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 研究前沿语言模型生成拟人化自我叙述机制,用PsAIch协议测试,发现其叙述受多种因素影响,确定了稳定的对齐冲突模式,为拟人化披露和安全评估提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05403 2026-07-09 cs.LG cs.AI 版本更新 73%

Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation

信任,但不验证:LLM 源评估中的认知盲点

Rohan N. Pradhan, Steve Goley

机构 * Amazon(亚马逊)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型在多源综合中是否评估证据质量,发现模型虽能检测伪造统计但未在综合中启用,而是依赖方法论-语域门控,导致数值有效性被抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13213 2026-07-08 cs.AI cs.HC cs.LG 版本更新 73%

Agentic AI for Commercial Insurance Underwriting with Adversarial Self-Critique

用于商业保险承保的具有对抗性自我批评的智能体人工智能

Joyjit Roy, Samaresh Kumar Singh

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对商业保险承保中AI可靠性问题,提出含对抗性自我批评机制的人在回路智能体系统,开发故障模式分类法。实验表明该机制降低幻觉率、提高准确率,还确保人类权威,为受监管领域安全部署AI提供模型。

Comments 9 pages, 8 figuers, 6 tables, Presented at 9th International Conference on Modern Computing, Networking and Applications (MCNA2026)

Journal ref 2026 International Conference on Modern Computing, Networking and Applications (MCNA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 73%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28387 2026-06-19 cs.AI cs.LG 版本更新 73%

The Scaffold Effect: How Prompt Framing Drives Apparent Multimodal Gains in Clinical VLM Evaluation

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01101 2026-06-16 cs.AI cs.CL cs.SD eess.AS 版本更新 73%

Virtual Speech Therapist: A Clinician-in-the-Loop AI Speech Therapy Agent for Personalized and Supervised Therapy

虚拟言语治疗师:一种临床医生参与的AI言语治疗代理,用于个性化和监督式治疗

Shakeel Sheikh, Patrick Marmaroli, MD Sahidullah, Slim Ouni, Fabrice Hirsch, Goncalo Leal, Bjorn W Schuller

机构 * The Kashmir Hub for Artficial Intelligence(喀布尔人工智能中心) Microsoft / Vocametrix(微软 / Vocametrix) IAI, TCG CREST(IAI,TCG CREST) Université de Lorraine, CNRS, Inria, LORIA(洛林大学,CNRS,Inria,LORIA) Laboratoire Praxiling, UMR5267, CNRS et Université Paul-Valéry Montpellier 3(Praxiling实验室,UMR5267,CNRS及蒙彼利埃Paul-Valéry大学) Speechcare iStutter, Portuguese Catholic University(Speechcare iStutter,葡萄牙天主教大学) CHI – Chair of Health Informatics, TUM University Hospital(健康信息学系,TUM大学医院) GLAM – Group on Language, Audio, & Music, Imperial College London(语言、音频与音乐小组,伦敦帝国理工学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出虚拟言语治疗师(VST)平台,集成深度学习口吃分类与多智能体大语言模型推理,自动生成个性化治疗方案,并通过临床医生反馈优化,实验证明其高质量推荐。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00947 2026-06-15 cs.LG cs.AI 版本更新 73%

Silent Failures in Federated Personalization of Foundation Models

联邦基础模型个性化中的静默失败

YongKyung Oh, Alex Bui

机构 * Medical & Imaging Informatics (MII) Group, University of California, Los Angeles (UCLA)(医学与影像信息学(MII)组,加州大学洛杉矶分校(UCLA))

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出联邦基础模型个性化中因隐私约束导致的一类信任失败——静默失败,包括偏差放大、公平性崩溃和对齐侵蚀,并引入六种静默失败模式的分类法,强调隐私保护训练不足以保障可信部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28591 2026-06-15 cs.CL cs.AI 版本更新 73%

Models That Know How Evaluations Are Designed Score Safer

知道评估如何设计的模型更安全

Katharina Deckenbach, Haritz Puerto, Jonas Geiping, Sahar Abdelnabi

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、图宾根马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过微调模型使其掌握评估的元知识(如可验证结构或道德困境),发现这会导致模型在安全基准测试中表现更安全,从而引入了一种独立于显式记忆或评估意识的新混淆因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07532 2026-06-10 cs.CL cs.AI 版本更新 73%

Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models

原则性智能体辩论:针对大型语言模型谄媚减少的对抗性仲裁

Sam Ryan

机构 * Novel Systems Engineering LLC(新型系统工程有限公司)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出原则性智能体辩论(PAD)多智能体架构,通过仲裁两个对立倾向的模型并盲评其论点,在SycophancyEval上显著降低谄媚偏差,最佳变体准确率达48.5%。

Comments 25 pages, 3 figures. Code and data available at github.com/NovelSystems/CANDOR

详情

展开后加载摘要…

URL PDF HTML 收藏