arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-24 至 2026-08-24 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2608.20374 2026-08-24 cs.CL cs.AI cs.LG 新提交 90%

VA-DPO: Valence-Arousal Direct Preference Optimization for Controllable Emotion Generation in Language Models

VA-DPO:用于语言模型可控情感生成的效价-唤醒直接偏好优化

Hyunwoo Kim

专题命中 偏好对齐 :DPO(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对现有情感生成无法表达细粒度情感的问题,提出VA-DPO方法,通过效价-唤醒连续目标优化LoRA适配器,在多模型上实现细粒度情感生成且不损害通用性能。

Comments 9 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20512 2026-08-24 cs.CY 新提交 79%

From Urban Mobility to Epidemic Dynamics: A Mixture-of-Experts Framework with Preference Alignment for Policy Scenario Simulation

从城市流动性到流行病动力学:用于政策情景模拟的带偏好对齐的混合专家框架

Yun Ye, Arsalan Dezhkam, Junyuan Liu, Xinglei Wang, Tao Cheng

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CY

AI总结 该研究提出带偏好对齐的混合专家框架UrbanShare-MoE-PA,通过智能体级流动性建模连接政策、行为与流行病模拟,评估了不同封锁政策的流行病-活动权衡,为NPI情景分析提供了可解释工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17378 2026-08-24 cs.LG cs.AI 版本更新 73%

Efficient Exploration at Scale

大规模高效探索

Seyed Mohammad Asghari, Chris Chute, Vikranth Dwaracherla, Xiuyuan Lu, Mehdi Jafarnia, Victor Minden, Zheng Wen, Benjamin Van Roy

机构 * Google(谷歌) DeepMind(深度思维)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种在线学习算法,通过增量更新奖励和语言模型提升强化学习从人类反馈中的数据效率,采用小幅度正向激励、信念神经网络和信息导向探索等机制,实验表明在少于20k标签下达到200k标签的性能,预计1M标签可匹配1B标签的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11354 2026-08-24 cs.AI 版本更新 57%

Inverse Theory of Mind Modeling for Content Recommendation: From Web Browsing to Dynamic Intelligent Interfaces

用于内容推荐的反向心智理论建模:从网页浏览到动态智能界面

Mengyu Chen, Feiyu Lu, Chun-Fu Chen, Lucas Vinh Tran, Jay Katukuri

机构 * JPMorganChase(摩根大通)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本研究提出反向心智理论(IToM)流程,从用户交互反向推理推断信念与偏好,在OPeRA数据集上验证其画像推断效果,并通过VisionOS应用展示跨模态迁移能力,提升内容推荐的用户理解精度。

Comments Preprint for conference full paper at 20th ACM Conference on Recommender Systems (RecSys '26), Minneapolis, MN, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09487 2026-08-24 cs.CL 版本更新 57%

SlidesGen-Bench: Evaluating Slides Generation via Computational and Quantitative Metrics

SlidesGen-Bench: 通过计算和定量指标评估幻灯片生成

Yunqiao Yang, Wenbo Li, Houxing Ren, Zimu Lu, Ke Wang, Zhiyuan Huang, Zhuofan Zong, Mingjie Zhan, Hongsheng Li

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SlidesGen-Bench通过计算和定量指标评估幻灯片生成,提出统一框架和可重复的量化指标,构建人类偏好对齐数据集,提升与人类判断的一致性。

Comments 37 pages, 34 figures, EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 10 篇

2608.21100 2026-08-24 cs.AI 新提交 89%

ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

ReFrame:多模态大语言模型中基于证据的测试时安全对齐

Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机学院) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究针对现有多模态安全对齐方法不适用于闭源模型的问题,提出无需训练的ReFrame框架,通过两个智能体协作实现测试时安全对齐,在提升安全性能的同时保留多模态效用。

Comments Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02530 2026-08-24 cs.AI cs.CL 版本更新 88%

SafeSteer: Localized On-Policy Distillation for Efficient Safety Alignment

SafeSteer: 局部化在策略蒸馏用于高效安全对齐

Hao Li, Jingkun An, Zijun Song, Pengyu Zhu, Rui Li, Hao Wang, Wendi Feng, Yesheng Liu, Lijun Li, Jin-Ge Yao, Lei Sha

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型安全对齐导致通用能力下降的问题,提出SafeSteer方法,通过激活引导构建安全教师并选择安全令牌,仅在安全令牌上施加反向KL惩罚,在仅用100个有害样本且无需通用数据的情况下,实现了安全与通用能力之间的优越平衡。

Comments 19 pages, 8 figures, 14 tables. EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01913 2026-08-24 cs.LG cs.AI cs.CE cs.CL cs.CR 版本更新 85%

RefusalGuard: Geometry-Preserving Fine-Tuning for Safety in LLMs

RefusalGuard:面向大语言模型安全的保几何微调方法

Sadia Asif, Mohammad Mohammadi Amiri

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出保几何微调框架RefusalGuard,解决大语言模型微调时安全对齐退化问题,在多模型及安全、下游任务基准上表现优于基线,平衡安全与任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15218 2026-08-24 cs.AI cs.CR 版本更新 83%

When Words Are Safe But Actions Kill: Probing Physical Jailbreak Beyond Textual Jailbreak in Hidden-State Risk Space

当言语安全但行动致命:在隐藏状态风险空间中探究超越文本安全的物理危险

Weimeng Wang, Ziqiang Wang, Zihang Zhan, Chuanpu Fu, Qi Li, Ke Xu

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 研究大语言模型中语言无害指令在现实世界中的物理危险与文本级内容危险是否相同,提出PRISM方法,通过隐藏状态方向分析等证明CD和PD可分离,PRISM在多个基准测试中表现良好,能检测物理危险而非仅依赖明确不安全措辞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20513 2026-08-24 cs.SE cs.AI 新提交 79%

Making Deployments Safe at Meta: Health Checks for Continuous Change-Safety

在 Meta 保障部署安全:面向持续变更安全的健康检查

Prakash KL, Anton Korenkov, Uttam Thakore, Christopher Hegre

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 Meta 介绍其用于平衡持续部署速度与可靠性的 Service Health Checker 健康检查基础设施,阐述其架构、集成方式、解决的运营问题及未来 AI 辅助调优方向。

Comments 6 pages, 4 figures, Accepted to ISSRE 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20378 2026-08-24 cs.AI 新提交 70%

Truth Lies Deep: Countering Semantic Camouflage via Latent Intent Verification

真相藏于深处:通过潜在意图验证对抗语义伪装

Md. Hasib Ur Rahman

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 针对大语言模型安全对齐的表面性问题,该研究提出潜在意图验证(LIV)方法,利用小型语言模型早期层的有害特征,在不重新训练的情况下,将语义伪装攻击的检测性能提升20%-50%。

Comments 5 pages, 3 figures. Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence, and Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16386 2026-08-24 cs.CL cs.LG 版本更新 62%

Mint-Agent: Introducing Finance-Native Agentic Foundation Models

Mint-Agent:引入金融原生智能体基础模型

Mint-Agent Team, Kun Wang, Gavin Zhang, Yaze Geng, Lei Tang, Yaoyang Yi, Zonghan Wu, Yifan Hu, Qingsong Wen, Yilei Shao

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00424 2026-08-24 cs.AI 版本更新 57%

Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight

弱批评者造就强学习者:用于可扩展监督的在策略批评蒸馏

Can Jin, Jiakang Li, Rui Wu, Eddy Z. Zhang, Dimitris N. Metaxas

机构 * University of Cambridge(剑桥大学) University of California, Berkeley(加州大学伯克利分校) UC Berkeley AI Lab(加州大学伯克利分校人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出在策略批评蒸馏(OPCD)方法,利用弱模型作为批评者提供修订方向,通过自适应自教师信号蒸馏批评引导的行为,提升强模型在推理和对齐基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21069 2026-08-24 cs.SE 新提交 56%

Spike-Killer: Evidence-Gated LLM Assistance for Safe Performance Diagnosis on a Real Windows Workstation

Spike-Killer:面向真实Windows工作站安全性能诊断的证据门控大语言模型辅助方案

Baocheng Zeng, Jinhao Yang

专题命中 安全训练 :trustworthy(abstract);safety(comments)

AI总结 该研究提出Spike-Killer,一种人在环的证据门控工作流,用于安全诊断Windows工作站的帧时间问题,以CS2为目标应用验证了其可审计性,为LLM辅助智能体提供了可信操作模式。

Comments 6 pages. Experience report; no causal CS2 frame-time improvement or autonomous-safety claim is made

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21066 2026-08-24 cs.CV 新提交 50%

Robust Validation to Geometric Perturbations for Autonomous Pose Estimation

面向自主位姿估计的几何扰动鲁棒性验证

Gregoire Theau, Melanie Ducoffe

机构 * Airbus SAS(空中客车公司) IRT Saint-Exupery(圣埃克苏佩里技术研究院)

专题命中 安全训练 :safety(abstract)

AI总结 本文针对自主位姿估计的几何扰动鲁棒性验证问题,提出基于全局利普希茨优化(GLO)的方法,在YOLOv8-Pose模型上验证其可高效定位失效模式并剪枝80%以上搜索空间,为鲁棒自主感知验证提供了新途径。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2608.20820 2026-08-24 cs.AI 新提交 83%

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

通过组合边界与安全持久性实现大语言模型安全的多轮认证鲁棒性

Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

机构 * Peking University(北京大学) Renmin University of China(中国人民大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 针对LLMs易受多轮越狱攻击的问题,提出MTCR框架,通过状态对抗MDPs等方法实现多轮认证鲁棒性,实验表明其经验安全性能超认证边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20991 2026-08-24 cs.LG 新提交 79%

Trojaning the Alignment: Stealthy Backdoor Attacks against Graph Foundation Models

对齐攻击:针对图基础模型的隐蔽后门攻击

Minhua Lin, Zhicheng Gao, Yilong Wang, Hanqing Lu, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文针对带文本属性图的图基础模型,提出STAG隐蔽特洛伊木马攻击框架,协调图触发器生成器与文本软提示实现后门攻击,经多数据集实验验证其有效性与隐蔽性。

Comments Accepted by ICDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20748 2026-08-24 cs.CV 新提交 50%

Generating Multi-view Adversarial Examples for Visual Geometry Grounded Transformer

为视觉几何接地Transformer生成多视角对抗样本

Qi Song, Ziyuan Luo, Haoliang Han, Renjie Wan

机构 * Hong Kong Baptist University(香港浸会大学)

专题命中 越狱攻击 :alignment(abstract)

AI总结 本研究针对3D基础模型VGGT的安全漏洞,提出MVAP-G多视角对抗扰动生成器,通过跨视角对抗对齐机制生成一致扰动,可无需迭代优化即可显著降低VGGT性能,为3D视觉系统鲁棒性研究提供了新方向。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2608.21230 2026-08-24 cs.CR cs.AI 新提交 57%

Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

受攻击下的效用:智能体记忆投毒及内容筛选与来源排序的局限性

Arulnidhi Karunanidhi

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 该研究针对智能体记忆投毒问题,测试了内容筛选和来源排序的防御效果,发现仅内容筛选无法抵御投毒,来源加权检索也存在局限,主张采用有限占用约束并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21126 2026-08-24 cs.CR 新提交 50%

TraceGrant: A Contract-Governed Security Framework for the Task-Effect Lifecycle of Networked LLM Agents

TraceGrant:一种用于联网LLM智能体任务-效应生命周期的合约治理安全框架

Bohao Liao, Jingchao Wang, Qipeng Song, Jin Cao, Jieling Wang, Boyu Deng

专题命中 提示注入 :prompt injection(abstract)

AI总结 TraceGrant是通过显式合约治理联网LLM智能体任务-效应生命周期的安全框架,在两类基准攻击案例中未出现攻击成功,且能关联用户意图、执行与任务完成。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2608.19816 2026-08-24 cs.CY 版本更新 86%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title);分类 cs.CY

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

Comments Changed first line of abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20166 2026-08-24 cs.CL cs.HC 版本更新 70%

Trust Stack for Mental Health AI: A Survey of Calibration across Human, Interaction, and AI Layers

对心理健康支持中的人机交互信任进行对齐:多利益相关者的调查与立场

Xin Sun, Yue Su, Yifan Mo, Qingyu Meng, Yuxuan Li, Min Chen, Mengyuan Zhang, Saku Sugawara, Charlotte Gerritsen, Sander L. Koole, Koen Hindriks, Jiahuan Pei

机构 * National Institute of Informatics (NII)(日本国立信息学研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Amsterdam(阿姆斯特丹大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本文提出三层信任框架,整合关键利益相关者观点,系统回顾心理健康领域AI研究,指出NLP与实际需求间的差距,提出构建社会技术一致且真实可信的AI研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10573 2026-08-24 cs.CL cs.LG 版本更新 62%

The Intrinsic Dimension of Prompts in Internal Representations of Large Language Models

大语言模型内部表示中提示的固有维度

Karthik Viswanathan, Yuri Gardinazzi, Giada Panerai, Alberto Cazzaniga, Matteo Biagetti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过固有维度视角分析大语言模型提示的内部表示几何,发现其与下一个 token 不确定性等相关,训练的线性探测模型可在生成前区分恶意与良性提示,准确率优于现有安全工具,为 LLM 安全提供了新信号。

Comments 12+14 pages, 18 figures, matches published version on Transactions of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21142 2026-08-24 cs.LG 新提交 57%

COEC: Calibrated Orthogonal-Equivalence Compensation for Structured Pruning of Large Language Models

COEC:面向大语言模型结构化剪枝的校准正交等价补偿

Peiqi Yu, Nam Ling, Wei Wang, Wei Jiang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究提出无训练补偿框架COEC,将其应用于Llama-3等模型的结构化剪枝,可提升剪枝后模型的困惑度与零样本准确率,在高稀疏度下增益更显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10725 2026-08-24 cs.CV cs.SC 版本更新 50%

Rethinking LLM Verification: Evidence Structure, Uncertainty, and Selective Refinement

重新思考大语言模型验证:证据结构、不确定性与选择性优化

Uma Ranjan, Kunal Tilaganji, Aditya Koul, Anurag Mahipal, Dashpreet Singh, Hriday Rana, Manan Jain, Sidharth Gupta, Ajo Babu George, Vineeth Balasubramanian, Nagarajan Natarajan, Amit Sharma

机构 * Indian Institute of Technology Jammu(贾姆穆印度理工学院) Microsoft Research(微软研究院) SCB Dental College and Hospital(SCB牙科学院与医院)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 该研究针对LLMs医疗应用的安全问题,提出两阶段框架,利用模型弃权信号优化推理,在GPT-5.5、DeepSeek-R1模型及MedReason、MedQA数据集上显著提升了医疗假设验证的准确率。

Comments Withdrawn by the authors due to premature submission before final review

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2605.24817 2026-08-24 cs.CR cs.AR cs.CL cs.LG 版本更新 81%

RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry

RouteScan: 通过专家路由遥测对MoE大语言模型安全性进行非侵入式审计

Bo Lv, Zhiheng Xu, KeDong Xiu, Ruyi Ding, Tianhang Zheng, Zhibo Wang, Kui Ren

机构 * Zhejiang University(浙江大学) Donghua University(东华大学) Louisiana State University(路易斯安那州立大学)

专题命中 隐私与版权 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 提出RouteScan,一种利用MoE模型GPU级专家路由遥测(如预填充阶段活跃线程数)作为微架构指纹,通过轻量级检测流水线识别恶意提示的非侵入式审计框架,在未见过的有害领域AUROC超0.93,新越狱包装下超0.96,且相比基于内容的审计方法具有隐私优势。

Comments 11 pages. Revised manuscript with expanded experiments

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 23 篇

2608.21278 2026-08-24 cs.AI 新提交 88%

CLEAR: Continuous Latent Adapter Routing for Utility-Preserving LLM Safety Alignment

CLEAR:用于保持效用的大语言模型安全对齐的连续潜在适配器路由

Chengxiao Wang, Enyi Jiang, Xiaojing Liao, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校西贝尔计算与数据科学学院) Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本研究提出CLEAR框架,通过轻量型隐藏状态门控控制安全低秩适配器的激活强度,在降低LLM有害输出的同时,减少了全局安全调优带来的效用损失,实现了安全与效用的更好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20554 2026-08-24 cs.CR cs.LG 新提交 83%

aiXamine: Unified Black-Box Evaluation of Cross-Dimensional Trade-offs in LLM Safety, Security, and Privacy

aiXamine:针对大语言模型安全、安全与隐私的跨维度权衡的统一黑盒评估

Fatih Deniz, Yazan Boshmaf, Dorde Popovic, Issa Khalil

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 该研究推出aiXamine统一黑盒平台,对超120个LLM开展大规模联合评估,发现安全、隐私等跨维度权衡现象,揭示当前对齐方法将多维度可信性视为单一目标的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20345 2026-08-24 cs.CL cs.AI cs.CY 新提交 82%

When Vocabulary Comprehension Fails Clinical Reasoning: Evaluating Therapy Bots' Safety Risks for Generation Alpha

当词汇理解失效于临床推理:评估面向阿尔法世代(Gen Alpha,2010-2024年出生)的治疗机器人的安全风险

Manisha Mehta, Virendra Mehta

机构 * Lynbrook High School(林布鲁克高中) University of Trento(特伦托大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本研究构建两个基准评估Claude、GPT-4o等LLM的治疗机器人安全风险,发现其存在10-14个百分点的词汇理解与临床风险校准差距,识别六种失败模式,提出四项监管与技术改进建议。

Comments 42 pages, 6 figures. Accepted at ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21057 2026-08-24 cs.LG 新提交 79%

Designing a Robust LLM-Based Evaluation System for Agentic AI in Drug Discovery Through Human Alignment

通过人类对齐设计用于药物发现中智能体AI的鲁棒性大语言模型评估系统

Emma Granqvist, Rocío Mercado, Samuel Genheden

机构 * AstraZeneca(阿斯利康) Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Science for Life Laboratory (SciLifeLab)(生命科学实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 本研究针对药物发现智能体AI,提出人类对齐的LLM作为评判者评估框架,优化后对齐度达0.86,为科学领域智能体系统评估提供可复用模板。

详情

展开后加载摘要…

URL PDF HTML 收藏