arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 47 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2608.27505 2026-08-31 cs.CL cs.AI 新提交 85%

A Survey on Rubric-Guided Reinforcement Learning for Language Models

面向语言模型的准则引导强化学习综述

Zifei Shan, Fangning Shao

机构 * WeChat, Tencent(腾讯微信)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该综述针对传统RLHF的缺陷,提出贝叶斯框架并沿先验-后验轴分类准则引导强化学习,分析语言学相关对齐问题,明确未来研究方向。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27910 2026-08-31 cs.AI cs.CL cs.GT 新提交 84%

AI Alignment through a Game-theoretic Lens: A Survey

基于博弈论视角的AI对齐:一项综述

Yanan Cai, Zhongrui Zhao, Zhigang Lu, Ickjai Lee, Wei Emma Zhang, Minhui Xue, Yihong Zhang, Shuchao Pang, Wei Xiang

机构 * James Cook University(詹姆斯库克大学) Western Sydney University(西悉尼大学) Adelaide University(阿德莱德大学) CSIRO(联邦科学与工业研究组织) The University of Osaka(大阪大学) Nanjing University of Science and Technology(南京理工大学) Macquarie University(麦考瑞大学) La Trobe University(拉筹伯大学)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 本综述从博弈论视角梳理AI对齐的近期进展,针对偏好多样性等三大挑战整合相关文献,明确了博弈论在AI对齐中的作用、不足及未来构建稳健AI系统的挑战。

Comments This paper has been accepted by EMNLP-2026 as a main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2608.27580 2026-08-31 cs.AI 新提交 79%

LongGuard: Mechanistic Analysis and Training-Free Mitigation of Long-Context Failure in Safety Guardrails

LongGuard:针对安全护栏长上下文失效的机制分析与无训练缓解方案

Ziyang Chen, Xing Wu, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本研究针对LLM安全护栏在长上下文下的失效问题,提出LongGuard框架,经机制分析后开发无训练缓解方案,在多基准测试中实现显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28010 2026-08-31 cs.LG cs.AI 新提交 62%

When Can Conditional Flow Matching Replace Pointwise Negative Log-Likelihood?

条件流匹配何时能替代逐点负对数似然?

Yansen Han, Hongxin Sun, Tao Lin

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Fudan University(复旦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文通过理论分解刻画了条件流匹配(CFM)可替代逐点负对数似然(NLL)的条件,指出其在离策略总体最优处的局限性,相关结论及分解为适配LLM方法至流匹配提供了理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28407 2026-08-31 cs.CL 新提交 57%

A Unified Framework to Elicit Structured Feedback for Interpretable Multi-Trait Essay Scoring

用于可解释多特质作文评分的结构化反馈提取统一框架

Shihang Yang, Sanwoo Lee, Ningning Zhao, Yunfang Wu

机构 * Peking University(北京大学) Beijing Normal University(北京师范大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 该研究针对多特质自动作文评分中反馈与评分分离的问题,提出统一框架HiFTS,结合教师LLM提炼反馈并训练学生模型,在新数据集CFMS-34及ASAP++上取得优异评分与反馈效果。

Comments 14 pages, accepted to EMNLP 2026 Findings. Code: this https URL (https://github.com/Atiyahsama/HiFTS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28399 2026-08-31 cs.AI q-fin.TR 新提交 57%

RetailAgent: Structured Adverse Timing in Self-Conditioned Multimodal LLM Trading Agents

RetailAgent:自条件多模态大语言模型交易智能体中的结构化不利时机

Yupeng Zhang, Liuyuan Jiang, Hongyi Huang, Bingheng Li, Lisha Chen

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Michigan State University(密歇根州立大学) University of Rochester(罗切斯特大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该研究提出RetailAgent框架,发现LLM交易智能体的决策存在跨维度的持续不利时机,动作与后续收益的一致性是该效应的关键驱动因素,同时自生成记忆会增强策略持续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28233 2026-08-31 cs.AI 新提交 57%

REINS: Refusal-Enhanced Inhibitory Steering with Sparse Autoencoder Features

REINS:基于稀疏自编码器特征的增强拒绝抑制引导方法

Kai-Xuan Ding, Hao-Xiang Xu, Ji-Hua Peng, Zi-Qi Chen, Jiaqi Wang, Zhen-Hua Ling

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究针对现有SAE引导方法在复杂包装器有害提示上的不足,提出REINS方法,可抑制有害特征、增强安全弃权特征,在GUISE等数据集上大幅减少有害响应并保留模型通用能力。

Comments Accepted at EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27844 2026-08-31 cs.CL 新提交 57%

EvoHarmBench: Breaking Content Moderation with Iterative Human-Like Evasion

EvoHarmBench:通过类人迭代规避突破内容审核

Ruijie Jian, Benlei Cui, Ting Ma, Haidong Ding, Kangwei Liu, Ziwen Xu, Longtao Huang, Hui Xue, Ziqiang Zhu, Junjie Li, Haiwen Hong

机构 * Yuvion Team, Alibaba Group(阿里巴巴集团Yuvion团队) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 该研究提出首个动态对抗评估框架EvoHarmBench,针对5类违规229个语义子簇的5002个样本评估LLM审核模型,发现SOTA模型经12次迭代后规避成功率达80.3%,将推动内容安全评估转向动态模式。

Comments Accepted to the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI eess.SY 新提交 50%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 安全训练 :safety(abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27726 2026-08-31 cs.RO 新提交 50%

Coordinated Motion Planning for Multi-Arm Systems via Iterative LQ Games

基于迭代LQ博弈的多机械臂系统协调运动规划

Junyoung Kim, Hanwen Ren, Lei Zhang, Ahmed H. Qureshi

机构 * Purdue University(普渡大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出迭代LQ博弈框架用于多机械臂协调运动规划,通过可微碰撞惩罚生成安全高效轨迹,性能优于传统方法,凸显微分博弈在多机器人操作中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 4 篇

2608.27504 2026-08-31 cs.CR 新提交 75%

Circuit Discovery Helps Detect LLM Jailbreaking: A Mechanistic Interpretability Study

电路发现助力检测大语言模型越狱:一项机制可解释性研究

Paria Mehrbod, Boris Knyazev, Guy Wolf, Eugene Belilovsky, Geraldin Nanfack

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract)

AI总结 本研究通过机制可解释性分析,在LLaMA-2-7B-chat-hf中识别出负责越狱响应的关键计算电路,剪枝这些电路可降低80%攻击成功率,为对齐LLMs的防御提供了可解释的新方向。

Comments Accepted at the 2nd Workshop on Reliable and Responsible Foundation Models of the 42nd International Conference on Machine Learning (ICML) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28394 2026-08-31 cs.CR cs.CL 新提交 57%

BEACON: Behavior-Anchored Cross-Source Knowledge Graph Construction for Cyber Threat Intelligence

BEACON:面向网络威胁情报的行为锚定跨源知识图谱构建

Changze Li, Yutong Cheng, Tsania Camila Finnisa, Qian Cui, Wei Ding, Peng Gao

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 该研究提出BEACON框架,基于LLM结合MITRE ATT&CK实现跨源CTI知识图谱构建,构建了两个标注数据集,性能优于基线方法至少9%至23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27658 2026-08-31 cs.CL 新提交 57%

When Tokenizers Fail: Byte-Level Chunking for Zero-Shot Transfer to Low-Resource Languages

当分词器失效:面向低资源语言零样本迁移的字节级分块方法

Sanjeev Kumar, Atsuki Yamaguchi, Nikolaos Aletras

机构 * IIT Bombay(印度理工学院孟买分校) University of Sheffield(谢菲尔德大学)

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL

AI总结 本文针对低资源语言处理中字节级模型的粒度不匹配问题,提出适配的分层网络框架,通过初始化字节嵌入、分块对齐损失及词性监督,在六种语言的词性标注任务上实现最高13.3%的性能提升。

Comments Accepted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27531 2026-08-31 cs.CR cs.CV 新提交 50%

Fully Unleashing the Multimodal Attacker: Meta-Adaptive Jailbreaking of Vision-Language Models

充分释放多模态攻击者的潜力:视觉语言模型的元自适应越狱攻击

Benlei Cui, Shen Pang, Yuke Wang, Xuemei Dong, Yuwen Zhai, Jingqun Tang, Haiyang Yu, Hui Xue, Longtao Huang, Haiwen Hong

专题命中 越狱攻击 :safety(abstract)

AI总结 提出元自适应多模态越狱攻击(MAMJ),通过优化攻击策略提示与攻击者权重提升多模态越狱效果,在MM-SafetyBench上对多款前沿VLMs的攻击成功率显著优于基线,且可迁移至未见过的目标模型。

Comments Accepted by EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2608.28411 2026-08-31 cs.CR cs.AI 新提交 79%

LongPIBench: A Long-Context Benchmark for Prompt Injection

LongPIBench:用于提示注入的长上下文基准

Yupei Liu, Yuqi Jia, Neil Zhenqiang Gong, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究人员推出涵盖4类场景的长上下文基准LongPIBench,发现现有提示注入防御在长上下文下漏洞显著,简单攻击即可绕过,该基准可用于系统评估此类防御。

Comments To appear in Findings of EMNLP'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27496 2026-08-31 cs.CR 新提交 78%

ROPE: Routed Origin Policy Enforcement against Indirect Prompt Injection

ROPE:针对间接提示注入的路由来源策略执行

Xinhang Ma, Chaowei Xiao, William Yeoh, Ning Zhang, Yevgeniy Vorobeychik

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出ROPE防御间接提示注入,通过确定性来源检查实现可证明的安全保证,在低攻击成功率的同时保留高智能体效用,优于现有系统级防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27990 2026-08-31 cs.CR cs.AI 新提交 57%

CAITLYN: Can LLM Agents Autonomously Synthesize Defenses against Emerging Injection Attacks?

CAITLYN:大语言模型智能体能否自主合成针对新型注入攻击的防御措施?

Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 针对LLM智能体注入攻击防御的三难困境,提出智能体无关防御中间件CAITLYN,其含即时防御与自主合成新防御的双系统,在标准基准与新基准Emerging上均表现优异,可降低攻击成功率。

Comments Source code: this https URL (https://github.com/liangzid/caitlyn)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2608.28058 2026-08-31 cs.CV cs.AI 新提交 79%

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

用于减轻大型视觉语言模型幻觉的动态对齐补偿

Kairong Yu, Zixin Zhu, Le Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型的幻觉问题,提出无需训练的推理时方法动态对齐补偿,结合分层语义补偿与序列语义校正,在9个多模态基准上可减少幻觉并保持整体性能。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28382 2026-08-31 cs.CL cs.AI 新提交 62%

When Linguistic and Internal Confidence Diverge in Large Language Models

当大型语言模型的语言置信度与内部置信度出现偏差时

Hefan Zhang, Bingquan Zhang, Ming Cheng, Saeed Hassanpour, Weicheng Ma, Soroush Vosoughi

机构 * Dartmouth College(达特茅斯学院) Oakland University(奥克兰大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比大型语言模型的语言置信度与内部置信度,发现二者常出现偏差,提出需用多维度诊断评估语言置信度后再用于下游可靠性流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28052 2026-08-31 cs.LG cs.AI 新提交 62%

Explainable Uncertainty Estimation for Reliable Medical AI

面向可靠医疗AI的可解释不确定性估计

Li Rong Wang, Jamie Duell, Xinran Xu, Thomas C. Henderson, Yu Yue Hew, Pik Wan Erica Chiang, Xiao Wei Alstar Ang, Bingwen Eugene Fan, Xiuyi Fan

机构 * College of Computing and Data Science (CCDS)(计算与数据科学学院) Nanyang Technological University (NTU)(南洋理工大学) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心) School Of Computing and Digital Technologies(计算与数字技术学院) Sheffield Hallam University(谢菲尔德哈勒姆大学) School of Computing(计算机学院) University of Utah(犹他大学) Tan Tock Seng Hospital (TTSH)(陈笃生医院) Lee Kong Chian School of Medicine(李光前医学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出将不确定性估计与XAI统一的egRUE方法,可量化并分解不确定性为特征贡献,经实验和专家研究验证,能提升医疗AI的可靠性与可解释性,优化临床决策支持。

Comments Accepted at the 26th IEEE International Conference on Data Mining (ICDM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27860 2026-08-31 cs.CV cs.AI 新提交 57%

From Perspective to Fisheye Depth Estimation and Open-Vocabulary Segmentation

从透视图像到鱼眼图像的深度估计与开放词汇分割

Rit Gangopadhyay, Alex Wong

机构 * Yale University(耶鲁大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 该研究提出了与架构、任务无关的Distortion Extenders(DEX),通过自监督对齐损失将视觉基础模型泛化到鱼眼相机,在深度估计和开放词汇分割任务中优于基线,还可用于相机校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27847 2026-08-31 cs.AI 新提交 57%

From Uncertainty to Clinical Risk: Severity-Aware Conformal Planning for Interactive Medical Diagnosis

从不确定性到临床风险:面向交互式医疗诊断的严重程度感知共形规划

Yue Zhou, Haiyang Zhou, Jin Zhang, Kong Wang, Yongxin Ni, Youhua Li, Hanwen Du

机构 * Lanzhou University(兰州大学) Hunan University(湖南大学) National University of Singapore(新加坡国立大学) City University of Hong Kong(香港城市大学) The Ohio State University(俄亥俄州立大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 该研究针对交互式医疗诊断漏诊重症的风险与长程规划缺失问题,提出严重程度感知共形临床规划框架,在DDXPlus和MediQ上提升了诊断准确性、鉴别质量并降低了高风险错误。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 17 篇

2608.28518 2026-08-31 cs.AI cs.CL cs.RO 新提交 84%

When Robots Mishear Us: Mapping the Safety Risks of Voice-Controlled Embodied AI

当机器人误听我们时:映射语音控制具身人工智能的安全风险

Sihan Jia, Oliver Lemon

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究探讨ASR错误对语音控制具身AI安全性的影响,发现其会导致有害指令被执行,部分错误会削弱模型弃权行为,自动修正并非总能降低风险,揭示了ASR错误带来的显著安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27548 2026-08-31 cs.AI 新提交 83%

Nemotron 3.5 Content Safety Moderator: A Compact Multimodal, Multilingual, and Reasoning Enabled Content Safety Moderator

Nemotron 3.5 内容安全审核器:一款紧凑的多模态、多语言且具备推理能力的内容安全审核器

Varun Singh, Anuj Doshi, Makesh Narsimhan Sreedhar, Shaona Ghosh, Katherine Luna

机构 * NVIDIA(英伟达)

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.AI

AI总结 本研究提出紧凑多模态多语言的Nemotron 3.5 CS安全审核器,兼具低计算成本与推理能力,可覆盖多场景安全审核,还发布配套安全数据集,验证其在多维度评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28300 2026-08-31 cs.RO cs.AI 新提交 79%

MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation

MaCoPlanner:面向机器人工业面板操作的、结合主动安全验证的大语言模型辅助人工编译任务规划

Guipeng Xin, Jiahe Xua, Mohammad Deghat, Chenhui Wan, Jie Liu, Youmin Hu, Zhongxu Hu

机构 * Huazhong University of Science and Technology(华中科技大学) University of New South Wales(新南威尔士大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 MaCoPlanner是面向机器人工业面板操作的规划框架,通过编译设备手册知识生成规划,经主动安全验证后执行,大幅提升了任务成功率,在Level-2、Level-3任务上分别提升了21.6、17.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28247 2026-08-31 cs.CV cs.AI 新提交 74%

A comprehensive and trustworthy benchmark of AI methods for change detection in Earth observation

面向地球观测变化检测的全面可信AI方法基准测试

Tadej Tomanič, Alice Baudhuin, Jan Sotošek, Jure Brence, Panče Panov, Nikola Simidjievski, Dragi Kocev

机构 * Bias Variance Labs, d.o.o.(Bias Variance Labs有限责任公司) University of Ljubljana(卢布尔雅那大学) Jožef Stefan Institute(约热夫·斯泰凡研究所) Télécom Paris(巴黎电信学院) Institut Polytechnique de Paris(巴黎综合理工学院)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 该研究构建了面向地球观测变化检测的标准化开源基准,对比10种模型在10种数据集上的性能,发现优化的经典模型结合预训练更具优势,实验资源符合FAIR原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28345 2026-08-31 cs.AI 新提交 70%

AGENT-O: A Semantic Agent Card Framework for Interoperable and Governed Healthcare AI Agents

AGENT-O:用于可互操作且受管控的医疗AI智能体的语义智能体卡框架

Pengze Li, Cui Tao

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究人员提出AGENT-O模块化本体框架,定义医疗AI智能体的语义智能体卡,评估279篇论文报告完整性,揭示评估规范差距,为结构化报告提供工具但不评估智能体质量与部署就绪性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27484 2026-08-31 cs.AI cs.IR cs.MA 新提交 70%

CareGraph: An Auditable Hybrid AI Framework for Evidence-Grounded Personalized Longitudinal Health Intelligence

CareGraph:一种用于基于证据的个性化纵向健康智能的可审计混合AI框架

Pratik Ghawate, Tanvi Patil

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CareGraph是可审计混合AI框架,用于将异构医疗记录转化为结构化证据,实验显示其在多指标上优于传统方法,为个性化健康系统提供安全受限基础。

Comments 21 pages, 7 figures, Code and data: this https URL (https://github.com/PratikGhawate/ai-personalized-health-intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27512 2026-08-31 cs.LG cs.AI cs.CL cs.CR 新提交 67%

Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap

语言模型中量化触发的后门:跨量化器可迁移性与验证-部署差距

Jacopo Dardini, Claudio Stanzione, Giordano Colò, Giuseppe Fenza

机构 * University of Bologna(博洛尼亚大学) Luiss Guido Carli University(路易斯 Guido Carli 大学) Live Tech University of Salerno(萨勒诺大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现仅源精度审计无法排除语言模型的量化触发后门,提出量化行为等价类理论,在多语言模型中实现量化后激活的后门攻击,证明攻击持久性与量化方案及模型架构相关。

Comments Accepted at the 21st International Conference on Availability, Reliability and Security (ARES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28405 2026-08-31 cs.CL cs.CY 新提交 62%

CultureConverse: A Multilingual Multi-turn Simulation Harness for Culturally Grounded Assistance in East and Southeast Asia

CultureConverse:面向东亚与东南亚文化适配助手的多语言多轮模拟工具包

Bryan Chen Zhengyu Tan, Weihua Zheng, Thong T. Doan, Bich Ngoc Doan, Jia Wang Peh, Xiaoyuan Yi, Jing Yao, Xing Xie, Nancy F. Chen, Zhengyuan Liu, JinYeong Bak, Wafi Shamdi, Soo Kai Chie, Liew Yu Siong, Aina Azyyati Binti Mohamad Rezal, Lew Yan Yan Vanessa, Huadan Wu, Dylan Raharja, Nadya Yuki Wangsajaya, Akane Fukushige, Kazushi Kato, Koji Inoue, Tatsuya Kawahara, Jaehyung Seo, Dongjun Kim, Seungyoon Lee, Zi Haur Pang, Rui Yang Tan, Charibeth Ko Cheng, Maria Regina Justina Estuar, Jann Railey Montalan, Pham Minh Duc, Roy Ka-Wei Lee

机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Microsoft Research Asia (MSRA)(微软亚洲研究院) Sungkyunkwan University (SKKU)(成均馆大学) Universiti Brunei Darussalam (UBD)(文莱大学) China University of Petroleum (East China)(中国石油大学(华东)) Nanyang Technological University (NTU)(南洋理工大学) Kyoto University(京都大学) Konkuk University(建国大学) Upstage AI

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.CY

AI总结 本研究推出CultureConverse多语言多轮模拟工具包,构建含14610个基准回合的数据集,评估18个模型发现GPT-5 mini表现最优,微调后模型在文化相关任务上性能提升。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏