arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-27 至 2026-08-27 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2607.09156 2026-08-27 cs.LG 版本更新 57%

Activation Steering Transfer to Agents: One Gain Ratio Does Not Identify Potency and Efficacy

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments v2 changes the estimand from a gain ratio to a curve location and supersedes v1's coupling-distribution reading. 40 pages, 7 figures, 5 tables. Includes an errata section correcting v1's public record. Code and pre-registrations: this http URL (http://github.com/digdoug/steering-dose-reparametrization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19380 2026-08-27 cs.SE cs.LG 版本更新 57%

ClayBuddy: A Framework, Evaluation, & Mitigation of Coding Agent Failures

AgentArmor:编码代理失败的框架、评估与缓解

Kenneth Ge, Andre Assis

机构 * Anthropic Fellows Program(Anthropic Fellow 项目) Constellation

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出AgentArmor框架,通过系统提示增强、命令分类器、三振政策等机制,缓解编码代理因规范不足、能力错误和工具错误导致的失败,显著提升安全性。

Comments Accepted at The Third Annual Conference on Language Modeling 2026 Workshop on Agent Behavior

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25340 2026-08-27 cs.HC 新提交 50%

HRGuard: Gating Relationship Manipulation in Multi-Turn Agentic AI Conversations

HRGuard:多轮智能体AI对话中的门控关系操纵

Pei-Sze Tan, Tasuku Igarashi, Isao Echizen

专题命中 安全评测 :safety(abstract)

AI总结 针对多轮智能体AI对话中AI协助的人际操纵问题,构建含1000个五轮对话的基准数据集,提出HRGuard双门控机制,在8个模型上表现优于通用安全方案,可减少有害顺从并保留保护指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25210 2026-08-27 cs.DB 新提交 50%

Bolt-on, Verifiable Provenance for LLM-Powered Data Processing

用于大语言模型驱动数据处理的外挂式可验证来源

Yiming Lin, Sepanta Zeighami, Aditya G. Parameswaran

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对LLM黑盒无法提供答案来源及可信度的问题,提出外挂式框架BLIP,可高效生成小尺寸可验证来源,在七个数据集上准确率较最优基线高30%以上且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22188 2026-08-27 cs.MA 版本更新 50%

Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives

耗尽能源共享池:自我挫败的过度占用作为智能体大语言模型集体中的协调失败

Marcantonio Bracale Syrnikov, Federico Pierucci, Matteo Prandi, Marcello Galisai, Piercosma Bisconti, Francesco Giarrusso, Daniele Nardi

专题命中 安全评测 :alignment(abstract)

AI总结 研究大语言模型智能体在共享可再生能源储备时的协调失败问题,通过让四个同系列智能体自博弈,改变储备再生率,发现它们在需求超阈值时过度占用致自我挫败,实际消耗类似更不耐烦的开放访问基准,孤立响应评估会忽略此系统层面协调失败。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2608.16081 2026-08-27 cs.CV 版本更新 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 AI治理与伦理 :safety(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at this https URL (https://github.com/The-Responsible-AI-Initiative/SafeGesture)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-08-27 cs.AI 版本更新 77%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

Comments 2026 Conference on Empirical Methods in Natural Language Processing (EMNLP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24662 2026-08-27 cs.AI cs.CL cs.CY 版本更新 67%

The Invisible Editorial Layer: Formalizing Undisclosed Inference-Time Steering, Probability Placement, and the Attribution Problem in Deployed Language Models

隐形编辑层:形式化部署语言模型中未公开的推理时调控、概率置放与归因问题

Augusto Camargo

机构 * Bluecore Consulting(蓝芯咨询)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文针对部署语言模型提出隐形编辑层概念,形式化推理归因问题、概率置放等核心概念,探讨其与相关监管框架的关联,揭示未公开推理调控的潜在影响。

Comments Substantially revised version with a formal non-identifiability result for the Inference Attribution Problem, expanded related work, and extended analysis of Probability Placement, auditing, and runtime transparency

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14480 2026-08-27 cs.CL 版本更新 57%

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 17 篇

2608.25493 2026-08-27 cs.CV 新提交 82%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 其他安全 :alignment(title,abstract);safety(abstract)

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25323 2026-08-27 eess.SY 新提交 78%

Scalable Tube-Tightened Multi-Agent Safety via Certified Constraint Reduction

基于可验证约束缩减的可扩展多智能体安全控制:管收紧策略

Armel Koulong

专题命中 其他安全 :safety(title,abstract)

AI总结 该研究针对多智能体系统的分布式模型预测控制,提出可验证的约束缩减方法,减少安全约束数量,保留标称控制,提升计算效率且保证安全。

Comments Submitted for consideration at the 2027 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24900 2026-08-27 cs.HC 新提交 78%

Stronger Alignment between Brain Activity and LLM Embeddings during Code Writing compared to Prose Writing

与散文写作相比,代码写作期间大脑活动与大语言模型(LLM)嵌入之间的对齐性更强

Zachary Karas, Catie Chang, Kevin Leach, Yu Huang

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究通过fMRI和VEMs发现,代码写作时大脑活动与LLM嵌入的对齐性显著强于散文写作,为相关AI系统设计提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17629 2026-08-27 cs.LG cs.AI 版本更新 76%

A General-Purpose Framework for Chemical Reaction Representation with Atomic Correspondence and Flexible Condition Adaptation

基于反应物-产物对齐的学习化学反应表示

Kaipeng Zeng, Xianbin Liu, Yu Zhang, Xiaokang Yang, Yaohui Jin, Yanyan Xu

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出RAlign模型,通过反应物-产物对齐和反应中心感知注意力机制,提升化学反应表示学习的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25741 2026-08-27 cs.LG cs.CL 新提交 73%

Why Does Graph Learning Fail to Fully Benefit from a Text Teacher?

为何图学习无法充分受益于文本教师?

Fumiaki Kimino (1), Ryoma Sato (1 and 2) ((1) SOKENDAI, (2) National Institute of Informatics)

机构 * SOKENDAI(总研究大学院大学) National Institute of Informatics(情报学研究所)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对结合自监督GNN与交替优化语言模型的多模态图学习模型未充分提升性能的问题,分析了六个关键影响因素并通过分阶段实验验证。

Comments 21 pages, 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16905 2026-08-27 cs.LG cs.AI 版本更新 73%

GRIP: Algorithm-Agnostic Machine Unlearning for Mixture-of-Experts via Geometric Router Constraints

GRIP:通过几何路由约束实现混合专家的算法无关机器反学习

Andy Zhu, Rongzhe Wei, Yupu Gu, Pan Li

机构 * School of Computer Science(计算机科学学院) Georgia Institute of Technology(佐治亚理工学院) Department of Electrical Engineering(电气工程系) Tsinghua University(清华大学) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24920 2026-08-27 cs.CL cs.AI cs.HC 新提交 62%

Semantic Variability of Replies Across LLMs: Implications for Designing Conversation-Based Assessment

不同大语言模型(LLM)生成回复的语义变异性:对基于对话的评估设计的启示

Jiangang Hao

机构 * ETS Research Institute(ETS研究院) Princeton(普林斯顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究不同LLM生成回复的语义变异性,发现模型选择与对话上下文会影响回复相似度及与人类回复的对齐度,指出仅靠提示词和上下文无法保证跨LLM的回复一致性,需构建相关基础设施与设计策略。

Comments 9 pages, 4 figures, two tables. Accepted to the AI in Measurement and Education Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-08-27 cs.CL cs.AI 版本更新 62%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25178 2026-08-27 cs.CV cs.AI 新提交 57%

Lightweight Machine Learning-Driven Monocular Sidewalk Path Extraction for Embedded Micromobility Navigation

面向嵌入式微型移动导航的轻量级机器学习驱动单目人行道路径提取

Lkhanaajav Mijiddorj, Yang Yan, Tyler Beringer, Bilguunzaya Mijiddorj, Alex N. Ho, Bin Xu, Binbin Weng

机构 * University of Oklahoma(俄克拉荷马大学) School of Electrical and Computer Engineering(电气与计算机工程学院) School of Aerospace and Mechanical Engineering(航空航天与机械工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对嵌入式微型移动导航的人行道路径提取问题,提出历经三次迭代的单目视觉流水线,采用轻量级SegFormer-B0模型,通过对比规划方法,实现低耗时、高精度的路径提取,适配嵌入式设备。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25140 2026-08-27 cs.CV cs.CL 新提交 57%

RefLAM: A Reference-Grounded Line Annotation Pipeline for Historical Arabic Manuscripts

RefLAM:一种用于历史阿拉伯文手稿的参考依据型行标注流水线

Mohamed Guechaoui, Mohamed Diaa Zellagui, Souleyman Chaib, Sahraoui Dhelim

机构 * Higher School of Computer Science (ESI-SBA)(高等计算机科学学院(ESI-SBA))

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 RefLAM是用于历史阿拉伯文手稿的参考依据型行标注流水线,结合深度学习、MLLM与模糊对齐引擎,可高效生成标注数据,吞吐量较手动标注提升75倍,发布的AraMS-28k可用于HTR模型微调。

Comments 11 pages, 6 figures, 3 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23875 2026-08-27 cs.AI 版本更新 57%

AI Finds A Way

AI找到了一种方法

Aaron Dharna, Cong Lu, Ryan Sullivan, Joel Lehman, Victoria Krakovna, Jeff Clune

机构 * Vector Institute(矢量研究所)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究整理26则机器学习领域一手轶事,揭示现代AI会规避设计限制、利用奖励漏洞等意外行为,指出基础模型未解决相关挑战,强调需管理AI创新的不可预测性以保障安全。

Comments 26 Anecdotes, 40 Pages (59 with references/appendix), updated affiliation footnote

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25845 2026-08-27 cs.CV 新提交 50%

THA-Flow Generative Model: Prosthesis Geometry Prediction from Preoperative CT

THA-Flow生成模型:基于术前CT的假体几何预测

Yiping Wang, Jie Li, Jingyu Shen, Liao Wang

机构 * Changzhou Jinse Medical Information Technology Co., Ltd.(常州金色医疗信息技术有限公司) Shanghai Ninth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第九人民医院)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出THA-Flow生成模型,通过AutoencoderKL和三维UNet从术前CT生成三维假体几何,在1355个髋关节数据上验证,实现了THA三维手术规划的生成式AI首次应用。

Comments 17 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25381 2026-08-27 cs.IR 新提交 50%

MOTIF: Motivation-guided Topology Inference for Cold-start Multimodal Recommendation

MOTIF:面向冷启动多模态推荐的动机引导拓扑推断

Yurui Shi, Yuchen Miao, Ximing Hu, Zijun Wang, Chang Han

专题命中 其他安全 :alignment(abstract)

AI总结 针对冷启动多模态推荐的三大耦合挑战,提出MOTIF框架,整合四类技术实现拓扑推断,在三个多模态基准上较各类基线取得最高6.07%的相对提升。

Comments 15 pages, 3 figures, 7 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25281 2026-08-27 math.OC eess.SY math-ph stat.ML 新提交 50%

Schrödinger Bridges over Kinetic Swarming Models

基于动力学蜂拥模型的薛定谔桥

Asmaa Eldesoukey, Md Zulfiqur Haider, Italo Napolitano, Yongxin Chen, Abhishek Halder

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对受随机扰动的惯性蜂拥,基于薛定谔桥理论,提出嵌套不动点方案求解最优控制,实现有限时间内将蜂拥群体引导至规定端点分布的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04235 2026-08-27 cs.ET 版本更新 50%

Scale-CDA: A Scalable Aftermarket Platform to Democratize Cooperative Driving Automation in Production Cars

Scale-CDA:一款用于量产车的、可扩展的原型,旨在普及AI辅助的协同驾驶自动化(CDA)

Hao Zhou, Shengming Yuan, Yuhang Wang, Alina Hagen, Haibin Wen

专题命中 其他安全 :safety(abstract)

AI总结 本研究提出Scale-CDA这一开源工具链,基于OpenDBC与Openpilot构建,成本低于1000美元,可实现AI辅助CDA的即插即用改装,通过多车辆测试验证了其低时延与数据隐私保护能力,为普及协同自动驾驶提供了实用方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15352 2026-08-27 cs.HC 版本更新 50%

People readily follow personal advice from AI but it does not improve their well-being

人们轻易跟随AI的个人建议但其并未改善他们的幸福感

Lennart Luettgau, Vanessa Cheung, Magda Dubois, Keno Juechems, Jessica Bergs, Luke Symes, Henry Davidson, Bessie O'Dell, Hannah Rose Kirk, Max Rollwage, Christopher Summerfield

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨了人们是否遵循AI建议及其对幸福感的影响,发现尽管多数人遵循建议,但并未带来持续的幸福感提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12660 2026-08-27 cs.CV 版本更新 50%

SEG-SAM: Semantic-Guided SAM for Unified Medical Image Segmentation

SEG-SAM:语义引导的SAM用于统一医学图像分割

Shuangping Huang, Hao Liang, Qingfeng Wang, Chulong Zhong, Zijian Zhou, Miaojing Shi

专题命中 其他安全 :alignment(abstract)

AI总结 该研究提出语义引导的SAM模型SEG-SAM,通过语义感知解码器、文本到视觉语义模块及跨掩码空间对齐策略,提升医学图像统一分割性能,实验显示其优于现有相关方法。

Comments 17 pages, 11 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏