arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-24 至 2025-12-24 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 6 篇

2511.14396 2025-12-24 cs.RO cs.AI cs.CV 79%

Continuous Vision-Language-Action Co-Learning with Semantic-Physical Alignment for Behavioral Cloning

具有语义-物理对齐的连续视觉-语言-动作共学用于行为克隆

Xiuxiu Qi, Yu Yang, Jiannong Cao, Luyao Bai, Chongshan Fan, Chengtai Cao, Hongpeng Wang

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出CCoL框架,通过连续共学视觉、语言和动作,解决行为克隆中的语义-物理不一致问题,提升动作执行的准确性和鲁棒性。

Comments Accepted at AAAI 2026, the Project website is available at https://qhemu.github.io/CCoL/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19399 2025-12-24 cs.LG cs.AI cs.CL 67%

Brain-Grounded Axes for Reading and Steering LLM States

基于大脑活动的阅读与操控LLM状态的轴

Sandro Andric

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出利用人类大脑活动作为坐标系,通过ICA提取潜在轴,操控LLM状态,实现可解释和可控的LLM行为。

Comments 10 pages, 4 figures. Code: https://github.com/sandroandric/Brain-Grounded-Axes-for-Reading-and-Steering-LLM-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20328 2025-12-24 cs.SE cs.AI cs.LG 62%

Toward Explaining Large Language Models in Software Engineering Tasks

向软件工程任务解释大型语言模型

Antonio Vitale, Khai-Nguyen Nguyen, Denys Poshyvanyk, Rocco Oliveto, Simone Scalabrino, Antonio Mastropaolo

机构 * University of Molise \& Politecnico di Torino Termoli Italy University of Molise Italy University of Molise \& Politecnico di Torino University of Molise

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 FeatureSHAP为软件工程任务提供首个自动化、模型无关的可解释性框架,通过Shapley值归因模型输出,提升代码生成和总结任务的解释性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20403 2025-12-24 cs.LG 57%

BRIDGE: Budget-aware Reasoning via Intermediate Distillation with Guided Examples

BRIDGE:通过引导示例的中间蒸馏实现预算感知推理

Xuan-An Le, Minh-Nam Tran, Son Nguyen

机构 * Faculty of Information Technology, VNU University of Engineering and Technology(信息技术学院,越南工程技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 BRIDGE通过中间蒸馏和预算不对称性,在减少教师查询的同时提升小型模型性能,实现更高效的模型蒸馏

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19928 2025-12-24 cs.CV cs.AI 57%

Unified Brain Surface and Volume Registration

统一的脑表面和体积配准

S. Mazdak Abulnaga, Andrew Hoopes, Malte Hoffmann, Robin Magnet, Maks Ovsjanikov, Lilla Zöllei, John Guttag, Bruce Fischl, Adrian Dalca

机构 * MIT Computer Science and Artificial Intelligence Laboratory(MIT计算机科学与人工智能实验室) Massachusetts General Hospital, Harvard Medical School(麻省总医院,哈佛医学院) Université Paris Cité, INRIA(巴黎Cité大学,INRIA) LIX, CNRS, École Polytechnique(LIX,CNRS,巴黎高等理工学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 NeurAlign通过统一的体积和表面表示,实现了更准确、快速且易用的脑皮层和皮下区域配准,提升了Dice分数并显著提高了效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17373 2025-12-24 cs.AI 57%

Dialectics for Artificial Intelligence

人工智能的辩证法

Zhengmian Hu

机构 * Adobe Research(Adobe研究)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种基于算法信息的辩证法框架,通过信息过剩和可逆一致性关系,实现多智能体概念的动态生成与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏