arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.04583 2026-01-09 cs.AI cs.MA 70%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 70%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 70%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04758 2026-01-09 cs.CL cs.AI 62%

PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks

PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务

Yehoon Jang, Chaewon Lee, Hyun-seok Min, Sungchul Choi

机构 * Pukyong National University(浦项国立大学) Tomocube Inc.(Tomocube公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。

Comments Accepted at the NLLP Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04195 2026-01-09 cs.CL cs.AI 62%

MedPI: Evaluating AI Systems in Medical Patient-facing Interactions

MedPI:评估医疗患者交互中的人工智能系统

Diego Fajardo V., Oleksii Proniakin, Victoria-Elisabeth Gruber, Razvan Marinescu

机构 * Lumos

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 MedPI是一个评估医疗患者交互中AI系统表现的高维基准,通过105个维度评估医疗对话质量,发现主流LLM在鉴别诊断上表现不佳。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 57%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11721 2026-01-09 stat.CO 50%

MDAS: A Diagnostic Approach to Assess the Quality of Data Splitting in Machine Learning

MDAS:一种评估机器学习中数据划分质量的诊断方法

Palash Ghosh, Bittu Karmakar, Eklavya Jain, J. Neeraja, Buddhananda Banerjee, Tanujit Chakraborty

专题命中 安全评测 :alignment(abstract)

AI总结 MDAS是一种用于评估机器学习中数据划分质量的诊断方法,通过新的差异度量来检测划分的统计兼容性,提升模型评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2601.04394 2026-01-09 cs.CL 85%

ARREST: Adversarial Resilient Regulation Enhancing Safety and Truth in Large Language Models

ARREST: 对抗鲁棒调节提升大语言模型的安全性与真实性

Sharanya Dasgupta, Arkaprabha Basu, Sujoy Nath, Swagatam Das

机构 * Electronics and Communication Sciences Unit (ECSU), Indian Statistical Institute Kolkata, University of Surrey, and Indian Institute Of Technology Delhi(电子与通信科学单元(ECSU)、印度统计研究所科钦分校、萨里大学和印度理工学院德里)

专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 ARREST通过对抗鲁棒调节提升大语言模型的安全性与真实性,通过外部网络纠正表征不匹配并生成软拒绝。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04739 2026-01-09 cs.CY cs.AI cs.LG 82%

A Framework for Responsible AI Systems: Building Societal Trust through Domain Definition, Trustworthy AI Design, Auditability, Accountability, and Governance

负责任人工智能系统的设计框架:通过领域定义、可信AI设计、可审计性、可问责性和治理建立社会信任

Andrés Herrera-Poyatos, Javier Del Ser, Marcos López de Prado, Fei-Yue Wang, Enrique Herrera-Viedma, Francisco Herrera

机构 * Deparment of Computer Science and Artificial Intelligence and Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI), University of Granada(计算机科学与人工智能系和安达卢西亚数据科学与计算智能研究所(DaSCI),格拉纳达大学) TECNALIA (BRTA)(TECNALIA(BRTA)) University of the Basque Country (UPV/EHU)(巴斯克大学(UPV/EHU)) School of Engineering, Cornell University(工程学院,康奈尔大学) ADIA Lab(ADIA实验室) Computational Research Department, Lawrence Berkeley National Laboratory(计算研究部,劳伦斯伯克利国家实验室) Intelligent Systems for Robotics and Automation Laboratory, Macau University of Science and Technology(机器人与自动化智能系统实验室,澳门科学技术大学)

专题命中 AI治理与伦理 :trustworthy(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一个整合领域定义、可信AI设计、可审计性、可问责性和治理的RAI系统设计框架,旨在通过建立社会信任实现负责任的人工智能。

Comments 27 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05184 2026-01-09 cs.AI cs.CL 62%

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

大语言模型自我消耗表现性循环中的观测与对策

Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) The Ohio State University(俄亥俄州立大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自我消耗表现性循环(SCPL)概念,通过实验发现表现性循环会增加偏好偏见并降低差异偏见,设计奖励拒绝采样策略以缓解偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04897 2026-01-09 cs.CL cs.CV cs.LG cs.MM 62%

V-FAT: Benchmarking Visual Fidelity Against Text-bias

V-FAT:基于文本偏见的视觉真实性基准测试

Ziteng Wang, Yujie He, Guanliang Li, Siqi Yang, Jiaqi Xiong, Songxiang Liu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Meituan(美团) University of Oxford(牛津大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 V-FAT通过三级评估框架量化文本偏见对视觉真实性的干扰,揭示多模态大语言模型在高语言主导性下的视觉崩溃问题。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04249 2026-01-09 cs.AI 57%

Fuzzy Representation of Norms

模糊表示规范

Ziba Assadi, Paola Inverardi

机构 * Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于模糊逻辑的SLEEC规则表示方法,用于在自主系统中嵌入伦理要求,以解决AI系统可能遇到的伦理困境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04238 2026-01-09 cs.CY 57%

Generative AI for Social Impact

生成式AI用于社会影响

Lingkai Kong, Cheol Woo Kim, Davin Choo, Milind Tambe

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 生成式AI通过LLM代理和扩散模型解决社会影响中的部署瓶颈,实现可扩展且人类对齐的资源优化系统。

Comments To appear in IEEE Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 10 篇

2601.04262 2026-01-09 cs.LG cs.AI 88%

Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis

安全与效用冲突并非全球性:通过头部层面诊断的手术对齐

Wang Cai, Yilin Wen, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu

机构 * Baidu Inc.(百度公司) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04605 2026-01-09 cs.CV 78%

Detection of Deployment Operational Deviations for Safety and Security of AI-Enabled Human-Centric Cyber Physical Systems

面向AI赋能的人本型网络物理系统的部署操作偏差检测

Bernard Ngabonziza, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出了一种基于个性化图像的新技术,用于检测AI赋能的人本型网络物理系统在部署中的操作偏差,以确保其安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16282 2026-01-09 cs.LG cs.AI 62%

CALM: A CKA-Guided Adaptive Layer-Wise Modularization Framework for LLM Quantization

CALM: 一种基于CKA的自适应层级模块化框架用于LLM量化

Jinhao Zhang, Yunquan Zhang, Daning Chen, JunSun, Zicheng Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CALM提出一种基于CKA的自适应层级模块化框架,通过独立评估各层最佳量化策略,提升LLM量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-01-09 cs.CL cs.AI 62%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04940 2026-01-09 cs.CR cs.AI 57%

CurricuLLM: Designing Personalized and Workforce-Aligned Cybersecurity Curricula Using Fine-Tuned LLMs

CurricuLLM: 利用微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程

Arthur Nijdam, Harri Kähkönen, Valtteri Niemi, Paul Stankovski Wagner, Sara Ramezanian

机构 * Lund University, Department of Electrical University of Helsinki, Department of Computer Science, Helsinki, Finland Helsinki Institute for Information Technology, Helsinki, Finland Karlstad University, Department of Mathematics \& Computer Science, Karlstad, Sweden

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 CurricuLLM通过微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程,解决课程与行业需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04888 2026-01-09 cs.AI 57%

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

SmartSearch: 基于过程奖励的查询优化用于搜索代理

Tongyu Wen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SmartSearch通过过程奖励和查询优化机制提升搜索代理的查询质量与效率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 57%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04545 2026-01-09 cs.AI cs.PF 57%

Personalized Model-Based Design of Human Centric AI enabled CPS for Long term usage

面向长期使用的以人为本的人工智能增强型控制系统个性化建模设计

Bernard Ngabonziza, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出个性化建模方法,以解决人工智能增强的人本控制系统在长期使用中的安全、可持续性和安全性分析问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04381 2026-01-09 cs.CV cs.AI 57%

Few-Shot LoRA Adaptation of a Flow-Matching Foundation Model for Cross-Spectral Object Detection

为跨光谱目标检测的流匹配基础模型进行少样本LoRA适应

Maxim Clouser, Kia Khezeli, John Kalantari

机构 * Yrikka Inc.(Yrikka公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 通过少样本LoRA适应流匹配基础模型,实现跨光谱目标检测的合成数据生成与提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 57%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏