arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 11 篇

2601.04199 2026-01-09 cs.LG cs.AI cs.CL 87%

The Forgotten Shield: Safety Grafting in Parameter-Space for Medical MLLMs

被遗忘的盾牌:参数空间中的医疗大语言模型安全性移植

Jiale Zhao, Xing Mou, Jinlin Wu, Hongyuan Yu, Mingrui Sun, Yang Shi, Xuanwu Yin, Zhen Chen, Zhen Lei, Yaohua Wang

机构 * National University of Defense Technology(国防科技大学) Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统(MAIS)) Multimedia Department, Xiaomi Inc(小米公司多媒体部门) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong(香港科学院人工智能与机器人中心) School of Artificial Intelligence, University of Chinese Academy of Sciences, UCAS(中国科学院大学人工智能学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数空间干预方法,通过提取原始模型的安全知识并注入目标模型,提升医疗大语言模型的安全性,同时保持医疗性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04211 2026-01-09 cs.CL 79%

Qwerty AI: Explainable Automated Age Rating and Content Safety Assessment for Russian-Language Screenplays

Qwerty AI:可解释的自动年龄评级和俄语剧本内容安全评估系统

Nikita Zmanovskii

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 Qwerty AI通过可解释的自动化系统实现俄语剧本的年龄评级和内容安全评估,利用微调模型和量化技术,在严格限制下实现高准确率和高效处理。

Comments 15 pages, 7 tables, 1 figure, 4 appendices. System paper describing automated age-rating for Russian screenplays using fine-tuned Phi-3-mini. Includes baseline comparisons, human evaluation, and production deployment. Code and model weights available at https://github.com/nikita-zmanovskiy/qwertyAI. Developed during Wink Hackathon, November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04688 2026-01-09 cs.CL cs.AI cs.FL 73%

ToolGate: Contract-Grounded and Verified Tool Execution for LLMs

ToolGate: 以合同为基础并经过验证的工具执行用于LLMs

Yanming Liu, Xinyue Peng, Jiannan Cao, Xinyi Wang, Songhang Deng, Jintao Chen, Jianwei Yin, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ToolGate通过形式化合同和验证机制,确保LLM调用工具时逻辑安全和状态演变的可验证性,提升系统可靠性与可调试性。

Comments First version of ToolGate

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04583 2026-01-09 cs.AI cs.MA 70%

Autonomous Agents on Blockchains: Standards, Execution Models, and Trust Boundaries

区块链上的自主代理:标准、执行模型与信任边界

Saad Alqithami

机构 * Saad Alqithami(萨德·阿利萨米)

专题命中 安全评测 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 本文系统梳理了区块链与自主代理的互操作性领域,提出了五类整合模式、定制化的威胁模型和能力矩阵,并提出了研究路线图和评估套件,旨在提升链上执行的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13655 2026-01-09 cs.CL cs.SE 70%

Comparative Analysis of LLM Abliteration Methods: A Cross-Architecture Evaluation

大语言模型擦除方法的比较分析:跨架构评估

Richard J. Young

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究比较了四种擦除工具在不同模型架构上的效果,发现数学推理能力对擦除干预最敏感,且单次通过方法在保持能力方面表现更优。

Comments 25 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16036 2026-01-09 cs.CL 70%

OpenEthics: A Comprehensive Ethical Evaluation of Open-Source Generative Large Language Models

OpenEthics: 对开源生成大语言模型的全面伦理评估

Yıldırım Özen, Burak Erinç Çetin, Kaan Engür, Elif Naz Demiryılmaz, Cagri Toraman

机构 * Middle East Technical University(中东技术大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 本研究对29个开源生成大语言模型进行全面伦理评估,评估鲁棒性、可靠性、安全性和公平性,发现较大模型在伦理表现上更优,禁言模板对多数模型无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04758 2026-01-09 cs.CL cs.AI 62%

PILOT-Bench: A Benchmark for Legal Reasoning in the Patent Domain with IRAC-Aligned Classification Tasks

PILOT-Bench:一个以专利领域法律推理为核心的基准,包含与IRAC对齐的分类任务

Yehoon Jang, Chaewon Lee, Hyun-seok Min, Sungchul Choi

机构 * Pukyong National University(浦项国立大学) Tomocube Inc.(Tomocube公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 PILOT-Bench通过IRAC对齐的分类任务评估专利领域法律推理能力,揭示闭源与开源模型在推理性能上的显著差异。

Comments Accepted at the NLLP Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04195 2026-01-09 cs.CL cs.AI 62%

MedPI: Evaluating AI Systems in Medical Patient-facing Interactions

MedPI:评估医疗患者交互中的人工智能系统

Diego Fajardo V., Oleksii Proniakin, Victoria-Elisabeth Gruber, Razvan Marinescu

机构 * Lumos

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 MedPI是一个评估医疗患者交互中AI系统表现的高维基准,通过105个维度评估医疗对话质量,发现主流LLM在鉴别诊断上表现不佳。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04960 2026-01-09 cs.CL cs.SD 57%

A Unified Spoken Language Model with Injected Emotional-Attribution Thinking for Human-like Interaction

具有注入情感归因思维的统一口语语言模型用于人样交互

Qing Wang, Zehan Li, Yaodong Song, Hongjie Chen, Jian Kang, Jie Lian, Jie Li, Yongxiang Li, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出一种通过注入情感归因思维提升情感智能的统一口语语言模型,实现人样交互中的情感感知与响应生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04709 2026-01-09 cs.AI 57%

Bridging Temporal and Textual Modalities: A Multimodal Framework for Automated Cloud Failure Root Cause Analysis

弥合时序与文本模态:一种多模态框架用于自动化云故障根本原因分析

Gijun Park

机构 * Okestro

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种多模态框架,通过融合时间序列与文本数据,提升云故障根本原因分析的自动化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11721 2026-01-09 stat.CO 50%

MDAS: A Diagnostic Approach to Assess the Quality of Data Splitting in Machine Learning

MDAS:一种评估机器学习中数据划分质量的诊断方法

Palash Ghosh, Bittu Karmakar, Eklavya Jain, J. Neeraja, Buddhananda Banerjee, Tanujit Chakraborty

专题命中 安全评测 :alignment(abstract)

AI总结 MDAS是一种用于评估机器学习中数据划分质量的诊断方法,通过新的差异度量来检测划分的统计兼容性,提升模型评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏