arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-03 至 2025-12-03 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 15 篇

2512.02363 2025-12-03 cs.CL cs.AI 86%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02282 2025-12-03 cs.AI cs.HC cs.MA 83%

DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses

DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应

Han Luo, Guy Laban

机构 * University of Leeds(利兹大学) Southwest Jiaotong University(西南交通大学) Department of Industrial Engineering and Management(工业工程与管理系) Ben-Gurion University of the Negev(贝内尔·加隆大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 DialogGuard通过多智能体框架评估LLM响应的心理社会风险,提供高准确性的风险检测与可解释的评估结果,支持安全提示设计和脆弱用户应用的监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 73%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02057 2025-12-03 cs.LG cs.AI 73%

Opening the Black Box: An Explainable, Few-shot AI4E Framework Informed by Physics and Expert Knowledge for Materials Engineering

揭开黑箱:一个受物理和专家知识启发的可解释、少样本AI4E框架

Haoxiang Zhang, Ruihao Yuan, Lihui Zhang, Yushi Luo, Qiang Zhang, Pan Ding, Xiaodong Ren, Weijie Xing, Niu Gao, Jishan Chen, Chubo Zhang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个受物理和专家知识启发的可解释、少样本AI4E框架,通过生成合成数据和优化策略提升工程领域模型的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02763 2025-12-03 cs.CL cs.AI 62%

SurveyEval: Towards Comprehensive Evaluation of LLM-Generated Academic Surveys

SurveyEval: 向LLM生成学术调查的全面评估迈进

Jiahao Zhao, Shuaixing Zhang, Nan Xu, Lei Wang

机构 * Beijing Wenge Technology Co., Ltd.(北京文格科技有限公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SurveyEval通过多维度评估LLM生成的学术调查,揭示了专门系统在质量上的优势,并为改进自动调查系统提供可扩展的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01282 2025-12-03 cs.CL cs.AI 62%

Kardia-R1: Unleashing LLMs to Reason toward Understanding and Empathy for Emotional Support via Rubric-as-Judge Reinforcement Learning

Kardia-R1: 通过Rubric-as-Judge强化学习释放大语言模型以通过评分标准进行推理,以实现情感支持的理解与共情

Jiahao Yuan, Zhiqing Cui, Hanqing Wang, Yuansheng Gao, Yucheng Zhou, Usman Naseem

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Kardia-R1通过Rubric-as-Judge强化学习框架,提升大语言模型在情感支持中的理解与共情能力,通过评分标准引导训练以实现更准确的情感推理和个性化响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15272 2025-12-03 cs.CV cs.AI cs.CL 62%

CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios

CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景

Jingyang Lin, Yingda Xia, Jianpeng Zhang, Ke Yan, Kai Cao, Le Lu, Jiebo Luo, Ling Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) University of Rochester(罗切斯特大学) Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02816 2025-12-03 cs.CL 57%

A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models

用于评估大型语言模型中辨证论治的基准数据集

Kunning Li, Jianbin Guo, Zhaoyang Shang, Yiqing Liu, Hongmin Du, Lingling Liu, Yuping Zhao, Lifeng Dong

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出TCM-BEST4SDT基准,用于评估大型语言模型在中医辨证论治中的能力,包含四个任务并提供三种评估机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26012 2025-12-03 cs.AI 57%

AutoSurvey2: Empowering Researchers with Next Level Automated Literature Surveys

AutoSurvey2:赋能研究人员的下一代自动化文献综述

Siyi Wu, Chiaxin Liang, Ziqian Bi, Leyi Zhao, Tianyang Wang, Junhao Song, Yichao Zhang, Keyu Chen, Benji Peng, Xinyuan Song

机构 * University of Texas at Arlington(德克萨斯理工大学) AI Agent Lab(人工智能代理实验室) Indiana University(印第安纳大学) Ohio State University(俄亥俄州立大学) Imperial College London(伦敦帝国理工学院) Georgia Institute of Technology(佐治亚理工学院) Appcubic(Appcubic公司) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AutoSurvey2通过多阶段流程实现自动化文献综述生成,结合检索增强合成与结构化评估,提升综述的连贯性与相关性,为学术写作提供可扩展解决方案。

Comments TKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26004 2025-12-03 cs.CV cs.AI 57%

Learning Egocentric In-Hand Object Segmentation through Weak Supervision from Human Narrations

通过人类叙述的弱监督学习进行视角注视手部物体分割

Nicola Messina, Rosario Leonardi, Luca Ciampi, Fabio Carrara, Giovanni Maria Farinella, Fabrizio Falchi, Antonino Furnari

机构 * Institute of Information Science and Technologies - National Research Council(信息科学与技术研究所-国家研究理事会) University of Catania(卡塔尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出WISH模型,通过人类叙述的弱监督学习实现手部物体分割,无需精细像素标注即可超越基线方法。

Comments Under consideration at Pattern Recognition Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12498 2025-12-03 cs.AI 57%

Artificial Intelligence Virtual Cells: From Measurements to Decisions across Modality, Scale, Dynamics, and Evaluation

人工智能虚拟细胞:从多模态、多尺度测量到决策的跨模态、跨尺度、动态和评估

Chengpeng Hu, Calvin Yu-Chian Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种模型无关的细胞状态潜在视角,通过操作符语法组织学习,旨在跨模态、跨尺度、上下文和干预实现决策对齐的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17699 2025-12-03 cs.CV q-bio.QM 50%

Benchmarking Class Activation Map Methods for Explainable Brain Hemorrhage Classification on Hemorica Dataset

在Hemorica数据集上基于类激活图方法的可解释性脑出血分类基准测试

Z. Rafati, M. Hoseyni, J. Khoramdel, A. Nikoofard

机构 * Faculty of Computer Engineering, K. N. Toosi University of Technology(计算机工程学院,K.N.托菲大学) Faculty of Electrical Engineering, K. N. Toosi University of Technology(电气工程学院,K.N.托菲大学) Faculty of Mechanical Engineering, Tarbiat Modares University(机械工程学院,塔里比亚特莫达res大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过在Hemorica数据集上评估九种CAM算法,发现AblationCAM在像素级Dice和IoU指标上表现最佳,为脑出血分类的可解释性提供了新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02410 2025-12-03 cs.MA cs.CR 50%

Decentralized Multi-Agent System with Trust-Aware Communication

去中心化多智能体系统与信任感知通信

Yepeng Ding, Ahmed Twabi, Junwei Yu, Lingfeng Zhang, Tohru Kondo, Hiroyuki Sato

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于区块链的去中心化多智能体系统,通过信任感知通信协议解决传统集中式系统中的信任、可扩展性和抗审查问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02329 2025-12-03 cs.SE 50%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22686 2025-12-03 cs.CV 50%

Emergent Extreme-View Geometry in 3D Foundation Models

三维基础模型中的涌现极端视角几何

Yiwen Zhang, Joseph Tung, Ruojin Cai, David Fouhey, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) New York University(纽约大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了三维基础模型在极端视角下的几何理解能力,并提出轻量级对齐方案提升其相对姿态估计性能,同时引入新的未见过的互联网场景基准。

Comments Project page is at https://ext-3dfms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏