arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-12 至 2025-12-12 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2512.10304 2025-12-12 cs.AI cs.ET 79%

Trustworthy Orchestration Artificial Intelligence by the Ten Criteria with Control-Plane Governance

基于十项准则的可信 orchestration 人工智能与控制平面治理

Byeong Ho Kang, Wenli Yang, Muhammad Bilal Amin

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出基于十项准则的可信 orchestration 人工智能框架,通过整合人类输入、语义一致性等要素,系统性地提升人工智能系统的可信度与可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19980 2025-12-12 cs.LG 79%

RAD: Towards Trustworthy Retrieval-Augmented Multi-modal Clinical Diagnosis

RAD:迈向可信的检索增强多模态临床诊断

Haolin Li, Tianjie Dai, Zhe Chen, Siyuan Du, Jiangchao Yao, Ya Zhang, Yanfeng Wang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai AI Laboratory(上海人工智能实验室) CMIC, Shanghai Jiao Tong University(上海交通大学计算机学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University(上海交通大学医学人工智能研究所)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 RAD通过检索增强多模态模型,提升临床诊断的可信度与准确性,实现任务特定知识的显式注入。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL 79%

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20018 2025-12-12 cs.AI cs.AR 74%

Achieving Trustworthy Real-Time Decision Support Systems with Low-Latency Interpretable AI Models

实现低延迟可解释AI模型的可信实时决策支持系统

Zechun Deng, Ziwei Liu, Ziqian Bi, Junhao Song, Chia Xin Liang, Joe Yeong, Xinyuan Song, Junfeng Hao

机构 * School of Physics and Astronomy(物理与天文学系) University of Edinburgh(爱丁堡大学) Siebel School of Computing and Data Science(计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AI Agent Lab(AI代理实验室) Vokram Group(Vokram集团) Department of Anatomical Pathology(解剖病理学部) Singapore General Hospital(新加坡中央医院) Department of Computer Science(计算机科学系) Emory University(埃默里大学)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出通过低延迟可解释AI模型实现可信实时决策支持系统,探讨资源受限环境下的人机协作方法及边缘计算优化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10195 2025-12-12 cs.CL cs.LG cs.MA 62%

AutoMedic: An Automated Evaluation Framework for Clinical Conversational Agents with Medical Dataset Grounding

AutoMedic: 一种用于具有医学数据集支撑的临床对话代理的自动化评估框架

Gyutaek Oh, Sangjoon Park, Byung-Hoon Kim

机构 * Yonsei University College of Medicine(延世大学医学院) Yonsei Institute for Digital Health(延世大学数字健康研究所) Yonsei University(延世大学) Institute of Behavioral Sciences in Medicine(医学行为科学研究所)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 AutoMedic是一种基于医学数据集的自动化评估框架,用于评估临床对话代理的多方面性能,包括准确性、效率、同理心和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11375 2025-12-12 cs.AI cs.CL 62%

Benchmarking Multimodal LLMs on Recognition and Understanding over Chemical Tables

在化学表格上评估多模态大语言模型的基准测试

Yitong Zhou, Mingyue Cheng, Qingyang Mao, Yucong Luo, Qi Liu, Yupeng Li, Xiaohan Zhang, Deguang Liu, Xin Li, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Artificial Intelligence Research Institute(人工智能研究院) iFLYTEK Co., Ltd(iFLYTEK公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChemTable基准,用于评估多模态模型在理解化学表格中的能力,揭示了现有模型在跨模态对齐和领域推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10624 2025-12-12 cs.CL 57%

AgriGPT-Omni: A Unified Speech-Vision-Text Framework for Multilingual Agricultural Intelligence

AgriGPT-Omni: 一种统一的语音-视觉-文本框架用于多语言农业智能

Bo Yang, Lanfei Feng, Yunkui Chen, Yu Zhang, Jianyu Zhang, Xiao Xu, Nueraili Aierken, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 AgriGPT-Omni提出了一种统一的语音-视觉-文本框架,通过数据合成、多阶段训练和三模态基准,提升多语言农业智能的性能和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10403 2025-12-12 cs.SD cs.CL 57%

BRACE: A Benchmark for Robust Audio Caption Quality Evaluation

BRACE:一种用于鲁棒音频描述质量评估的基准

Tianyu Guo, Hongyu Chen, Hao Liang, Meiyi Qiang, Bohan Zeng, Linzhuang Sun, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 BRACE基准用于评估参考自由环境下音频描述质量,揭示CLAP模型和LALM的局限性,推动未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08844 2025-12-12 cs.CY 57%

A Methodology for Quantitative AI Risk Modeling

一种量化AI风险建模的方法论

Malcolm Murray, Steve Barrett, Henry Papadatos, Otter Quarks, Matt Smith, Alejandro Tlaie Boria, Chloé Touzet, Siméon Campos

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文提出了一种整合情景构建与定量风险估算的方法论,用于量化AI风险,通过六个步骤系统性地建模潜在危害,并通过实际应用验证其有效性。

Comments The only changes in v2 are some updates to a few arXiv URLs in the references

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 57%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18271 2025-12-12 cs.CV cs.AI 57%

Beyond Words and Pixels: A Benchmark for Implicit World Knowledge Reasoning in Generative Models

超越文字和像素:生成模型中隐式世界知识推理的基准测试

Tianyang Han, Junhao Su, Junjie Hu, Peizhen Yang, Hengyu Shi, Junfeng Luo, Jialin Gao

机构 * MeiGen AI Team, Meituan(美团梅基因AI团队) Fudan University(复旦大学) D^{4} Lab(D⁴实验室) HHMI Janelia Research Campus(HHMI贾能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出PicWorld基准测试,用于评估生成模型在隐式世界知识和物理因果推理方面的能力,揭示了现有T2I模型在这些方面的局限性,并提出了证据基础的多代理评估器进行细粒度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16528 2025-12-12 cs.LG 57%

Aligning ASR Evaluation with Human and LLM Judgments: Intelligibility Metrics Using Phonetic, Semantic, and NLI Approaches

对齐语音识别评估与人类和LLM判断:利用音系、语义和NLI方法的可理解性度量

Bornali Phukon, Xiuwen Zheng, Mark Hasegawa-Johnson

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出结合NLI、语义和音系相似性的新型语音识别评估度量,以提高对口吃和发音障碍语音的可理解性评估精度。

Comments 5 pages, 2 figures, Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10066 2025-12-12 stat.AP cs.AI 57%

Classifying Metamorphic versus Single-Fold Proteins with Statistical Learning and AlphaFold2

利用统计学习和AlphaFold2对变构蛋白与单构蛋白进行分类

Yongkai Chen, Samuel WK Wong, SC Kou

机构 * Harvard University(哈佛大学) University of Waterloo(滑铁卢大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用AlphaFold2生成构象集合并结合统计学习,对变构与单构蛋白进行分类,提高了对变构蛋白识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10674 2025-12-12 cs.CV 50%

Geo6DPose: Fast Zero-Shot 6D Object Pose Estimation via Geometry-Filtered Feature Matching

Geo6DPose:通过几何过滤特征匹配实现快速零样本6D物体姿态估计

Javier Villena Toro, Mehdi Tarkian

机构 * Linköping University(利乌普斯大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Geo6DPose通过几何过滤特征匹配实现快速零样本6D姿态估计,无需训练或网络访问,具备高效推理与高鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏