arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-15 至 2025-12-15 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 13 篇

2512.11421 2025-12-15 cs.AI 79%

Towards Trustworthy Multi-Turn LLM Agents via Behavioral Guidance

通过行为指导实现可信的多轮大语言模型代理

Gonca Gürsun

机构 * Gonca Gürsun(独立研究者)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种框架,通过行为指导使大语言模型代理在多轮任务中实现可靠和可验证的行为。

Comments Accepted to AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10470 2025-12-15 cs.CL 79%

Statistical Analysis of Sentence Structures through ASCII, Lexical Alignment and PCA

通过ASCII、词性对齐和PCA进行句子结构的统计分析

Abhijeet Sahdev

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本研究通过ASCII、词性对齐和PCA分析句子结构的平衡,提出一种资源高效的统计方法,用于评估文本平衡并补充传统语法工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11412 2025-12-15 cs.CE cs.AI cs.CL cs.LG q-bio.BM 67%

Task-Specific Sparse Feature Masks for Molecular Toxicity Prediction with Chemical Language Models

针对分子毒性预测的特定任务稀疏特征掩码与化学语言模型

Kwun Sy Lee, Jiawei Chen, Fuk Sheng Ford Chung, Tianyu Zhao, Zhenyuan Chen, Debby D. Wang

机构 * School of Science and Technology(科学与技术学院) Hong Kong Metropolitan University(香港 Metropolitan 大学) Faculty of Engineering(工程学院) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多任务学习框架,通过稀疏注意力机制提升化学分子毒性预测的准确性和可解释性。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18234 2025-12-15 cs.AI cs.CL cs.LG 67%

The Illusion of Readiness in Health AI

健康AI中的“准备”幻觉

Yu Gu, Jingjing Fu, Xiaodong Liu, Jeya Maria Jose Valanarasu, Noel CF Codella, Reuben Tan, Qianchu Liu, Ying Jin, Sheng Zhang, Jinyu Wang, Rui Wang, Lei Song, Guanghui Qin, Naoto Usuyama, Cliff Wong, Hao Cheng, HoHin Lee, Praneeth Sanapathi, Sarah Hilado, Tristan Naumann, Javier Alvarez-Valle, Jiang Bian, Mu Wei, Khalil Malik, Lidong Zhou, Jianfeng Gao, Eric Horvitz, Matthew P. Lungren, Doug Burger, Eric Topol, Hoifung Poon, Paul Vozila

机构 * Scripps Research Translational Institute(斯克里普斯研究转化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过对抗性压力测试揭示了健康AI在现实应用中的鲁棒性和推理能力不足,强调了对AI系统责任和真实医疗需求的重视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10313 2025-12-15 cs.AI cs.CY 62%

EpiPlanAgent: Agentic Automated Epidemic Response Planning

EpiPlanAgent:基于代理的自动化疫情响应规划

Kangkun Mao, Fang Xu, Jinru Ding, Yidong Jiang, Yujun Yao, Yirong Chen, Junming Liu, Xiaoqin Wu, Qian Wu, Xiaoyan Huang, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Center For Disease Control and Prevention(上海市疾病预防控制中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 EpiPlanAgent利用大语言模型和多代理框架,实现自动化疫情响应规划,显著提升计划完整性并减少开发时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11544 2025-12-15 cs.AI 57%

AI-MASLD Metabolic Dysfunction and Information Steatosis of Large Language Models in Unstructured Clinical Narratives

AI-MASLD 大语言模型在无结构临床叙述中的代谢功能障碍与信息脂肪变

Yuan Shen, Xiaojun Wu, Linghua Yu

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究首次实证表明大语言模型在处理临床信息时表现出类似代谢功能障碍的特征,提出AI-MASLD概念,强调需在人类监督下使用LLMs作为辅助工具。

Comments 47 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11437 2025-12-15 cs.CL 57%

CLINIC: Evaluating Multilingual Trustworthiness in Language Models for Healthcare

CLINIC:评估语言模型在医疗领域的多语言可信度

Akash Ghosh, Srivarshinee Sridhar, Raghav Kaushik Ravi, Muhsin Muhsin, Sriparna Saha, Chirag Agarwal

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) IGIMS, Patna(帕纳布IGIMS) University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CLINIC提出一个多语言基准,评估语言模型在医疗领域的可信度,揭示其在事实准确性、公平性和隐私保护方面的不足。

Comments 49 pages, 31 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11323 2025-12-15 cs.AI 57%

CAPTURE: A Benchmark and Evaluation for LVLMs in CAPTCHA Resolving

CAPTURE:一个用于LVLM在CAPTCHA解决中的基准和评估

Jianyi Zhang, Ziyin Zhou, Xu Ji, Shizhao Liu, Zhangchi Zhao

机构 * Beijing Electric Science and Technology Institute(北京电子科技研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 CAPTURE是一个专为LVLM设计的CAPTCHA基准,涵盖4种主要类型和25种子类型,旨在全面评估LVLM在解决CAPTCHA任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16979 2025-12-15 cs.CV cs.AI 57%

The Finer the Better: Towards Granular-aware Open-set Domain Generalization

更细的更好:面向粒度感知的开集域泛化

Yunyun Wang, Zheng Duan, Xinyue Liao, Ke-Jia Chen, Songcan Chen

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 SeeCLIP通过细粒度语义增强解决开集域泛化中的结构风险与开放空间风险困境,提升模型对难区分未知类别的判别能力。

Comments 9 pages,3 figures,aaai2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26898 2025-12-15 cs.LG 57%

Integrating Ontologies with Large Language Models for Enhanced Control Systems in Chemical Engineering

将本体与大语言模型结合以增强化工工程中的控制系统

Crystal Su, Kuai Yu, Jingrui Zhang, Mingyuan Shao, Daniel Bauer

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出结合本体的LLM框架,用于增强化工工程控制系统,通过结构化知识与生成推理结合,提升过程控制和安全分析的可解释性和可靠性。

Comments This paper is withdrawn due to issues with attribution and citation accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10968 2025-12-15 cs.CL cs.SD eess.AS 57%

Benchmarking Automatic Speech Recognition Models for African Languages

对非洲语言自动语音识别模型的基准测试

Alvin Nahabwe, Sulaiman Kagumire, Denis Musinguzi, Bruno Beijuka, Jonah Mubuuke Kyagaba, Peter Nabende, Andrew Katumba, Joyce Nakatumba-Nabende

机构 * Makerere University Centre for Artificial Intelligence(Makerere大学人工智能中心) Marconi Lab(Marconi实验室) Department of Information Systems(信息系统系) Department of Electrical Engineering(电气工程系) Department of Computer Science(计算机科学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究对四种最先进的ASR模型在13种非洲语言上进行基准测试,揭示不同模型在不同资源条件下的表现差异及优化策略。

Comments 19 pages, 8 figures, Deep Learning Indiba, Proceedings of Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11680 2025-12-15 cs.CV 50%

Cross-modal Context-aware Learning for Visual Prompt Guided Multimodal Image Understanding in Remote Sensing

跨模态上下文感知学习:用于遥感中视觉提示引导的多模态图像理解

Xu Zhang, Jiabin Fang, Zhuoming Ding, Jin Yuan, Xuan Liu, Qianjun Zhang, Zhiyong Li

机构 * College of Computer Science and Electronic Engineering, Hunan University(计算机科学与电子工程学院,湖南大学) School of Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人学院及机器人视觉感知与控制技术国家工程研究中心,湖南大学) School of Computing and Artificial Intelligence, Southwest Jiaotong University(计算与人工智能学院,西南交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 CLV-Net通过跨模态上下文感知学习,利用视觉提示引导遥感多模态图像理解,提升目标识别精度和用户意图对齐能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11215 2025-12-15 cs.CV 50%

SmokeBench: Evaluating Multimodal Large Language Models for Wildfire Smoke Detection

SmokeBench: 评估多模态大语言模型用于野火烟雾检测

Tianye Qi, Weihao Li, Nick Barnes

机构 * Australian National University(澳大利亚国立大学)

专题命中 安全评测 :safety(abstract)

AI总结 SmokeBench评估多模态大语言模型在野火烟雾检测中的性能,发现模型在烟雾定位方面存在显著局限,尤其在早期阶段。

Comments Accepted to WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏