arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-01 至 2025-12-01 共收录 26 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2410.00081 2025-12-01 cs.MA cs.AI 89%

From homeostasis to resource sharing: Biologically and economically aligned multi-objective multi-agent gridworld-based AI safety benchmarks

从稳态到资源共享:生物和经济对齐的多目标多智能体网格世界基于AI安全基准

Roland Pihlakas

机构 * Independent researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文提出生物和经济对齐的多目标多智能体网格世界基准,用于评估AI安全中的稳态、 diminishing returns、可持续性和资源共享等关键问题。

Comments 21 pages, 13 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22047 2025-12-01 cs.CR 82%

Evaluating the Robustness of Large Language Model Safety Guardrails Against Adversarial Attacks

评估大型语言模型安全防护措施对对抗攻击的鲁棒性

Richard J. Young

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract)

AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。

Comments 21 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21737 2025-12-01 cs.CL cs.AI 81%

Polarity-Aware Probing for Quantifying Latent Alignment in Language Models

考虑极性的人探针用于量化语言模型中的潜在对齐

Sabrina Sadiekh, Elena Ericheva, Chirag Agarwal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 提出考虑极性的CCS方法,用于量化语言模型潜在对齐的鲁棒性,揭示模型内部表示的一致性差异。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21920 2025-12-01 cs.SE cs.AI 79%

Toward Automated and Trustworthy Scientific Analysis and Visualization with LLM-Generated Code

迈向基于LLM生成代码的自动化和可信的科学分析与可视化

Apu Kumar Chakroborti, Yi Ding, Lipeng Wan

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文探讨了LLM生成代码在科学分析与可视化中的可信度与自动化潜力,提出三种策略提升代码执行成功率与质量,强调需进一步优化以构建更可靠的AI辅助研究工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21799 2025-12-01 cs.LG 79%

The Double-Edged Nature of the Rashomon Set for Trustworthy Machine Learning

拉索蒙集在可信机器学习中的双刃剑性质

Ethan Hsu, Harry Chen, Chudi Zhong, Lesia Semenova

机构 * Duke University(杜克大学) MIT(麻省理工学院) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Rutgers University(罗格斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 研究揭示了拉索蒙集在可信机器学习中的双刃剑性质,指出其在提升鲁棒性的同时也带来隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02821 2025-12-01 cs.CV cs.AI cs.LG 73%

Sparse Autoencoders Learn Monosemantic Features in Vision-Language Models

稀疏自编码器在视觉-语言模型中学习单义特征

Mateusz Pach, Shyamgopal Karthik, Quentin Bouniot, Serge Belongie, Zeynep Akata

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) University of Tübingen(图宾根大学) University of Copenhagen(哥本哈根大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过稀疏自编码器提升视觉-语言模型中神经元的单义性,展示其在增强模型可解释性和可控性方面的有效性。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18192 2025-12-01 cs.CV cs.AI 70%

ARIAL: An Agentic Framework for Document VQA with Precise Answer Localization

ARIAL:一个用于文档视觉问答的代理框架,具有精确答案定位

Ahmad Mohammadshirazi, Pinaki Prasad Guha Neogi, Dheeraj Kulshrestha, Rajiv Ramnath

机构 * Ohio State University(俄亥俄州立大学) Flairsoft(Flairsoft公司)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 ARIAL通过代理协调专门工具,实现文档VQA的高精度和可解释性,取得最佳性能和可解释性成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12565 2025-12-01 cs.CL 70%

Self Iterative Label Refinement via Robust Unlabeled Learning

通过鲁棒无标签学习实现自迭代标签细化

Hikaru Asano, Tadashi Kozuno, Yukino Baba

机构 * The University of Tokyo(东京大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出了一种通过鲁棒无标签学习实现自迭代标签细化的方法,有效提升了LLM在分类任务中的性能,并在安全对齐和生成任务中展示了优越性。

Comments To appear in the Thirty-Ninth Annual Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22061 2025-12-01 cs.GT 67%

Aligning with Human Values to Enhance Interaction: An eHMI-Mediated Lane-Changing Negotiation Strategy Using Bayesian Inference

与人类价值观对齐以增强交互:一种使用贝叶斯推理的eHMI介导的变道协商策略

Boyao Peng, Linkun Liu

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文提出了一种使用贝叶斯推理的eHMI介导变道协商策略,通过善意欺骗提升交互效率和安全性,但同时也揭示了信任崩溃的伦理风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21742 2025-12-01 cs.CL cs.AI 62%

EduMod-LLM: A Modular Approach for Designing Flexible and Transparent Educational Assistants

EduMod-LLM: 一种用于设计灵活且透明教育助手的模块化方法

Meenakshi Mittal, Rishi Khare, Mihran Miroyan, Chancharik Mitra, Narges Norouzi

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 EduMod-LLM通过模块化方法评估教育问答系统各组件性能,揭示失败模式,提升透明度和教学对齐效果。

Comments Proceedings of the AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23387 2025-12-01 cs.AI 57%

Hierarchical AI-Meteorologist: LLM-Agent System for Multi-Scale and Explainable Weather Forecast Reporting

分层人工智能气象学家:用于多尺度和可解释性天气预报报告的LLM代理系统

Daniil Sukhorukov, Andrei Zakharov, Nikita Glazkov, Katsiaryna Yanchanka, Vladimir Kirilin, Maxim Dubovitsky, Roman Sultimov, Yuri Maksimov, Ilya Makarov

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出分层人工智能气象学家,通过多尺度推理和关键词生成提升天气预报的可解释性和鲁棒性。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23118 2025-12-01 stat.ME cs.LG 57%

Machine learning for violence prediction: a systematic review and critical appraisal

利用机器学习进行暴力预测:系统综述与批判性评估

Stefaniya Kozhevnikova, Denis Yukhnenko, Giulio Scola, Seena Fazel

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文系统综述了机器学习在暴力预测中的应用,指出当前模型在临床应用中存在偏倚风险和低效用,建议改进方法和加强跨学科合作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22805 2025-12-01 cs.CV cs.LG cs.MM 57%

From Pixels to Feelings: Aligning MLLMs with Human Cognitive Perception of Images

从像素到感受:将MLLMs对齐于人类对图像的认知感知

Yiming Chen, Junlin Han, Tianyi Bai, Shengbang Tong, Filippos Kokkinos, Philip Torr

机构 * Oxford University(牛津大学) HKUST(香港科技大学) University College London(伦敦大学学院) New York University(纽约大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出CogIP-Bench基准,通过后训练提升MLLMs对图像认知属性的对齐能力,并展示其在图像生成中的应用。

Comments Project page with codes/datasets/models: https://follen-cry.github.io/MLLM-Cognition-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22777 2025-12-01 cs.RO cs.AI 57%

Improving Robotic Manipulation Robustness via NICE Scene Surgery

通过NICE场景手术提升机器人操作的鲁棒性

Sajjad Pakdamansavoji, Mozhgan Pourkeshavarz, Adam Sigal, Zhiyuan Li, Rui Heng Yang, Amir Rasouli

机构 * Huawei Technologies Canada(华为技术加拿大公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 NICE通过增强场景上下文减少分布外差距,提升机器人操作在复杂环境中的鲁棒性和安全性。

Comments 11 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21970 2025-12-01 cs.LG eess.SP 57%

MOTIF-RF: Multi-template On-chip Transformer Synthesis Incorporating Frequency-domain Self-transfer Learning for RFIC Design Automation

MOTIF-RF: 多模板芯片上变压器合成结合频率域自迁移学习用于射频集成电路设计自动化

Houbo He, Yizhou Xu, Lei Xia, Yaolong Hu, Fan Cai, Taiyun Chi

机构 * ECE Department, Rice University(Rice大学电子工程系) Keysight Technologies(Keysight技术公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 MOTIF-RF通过频率域自迁移学习提升变压器逆设计精度,提供AI辅助的射频集成电路自动化设计工具。

Comments Accepted at ASP-DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21698 2025-12-01 cs.MM cs.AI 57%

TIP and Polish: Text-Image-Prototype Guided Multi-Modal Generation via Commonality-Discrepancy Modeling and Refinement

TIP和Polish:通过共同性-差异性建模与细化的文本-图像-原型引导的多模态生成

Zhiyong Ma, Jiahao Chen, Qingyuan Chuai, Zhengping Li

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 TIPPo通过共同性-差异性建模与细化,提升多模态生成的主题一致性和风格一致性。

Comments Submitted to ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 50%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 安全评测 :alignment(abstract)

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23100 2025-12-01 math.OC 50%

On Rank Graduation Metrics for High Dimensional Ordinal Data

关于高维有序数据的排名渐进度量方法

Gennaro Auricchio, Adelaide Emma Bernardelli, Paolo Giudici, Giuseppe Toscani

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于Rank Graduation度量的方法,用于高维有序数据的比较,通过量化预测对响应变异的解释比例,提升AI系统的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22928 2025-12-01 cs.RO 50%

Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models

在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理

Jiaxin Liu, Xiangyu Yan, Liang Peng, Lei Yang, Lingjun Zhang, Yuechen Luo, Yueming Tao, Ashton Yu Xuan Tan, Mu Li, Lei Zhang, Ziqi Zhan, Sai Guo, Hong Wang, Jun Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 50%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06597 2025-12-01 cs.RO 50%

LiHRA: A LiDAR-Based HRI Dataset for Automated Risk Monitoring Methods

LiHRA:基于LiDAR的人机交互风险监测数据集

Frederik Plahl, Georgios Katranis, Ilshat Mamaev, Andrey Morozov

机构 * Proximity Robotics & Automation GmbH(近距机器人与自动化有限公司) Institute of Industrial Automation and Software Engineering, University of Stuttgart(工业自动化与软件工程学院,斯图加特大学)

专题命中 安全评测 :safety(abstract)

AI总结 LiHRA数据集通过多模态数据支持人机交互风险监测方法的开发,提供高分辨率LiDAR数据和真实碰撞事件,用于训练和评估RM算法。

Comments Preprint of final paper that will appear in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22576 2025-12-01 cs.MM 50%

A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization

一种用于故事可视化多元文化分析的渐进评估框架

Janak Kapuriya, Ali Hatami, Paul Buitelaar

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种渐进多元文化评估框架,通过五个新指标评估故事可视化模型在不同文化下的表现,揭示模型在文化适当性和视觉美学上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22359 2025-12-01 cs.SE cs.CR 50%

UniBOM -- A Unified SBOM Analysis and Visualisation Tool for IoT Systems and Beyond

UniBOM -- 一种用于物联网系统及更广泛领域的统一SBOM分析与可视化工具

Vadim Safronov, Ionut Bostan, Nicholas Allott, Andrew Martin

专题命中 安全评测 :safety(abstract)

AI总结 UniBOM是一种用于物联网系统及更广泛领域的统一SBOM分析与可视化工具,通过集成二进制、文件系统和源代码分析,提升漏洞检测与风险管理能力。

Comments This paper has been accepted at the ACM 15th International Conference on the Internet of Things (ACM IoT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22253 2025-12-01 cs.IR cs.CV 50%

UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries

UNION: 一种轻量级的目标表示用于高效零样本图像引导检索与可选文本查询

Hoang-Bao Le, Allie Tran, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

专题命中 安全评测 :alignment(abstract)

AI总结 UNION通过融合图像嵌入与空文本提示,实现高效零样本图像引导检索,仅需5,000训练样本即在多个基准测试中超越传统基线。

Comments Accepted at ICDM - MMSR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM 50%

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19057 2025-12-01 cs.IR 50%

RELATE: Relation Extraction in Biomedical Abstracts with LLMs and Ontology Constraints

RELATE:利用LLMs和本体约束进行生物医学摘要中的关系提取

Olawumi Olasunkanmi, Mathew Satusky, Hong Yi, Chris Bizon, Harlin Lee, Stanley Ahalt

专题命中 安全评测 :alignment(abstract)

AI总结 RELATE通过结合LLMs和本体约束,提升生物医学摘要中关系提取的标准化和准确性,有效构建标准化知识图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏