arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9451 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9451 篇

2512.06645 2025-12-09 cs.MA 50%

Analyzing Collision Rates in Large-Scale Mixed Traffic Control via Multi-Agent Reinforcement Learning

通过多智能体强化学习分析大规模混合交通控制中的碰撞率

Muyang Fan

专题命中 安全评测 :safety(abstract)

AI总结 本研究通过多智能体强化学习分析大规模混合交通控制中的碰撞率影响因素,探讨交通密度、信号协调和转向策略对碰撞风险的作用,为提升交通系统安全性和效率提供理论支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06583 2025-12-09 econ.GN q-fin.EC 50%

Tournament-Based Performance Evaluation and Systematic Misallocation: Why Forced Ranking Systems Produce Random Outcomes

基于竞赛的绩效评估与系统性误分配:为什么强制排名系统产生随机结果

Jeremy McEntire

专题命中 安全评测 :alignment(abstract)

AI总结 本文揭示强制排名系统因系统性误分配导致随机结果,指出其无法有效解决委托-代理问题,反而加剧了分配误差。

Comments 31 pages, 6 tables. Agent-based simulation demonstrating structural allocation failures in tournament-based forced distribution evaluation mechanisms. Includes sensitivity analyses across team bias levels, alternative distributions, and cutoff percentages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05559 2025-12-08 q-fin.CP 50%

A Unified AI System For Data Quality Control and DataOps Management in Regulated Environments

统一的AI系统用于受监管环境中的数据质量控制和DataOps管理

Devender Saini, Bhavika Jain, Nitish Ujjwal, Philip Sommer, Dan Romuald Mbanga, Dhagash Mehta

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种统一的AI驱动框架,用于受监管环境中数据质量控制和DataOps管理,通过整合多种方法提升数据管道的可靠性与合规性。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05511 2025-12-08 cs.CV 50%

Rethinking Infrared Small Target Detection: A Foundation-Driven Efficient Paradigm

重新思考红外小目标检测:一种基础驱动的高效范式

Chuang Yu, Jinmiao Zhao, Yunpeng Liu, Yaokun Li, Xiujun Shu, Yuanhao Feng, Bo Wang, Yimian Dai, Xiangyu Yue

机构 * Key Laboratory of Opto-Electronic Information Processing, Chinese Academy of Sciences(光电信息处理重点实验室,中国科学院) Shenyang Institute of Automation, Chinese Academy of Sciences(沈阳自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Tencent(腾讯) Nankai University(南开大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FDEP范式,通过基础模型冻结表示与任务特征融合,提升红外小目标检测精度,构建综合评估指标,实现多数据集SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05470 2025-12-08 cs.SE 50%

Everything is Context: Agentic File System Abstraction for Context Engineering

一切皆为上下文:面向上下文工程的代理文件系统抽象

Xiwei Xu, Robert Mao, Quan Bai, Xuewu Gu, Yechao Li, Liming Zhu

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种基于文件系统的上下文工程抽象,通过统一挂载、元数据和访问控制,实现可验证的上下文管理,支持可问责和以人类为中心的AI协作。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14257 2025-12-08 cs.SE 50%

C2SaferRust: Transforming C Projects into Safer Rust with NeuroSymbolic Techniques

C2SaferRust:利用神经符号技术将C项目转化为更安全的Rust

Vikram Nitin, Rahul Krishna, Luiz Lemos do Valle, Baishakhi Ray

专题命中 安全评测 :safety(abstract)

AI总结 C2SaferRust结合规则系统和LLMs,将C代码转换为更安全的Rust,减少指针和unsafe代码,提升安全性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03635 2025-12-04 cs.LO cs.SE 50%

Formal Analysis of the Sigmoid Function and Formal Proof of the Universal Approximation Theorem

对Sigmoid函数的正式分析及通用逼近定理的正式证明

Dustin Bryant, Jim Woodcock, Simon Foster

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文在Isabelle/HOL中形式化分析了Sigmoid函数并证明了通用逼近定理,填补了形式化证明库的空白,提升了神经网络的可信度。

Comments 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11045 2025-12-04 cs.CV 50%

StableV2V: Stablizing Shape Consistency in Video-to-Video Editing

StableV2V: 视频到视频编辑中的形状一致性稳定

Chang Liu, Rui Li, Kaidong Zhang, Yunwei Lan, Dong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 StableV2V通过分解编辑流程并建立运动与提示的对齐,提升视频到视频编辑的形状一致性与效率。

Comments Project page: https://alonzoleeeooo.github.io/StableV2V, code: https://github.com/AlonzoLeeeooo/StableV2V, model weights: https://huggingface.co/AlonzoLeeeooo/StableV2V, dataset (DAVIS-Edit): https://huggingface.co/datasets/AlonzoLeeeooo/DAVIS-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17699 2025-12-03 cs.CV q-bio.QM 50%

Benchmarking Class Activation Map Methods for Explainable Brain Hemorrhage Classification on Hemorica Dataset

在Hemorica数据集上基于类激活图方法的可解释性脑出血分类基准测试

Z. Rafati, M. Hoseyni, J. Khoramdel, A. Nikoofard

机构 * Faculty of Computer Engineering, K. N. Toosi University of Technology(计算机工程学院,K.N.托菲大学) Faculty of Electrical Engineering, K. N. Toosi University of Technology(电气工程学院,K.N.托菲大学) Faculty of Mechanical Engineering, Tarbiat Modares University(机械工程学院,塔里比亚特莫达res大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过在Hemorica数据集上评估九种CAM算法,发现AblationCAM在像素级Dice和IoU指标上表现最佳,为脑出血分类的可解释性提供了新的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02410 2025-12-03 cs.MA cs.CR 50%

Decentralized Multi-Agent System with Trust-Aware Communication

去中心化多智能体系统与信任感知通信

Yepeng Ding, Ahmed Twabi, Junwei Yu, Lingfeng Zhang, Tohru Kondo, Hiroyuki Sato

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于区块链的去中心化多智能体系统,通过信任感知通信协议解决传统集中式系统中的信任、可扩展性和抗审查问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02329 2025-12-03 cs.SE 50%

Towards autonomous normative multi-agent systems for Human-AI software engineering teams

迈向自主规范的多智能体系统用于人机软件工程团队

Hoa Khanh Dam, Geeta Mahala, Rashina Hoda, Xi Zheng, Cristina Conati

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出自主规范的多智能体系统,通过大型语言模型赋能,实现人机协作的高效软件开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22686 2025-12-03 cs.CV 50%

Emergent Extreme-View Geometry in 3D Foundation Models

三维基础模型中的涌现极端视角几何

Yiwen Zhang, Joseph Tung, Ruojin Cai, David Fouhey, Hadar Averbuch-Elor

机构 * Cornell University(康奈尔大学) New York University(纽约大学) Kempner Institute, Harvard University(哈佛大学凯普勒研究所)

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了三维基础模型在极端视角下的几何理解能力,并提出轻量级对齐方案提升其相对姿态估计性能,同时引入新的未见过的互联网场景基准。

Comments Project page is at https://ext-3dfms.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00928 2025-12-02 cs.MM 50%

Augmenting Intra-Modal Understanding in MLLMs for Robust Multimodal Keyphrase Generation

增强多模态大语言模型的模态内理解以实现鲁棒的多模态关键词生成

Jiajun Cao, Qinggang Zhang, Yunbo Tang, Zhishang Xiang, Chang Yang, Jinsong Su

专题命中 安全评测 :alignment(abstract)

AI总结 AimKP通过增强模态内语义学习和跨模态对齐,提升多模态关键词生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV 50%

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23594 2025-12-02 cs.CV 50%

PRISM-Bench: A Benchmark of Puzzle-Based Visual Tasks with CoT Error Detection

PRISM-Bench: 一个包含推理错误检测的基于谜题的视觉任务基准

Yusu Qian, Cheng Wan, Chao Jia, Yinfei Yang, Qingyu Zhao, Zhe Gan

专题命中 安全评测 :trustworthy(abstract)

AI总结 PRISM-Bench通过检测推理错误评估多模态模型的视觉推理能力,揭示了流畅生成与忠实推理之间的差距。

Comments This paper's first error detection task's ground truth data contains hallucination introduced by gpt and needs to be withdrawn

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.19480 2025-12-02 cs.CV 50%

Learning by Aligning 2D Skeleton Sequences and Multi-Modality Fusion

通过对齐2D骨骼序列和多模态融合进行学习

Quoc-Huy Tran, Muhammad Ahmed, Murad Popattia, M. Hassan Ahmed, Andrey Konin, M. Zeeshan Zia

机构 * Retrocausal, Inc.(Retrocausal公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出通过2D骨骼热图和多模态融合提升时间视频对齐的自监督学习方法,实现更高的准确性和鲁棒性。

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00082 2025-12-02 cs.CV 50%

Exploring Diagnostic Prompting Approach for Multimodal LLM-based Visual Complexity Assessment: A Case Study of Amazon Search Result Pages

探索用于多模态大语言模型视觉复杂性评估的诊断提示方法:亚马逊搜索结果页面案例研究

Divendar Murtadak, Yoon Kim, Trilokya Akula

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过对比诊断提示与传统提示方法,发现其在提升多模态大语言模型对亚马逊搜索结果页面视觉复杂性评估的可靠性方面有显著改进,但仍有待进一步优化。

Comments 9 pages, 4 figures, 9 tables. Study on diagnostic prompting for multimodal LLM-based visual complexity assessment of Amazon search result pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23241 2025-12-01 cs.CV 50%

Synthetic Industrial Object Detection: GenAI vs. Feature-Based Methods

合成工业目标检测:GenAI与基于特征的方法

Jose Moises Araya-Martinez, Adrián Sanchis Reig, Gautham Mohan, Sarvenaz Sardari, Jens Lambrecht, Jörg Krüger

专题命中 安全评测 :alignment(abstract)

AI总结 本研究比较了GenAI与基于特征的方法在合成工业目标检测中的效果,发现简单方法在准确性和效率上优于复杂GenAI方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23100 2025-12-01 math.OC 50%

On Rank Graduation Metrics for High Dimensional Ordinal Data

关于高维有序数据的排名渐进度量方法

Gennaro Auricchio, Adelaide Emma Bernardelli, Paolo Giudici, Giuseppe Toscani

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出了一种基于Rank Graduation度量的方法,用于高维有序数据的比较,通过量化预测对响应变异的解释比例,提升AI系统的可靠性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22928 2025-12-01 cs.RO 50%

Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models

在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理

Jiaxin Liu, Xiangyu Yan, Liang Peng, Lei Yang, Lingjun Zhang, Yuechen Luo, Yueming Tao, Ashton Yu Xuan Tan, Mu Li, Lei Zhang, Ziqi Zhan, Sai Guo, Hong Wang, Jun Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 50%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06597 2025-12-01 cs.RO 50%

LiHRA: A LiDAR-Based HRI Dataset for Automated Risk Monitoring Methods

LiHRA:基于LiDAR的人机交互风险监测数据集

Frederik Plahl, Georgios Katranis, Ilshat Mamaev, Andrey Morozov

机构 * Proximity Robotics & Automation GmbH(近距机器人与自动化有限公司) Institute of Industrial Automation and Software Engineering, University of Stuttgart(工业自动化与软件工程学院,斯图加特大学)

专题命中 安全评测 :safety(abstract)

AI总结 LiHRA数据集通过多模态数据支持人机交互风险监测方法的开发,提供高分辨率LiDAR数据和真实碰撞事件,用于训练和评估RM算法。

Comments Preprint of final paper that will appear in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22576 2025-12-01 cs.MM 50%

A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization

一种用于故事可视化多元文化分析的渐进评估框架

Janak Kapuriya, Ali Hatami, Paul Buitelaar

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种渐进多元文化评估框架,通过五个新指标评估故事可视化模型在不同文化下的表现,揭示模型在文化适当性和视觉美学上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22359 2025-12-01 cs.SE cs.CR 50%

UniBOM -- A Unified SBOM Analysis and Visualisation Tool for IoT Systems and Beyond

UniBOM -- 一种用于物联网系统及更广泛领域的统一SBOM分析与可视化工具

Vadim Safronov, Ionut Bostan, Nicholas Allott, Andrew Martin

专题命中 安全评测 :safety(abstract)

AI总结 UniBOM是一种用于物联网系统及更广泛领域的统一SBOM分析与可视化工具,通过集成二进制、文件系统和源代码分析,提升漏洞检测与风险管理能力。

Comments This paper has been accepted at the ACM 15th International Conference on the Internet of Things (ACM IoT 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22253 2025-12-01 cs.IR cs.CV 50%

UNION: A Lightweight Target Representation for Efficient Zero-Shot Image-Guided Retrieval with Optional Textual Queries

UNION: 一种轻量级的目标表示用于高效零样本图像引导检索与可选文本查询

Hoang-Bao Le, Allie Tran, Binh T. Nguyen, Liting Zhou, Cathal Gurrin

专题命中 安全评测 :alignment(abstract)

AI总结 UNION通过融合图像嵌入与空文本提示,实现高效零样本图像引导检索,仅需5,000训练样本即在多个基准测试中超越传统基线。

Comments Accepted at ICDM - MMSR Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22055 2025-12-01 cs.CV cs.MM 50%

OralGPT-Omni: A Versatile Dental Multimodal Large Language Model

OralGPT-Omni: 一种多功能的牙科多模态大语言模型

Jing Hao, Yuci Liang, Lizhuo Lin, Yuxuan Fan, Wenkai Zhou, Kaixin Guo, Zanting Ye, Yanpeng Sun, Xinyu Zhang, Yanqi Yang, Qiankun Li, Hao Tang, James Kit-Hon Tsoi, Linlin Shen, Kuo Feng Hung

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙科学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) School of Biomedical Engineering, Southern Medical University(南方医科大学生物医学工程学院) Singapore University of Technology and Design(新加坡科技与设计大学) University of Auckland(奥克兰大学) University of Science and Technology of China(中国科学技术大学) School of Computer Science, Peking University(北京大学计算机学院) College of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 OralGPT-Omni是一种专门用于牙科的多模态大语言模型,通过TRACE-CoT数据集和四阶段训练范式,实现了对牙科图像的高效分析和高准确率评估。

Comments 47 pages, 42 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19057 2025-12-01 cs.IR 50%

RELATE: Relation Extraction in Biomedical Abstracts with LLMs and Ontology Constraints

RELATE:利用LLMs和本体约束进行生物医学摘要中的关系提取

Olawumi Olasunkanmi, Mathew Satusky, Hong Yi, Chris Bizon, Harlin Lee, Stanley Ahalt

专题命中 安全评测 :alignment(abstract)

AI总结 RELATE通过结合LLMs和本体约束,提升生物医学摘要中关系提取的标准化和准确性,有效构建标准化知识图谱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21106 2025-11-27 cs.CV 50%

EM-KD: Distilling Efficient Multimodal Large Language Model with Unbalanced Vision Tokens

EM-KD: 通过不平衡视觉标记的知识蒸馏提升高效多模态大语言模型

Ze Feng, Sen Yang, Boqiang Duan, Wankou Yang, Jingdong Wang

机构 * Baidu VIS(百度视觉)

专题命中 安全评测 :alignment(abstract)

AI总结 EM-KD通过改进的知识蒸馏方法,有效提升高效多模态大语言模型的视觉理解和效率。

Comments accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20914 2025-11-27 eess.SY cs.SY 50%

Distributionally Robust Cascading Risk in Multi-Agent Rendezvous: Extended Analysis of Parameter-Induced Ambiguity

多智能体会合中的分布鲁棒级联风险:参数诱导模糊性的扩展分析

Vivek Pandey, Nader Motee

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种分析多智能体会合中分布鲁棒级联风险的理论框架,通过引入条件分布鲁棒函数和闭合形式风险表达式,揭示了参数不确定性对集体安全的影响,并通过模拟验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20550 2025-11-26 cs.LO 50%

Verifying Numerical Methods with Isabelle/HOL

用Isabelle/HOL验证数值方法

Dustin Bryant, Jonathan Julian Huerta y Munive, Simon Foster

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于ITrees的Isabelle/HOL框架,用于验证数值方法,通过形式化规范和自动证明方法,实现从形式化到可执行代码的端到端验证流程。

Comments 30 pages, 30 listings, for accompanying formalisation, see https://zenodo.org/records/17679526

详情

展开后加载摘要…

URL PDF HTML 收藏