arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9434 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9434 篇

2604.12693 2026-04-15 cs.CV 50%

Risk-Calibrated Learning: Minimizing Fatal Errors in Medical AI

风险校准学习:在医学AI中最小化致命错误

Abolfazl Mohammadi-Seif, Ricardo Baeza-Yates

机构 * Department of Engineering(工程系) Universitat Pompeu Fabra(庞培乌法拉大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出风险校准学习方法,通过区分视觉模糊与结构性错误,提升医学AI的可靠性,实验表明其在多种影像模态中显著降低关键错误率。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026). The final published version should be cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11767 2026-04-15 cs.PL cs.MA cs.SE 50%

$λ_A$: A Typed Lambda Calculus for LLM Agent Composition

$λ_A$: 一种用于LLM代理组合的类型lambda演算

Qin Liu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出$λ_A$类型lambda演算,通过引入oracle调用、有界固定点、概率选择和可变环境扩展简单类型lambda演算,证明类型安全性和终止性,并展示其在代理配置检测中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12403 2026-04-15 cs.CV 50%

Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning

双模锚引导过滤用于测试时提示微调

Jungwon Choi, Eunwoo Kim

机构 * School of Computer Science and Engineering, Chung-Ang University(Chung-Ang大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出双模锚引导框架,通过语义证据指导视图选择,结合文本和图像锚点进行过滤和集成,提升测试时提示微调的鲁棒性。

Comments Accepted by CVPR 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12048 2026-04-15 cs.SE 50%

ORBIT: Guided Agentic Orchestration for Autonomous C-to-Rust Transpilation

ORBIT: 用于自主C到Rust转换的引导代理 orchestration

Muhammad Farrukh, Baris Coskun, Tapti Palit, Michalis Polychronakis

专题命中 安全评测 :safety(abstract)

AI总结 ORBIT 提出一种自主代理框架,通过动态上下文收集和依赖引导 orchestration 实现项目级 C到Rust转换,显著提升大规模代码转换的准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11444 2026-04-14 cs.CV 50%

HuiYanEarth-SAR: A Foundation Model for High-Fidelity and Low-Cost Global Remote Sensing Imagery Generation

HuiYanEarth-SAR:一种用于高保真和低成本全球遥感影像生成的基础模型

Yongxiang Liu, Jie Zhou, Yafei Song, Tianpeng Liu, Li Liu

机构 * College of Electronic Science and Technology, National University of Defense Technology (NUDT)(国防科技大学电子科学学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出HuiYanEarth-SAR模型,结合AlphaEarth和散射机制,实现基于地理坐标生成高保真全球SAR影像,推动遥感研究从感知到模拟的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11161 2026-04-14 cs.HC cs.MA 50%

A Simulation-Based Method for Testing Collaborative Learning Scaffolds Using LLM-Based Multi-Agent Systems

基于模拟的方法用于使用基于LLM的多智能体系统测试协作学习支架

Han Wua, Lishan Zhang, Chunming Lu

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于LLM的多智能体模拟方法,研究协作学习过程及教学支架有效性,通过对比两种策略提升讨论多样性与互动深度,符合ICAP框架。

Comments submitted to journal of computer aisstant learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03765 2026-04-14 cs.CV 50%

ITIScore: An Image-to-Text-to-Image Rating Framework for the Image Captioning Ability of MLLMs

ITIScore: 一种图像到文本到图像评分框架,用于评估多模态大语言模型的图像描述能力

Zitong Xu, Huiyu Duan, Shengyao Qin, Guangyu Yang, Guangji Ma, Xiongkuo Min, Ke Gu, Guangtao Zhai, Patrick Le Callet

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic and Science Technology of China(电子科技大学) Beijing University of Technology(北京工业大学) Institut Universitaire de France (IUF), University of Nantes(法国大学研究院(IUF),南特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出ICBenchmark图像描述基准,包含12类内容和2K图像生成的40K短长描述,提出ITIScore自动评估指标,通过图像到文本到图像框架衡量描述质量,实验显示其与人类判断一致且具有强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11022 2026-04-14 quant-ph 50%

SPATE: Spiking-Phase Adaptive Temporal Encoding for Quantum Machine Learning

SPATE:基于脉冲-相位自适应的量子机器学习时序编码

Nouhaila Innan, Rachmad Vidya Wicaksana Putra, Muhammad Shafique

专题命中 安全评测 :alignment(abstract)

AI总结 SPATE通过将实值表格特征转换为漏电积分-放电脉冲序列,并利用量子旋转映射脉冲统计,提升量子特征表示能力,实验显示其在多个数据集上表现更优。

Comments 8 pages, 4 figures. Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10522 2026-04-14 cs.CR 50%

SEED: A Large-Scale Benchmark for Provenance Tracing in Sequential Deepfake Facial Edits

SEED:一个大规模的面部深度伪造序列编辑溯源基准

Mengieong Hoi, Zhedong Zheng, Ping Liu, Wei Liu

专题命中 安全评测 :trustworthy(abstract)

AI总结 SEED通过多步扩散编辑流程生成90000张图像,包含编辑顺序、文本指令等细粒度标注,用于研究序列溯源和伪造检测,揭示空间与频域特征在深度伪造分析中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10437 2026-04-14 cs.CV 50%

Enhancing Fine-Grained Spatial Grounding in 3D CT Report Generation via Discriminative Guidance

通过判别引导增强3D CT报告生成中的细粒度空间定位

Chenyu Wang, Weicheng Dai, Han Liu, Wenchao Li, Kayhan Batmanghelich

机构 * Boston University(波士顿大学) Siemens Healthineers(西门子医疗)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出DCP-PD框架,通过提炼自由文本报告中的细粒度线索,指导报告生成并减少对快捷方式的依赖,提升了CT-RATE和Rad-ChestCT的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10436 2026-04-14 cs.CV 50%

SignReasoner: Compositional Reasoning for Complex Traffic Sign Understanding via Functional Structure Units

SignReasoner:通过功能结构单元实现复杂交通标志理解的组合推理

Ruibin Wang, Zhenyu Lin, Xinhai Zhao

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出SignReasoner,通过功能结构单元实现复杂交通标志的组合推理,提升自动驾驶安全。核心方法是功能结构单元,通过分解标志为基本功能块,增强模型对未知配置的泛化能力。

Comments CVPRF 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09087 2026-04-14 cs.IR 50%

DIAURec: Dual-Intent Space Representation Optimization for Recommendation

DIAURec: 双意图空间表示优化用于推荐

Yu Zhang, Yiwen Zhang, Yi Zhang, Lei Sang

专题命中 安全评测 :alignment(abstract)

AI总结 DIAURec通过统一意图和语言模型优化推荐表示,提升用户与物品在特征空间中的亲和力,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17853 2026-04-14 cs.DL 50%

CiteGuard: Faithful Citation Attribution for LLMs via Retrieval-Augmented Validation

CiteGuard: 通过检索增强验证实现LLM的忠实引文归因

Yee Man Choi, Xuehang Guo, Yi R. Fung, Qingyun Wang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出CiteGuard,通过检索增强验证提升LLM引文准确性,实现比基线模型高10个百分点的性能,达到68.1%的准确率,接近人类水平。

Comments Project Page: https://kathcym.github.io/CiteGuard_Page/. ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10125 2026-04-14 cs.CV 50%

PhyMix: Towards Physically Consistent Single-Image 3D Indoor Scene Generation with Implicit--Explicit Optimization

PhyMix:迈向物理一致的单图像3D室内场景生成的隐式-显式优化

Dongli Wu, Jingyu Hu, Ka-Hei Hui, Xiaobao Wei, Chengwen Luo, Jianqiang Li, Zhengzhe Liu

机构 * Lingnan University(岭南大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Shenzhen University(深圳大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出PhyMix,通过隐式-显式优化框架,结合物理评估器提升生成场景的物理一致性,实现视觉真实且物理合理的3D室内场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09917 2026-04-14 cs.MA cs.GT 50%

Toward Explanatory Equilibrium: Verifiable Reasoning as a Coordination Mechanism under Asymmetric Information

迈向解释均衡:在信息不对称下可验证推理作为协调机制

Feliks Bańka, Jarosław A. Chudziak

专题命中 安全评测 :safety(abstract)

AI总结 本文提出解释均衡概念,研究在信息不对称环境下,通过结构化推理 artifacts 和有限验证机制实现安全协调,证明结构化推理能有效降低不良批准率。

Comments 18 pages, 4 figures. Accepted for presentation at EXTRAAMAS 2026 (AAMAS 2026 workshop); to appear in post-proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18373 2026-04-14 cs.CV 50%

MASS: Motion-Aware Spatial-Temporal Grounding for Physics Reasoning and Comprehension in Vision-Language Models

MASS:面向视觉-语言模型中物理推理与理解的运动感知空间-时间 grounding

Xiyang Wu, Zongxia Li, Jihui Jin, Guangyao Shi, Gouthaman KV, Vishnu Raj, Nilotpal Sinha, Jingxi Chen, Fan Du, Dinesh Manocha

机构 * University of Maryland(马里兰大学) Dolby Laboratories(杜比实验室) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MASS通过引入空间-时间信号提升视觉-语言模型对物理现象的理解能力,提出MASS-Bench基准测试集并验证模型在物理推理中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09368 2026-04-13 cs.MM cs.CV 50%

Through Their Eyes: Fixation-aligned Tuning for Personalized User Emulation

通过他们的眼睛:基于注视点的个性化用户模拟调谐

Lingfeng Huang, Huizhong Guo, Tianjun Wei, Yingpeng Du, Zhu Sun

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FixATE方法,通过将视觉语言模型的视觉注意力与用户特定的注视模式对齐,提升推荐系统模拟的准确性,实验表明这种对齐能有效提高点击预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09235 2026-04-13 cs.CR 50%

Unreal Thinking: Chain-of-Thought Hijacking via Two-stage Backdoor

Unreal Thinking: 通过两阶段后门实现链式思维劫持

Wenhan Chang, Tianqing Zhu, Ping Xiong, Faqian Guan, Wanlei Zhou

专题命中 安全评测 :safety(abstract)

AI总结 本文提出MRTS和TSBH方法,解决LLM链式思维劫持中的数据稀缺和稳定性问题,通过生成对齐的CoT实现可控的恶意行为诱导,并提供安全推理数据集和缓解方法。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09056 2026-04-13 cs.CR cs.CE 50%

Conversations Risk Detection LLMs in Financial Agents via Multi-Stage Generative Rollout

通过多阶段生成 rollout 检测金融代理中的对话风险

Xiaotong Jiang, Jun Wu

专题命中 安全评测 :safety(abstract)

AI总结 本文提出FinSec框架,通过多阶段生成rollout方法检测金融代理中的对话风险,提升高风险对话检测的鲁棒性,实验显示其在F1分数、ASR和AUPRC等方面均优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08799 2026-04-13 cs.GR cs.CV 50%

MeshOn: Intersection-Free Mesh-to-Mesh Composition

MeshOn:无交集的网格到网格组合

Hyunwoo Kim, Itai Lang, Hadar Averbuch-Elor, Silvia Sellán, Rana Hanocka

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Cornell University(康奈尔大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MeshOn通过多步骤优化框架实现两个输入网格的物理和语义真实组合,利用结构对齐方案和几何损失防止表面交叠,适用于多种材质配件的精准拟合。

Comments Project page: \hyperlink{https://threedle.github.io/MeshOn/}{this https URL}

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08778 2026-04-13 math.HO 50%

Open Preparation, Human Explanation, and Instructor Synthesis: A Human-Scale Methodology for AI-Rich Higher Education

开放准备、人类解释与教师合成:面向AI丰富高等教育的人尺度方法论

Siniša Miličić

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种人尺度方法论,通过信息学案例,强调将证据信任从工具禁用转向实时解释与观察,构建了操作周期、现实框架及口头证据模型,回应AI与主动学习的教育需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08031 2026-04-10 cs.RO cs.CV 50%

Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆

Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo

机构 * Jilin University(吉林大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Tongji University(同济大学) NKIARI Nankai University(南开大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06762 2026-04-09 cs.CR 50%

ARuleCon: Agentic Security Rule Conversion

ARuleCon:代理安全规则转换

Ming Xu, Hongtai Wang, Yanpei Guo, Zhengmin Yu, Weili Han, Hoon Wei Lim, Jin Song Dong, Jiaheng Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 ARuleCon通过自动化规则转换框架,解决跨平台安全规则复用难题,提升SIEM规则转换的准确性和效率,平均优于基线LLM模型15%。

Comments This paper has been accepted for publication at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06347 2026-04-09 cs.CV 50%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 50%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 50%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06024 2026-04-08 eess.SY cs.SY 50%

Incremental Risk Assessment for Cascading Failures in Large-Scale Multi-Agent Systems

大规模多智能体系统中递增风险评估用于级联故障

Guangyi Liu, Vivek Pandey, Christoforos Somarakis, Nader Motee

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种框架,用于研究和量化时间延迟共识网络中级联故障的风险,通过平均值在风险评估中使用系统性措施,揭示风险与拉普拉斯谱、通信延迟和噪声统计的依赖关系,并建立根本下界以评估网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05449 2026-04-08 cs.CV 50%

Not All Agents Matter: From Global Attention Dilution to Risk-Prioritized Game Planning

并非所有智能体都重要:从全局注意力稀释到风险优先的游戏规划

Kang Ding, Hongsong Wang, Jie Gui, Lei He

机构 * School of Cyberspace Security, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Vehicle and Mobility School, Tsinghua University(清华大学车辆与运载学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出风险优先游戏规划方法,通过GameAD框架提升自动驾驶轨迹安全性,实验表明其在复杂环境中表现更优。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05180 2026-04-08 cs.CV 50%

MIRAGE: Benchmarking and Aligning Multi-Instance Image Editing

MIRAGE:多实例图像编辑的基准测试与对齐

Ziqian Liu, Stephan Alaniz

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris, France(法国巴黎理工学院电信巴黎分校LTCI实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MIRAGE框架,通过多分支并行去噪策略实现精确多实例编辑,解决现有方法在多实例和复合指令下的过度编辑和空间错位问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 50%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏