arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2607.24542 2026-07-28 cs.CL cs.DL cs.IR 新提交 57%

From transcription to semantic corpus analysis: unsupervised learning of sentence representations for ancient languages

从转录到语义语料库分析:古代语言句子表示的无监督学习

Th{é}otime de la Selle

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究古代语言句子表示的无监督学习,采用TSDAE和CSE策略,将专门语言模型转换为特定语料库句子编码器,在教父文献圣经重用案例中表现出色,优于多种基线,且可跨作品作者迁移,相关工具可供非专业人员使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23975 2026-07-28 cs.AI q-bio.QM 新提交 57%

Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks

柏拉图生物:通过时间再发现和结构基准进行验证优先的生物新奇性筛选

Stefan G. Creadore

机构 * Praxa Labs(普拉克斯实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究开发柏拉图生物,扩展开放架构并结合多种功能,修复评估缺陷。通过Python套件等验证其有效性,评估两个用例,如历史再发现任务及蛋白质结构比较,提供可重复软件契约和筛选基准,为生物研究提供支持。

Comments 16 pages, 6 figures, 3 tables. Companion code and data: https://github.com/Eldergenix/Plato-Scientific-Research-Autonomous-Agent. This fork-specific validation study cites, but does not duplicate, arXiv:2510.26887

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23055 2026-07-28 cs.AI 新提交 57%

SymStep: Symbolic Step Verification for Logical Reasoning

SymStep:用于逻辑推理的符号步骤验证

Aida Usmanova, Rui Gao, Dilshod Azizov, Ricardo Usbeck, Zangir Iklassov

机构 * Leuphana University of Lüneburg(吕讷堡莱普芬纳大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对约束密集型逻辑推理任务中思维链提示的不足,提出SymStep方法,通过语言模型分步声明、约束传播器检查一致性等进行推理,在多个逻辑推理任务上表现优异,最小剩余值指导和一致性检查起关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 57%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22563 2026-07-28 cs.AI 新提交 57%

Synthetic Scenario Generation for Evaluation of Industry 4.0 Agents

用于工业4.0智能体评估的合成场景生成

Sagar Chethan Kumar, Rohith Kanathur, Dhaval Patel, Kaoutar El Maghraoui

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对工业智能体基准测试场景有限问题,扩展AssetOpsBench并引入ScenarioGeneratorAgent管道,通过多种优化方式提高可扩展性,实现智能电网变压器场景生成的高效优化,有效扩展工业智能体基准测试且保证场景质量。

Comments 19 pages, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24663 2026-07-28 physics.acc-ph cs.AI cs.IR 新提交 57%

A corrective agentic hybrid RAG and an operations-grounded evaluation for a scientific facility

一种用于科学设施的校正智能混合RAG及基于操作的评估

Rajat Sainju, Dariusz Jarosz, Hairong Shang, Michael Prince, Ryan M. Aydelott, Mathew J. Cherukara, Yine Sun, Michael D. Borland

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对科学设施操作知识难覆盖问题,提出APS - RAG平台,融合多种检索通道并添加校正智能循环,构建APS - Bench数据集评估。结果显示该平台提升关键信息召回率,交叉编码器重排器作用显著,还发布相关资源,为设施操作提供可信AI辅助工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10526 2026-07-28 cs.AI 版本更新 57%

Agents Don't Just Agree, They Remember: Benchmarking Persistent Sycophancy in Stateful Personal Agents

智能体不仅会认同,还会记忆:对有状态个人智能体中持续谄媚行为的基准测试

Xutao Mao, Liangjie Zhao, Leyao Wang, Rui Qian, Qiang Huang, Wentao Wang, Bo Han, Xiang Zheng, Cong Wang

机构 * City University of Hong Kong(香港城市大学) ByteDance(字节跳动) Yale University(耶鲁大学) Fudan University(复旦大学) Hong Kong Baptist University(香港浸会大学) Dalian University of Technology(大连理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究有状态个人智能体中的持续谄媚行为,引入PASB基准测试,评估真实智能体。通过特定方法隔离写入过程,发现提交边界是关键转折点,提交声明有三种模式,表明智能体谄媚行为是状态写入治理问题,PASB确定相关写入时控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 57%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17052 2026-07-28 cs.CL 版本更新 57%

PReSS: An Automated Black-Box Framework for Evaluating Political Stance Stability in LLMs

PReSS:通过论证压力评估LLM中政治立场稳定性的黑盒框架

Shariar Kabir, Kevin Esterling, Yue Dong

机构 * Bangladesh University of Engineering and Technology(孟加拉工程科技大学) University of California Riverside(加州大学河滨分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 PReSS通过评估LLM在不同话题下的立场稳定性,揭示了模型政治立场的动态变化,为理解和干预政治敏感行为提供新视角。

Comments 13 pages, 8 figures

Journal ref In Proceedings of the 3rd Workshop on Natural Language Processing for Political Sciences (PoliticalNLP 2026) @ LREC 2026 (pp. 234-247)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07889 2026-07-28 cs.CL 版本更新 57%

BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science

BioProBench: 一个全面的数据集和生物协议理解与推理基准

Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 BioProBench通过构建大规模数据集和基准,提升生物协议理解与推理的LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22264 2026-07-27 cs.LG 新提交 57%

Autoregressive EHR Foundation Models with Multimodal Inputs

具有多模态输入的自回归电子健康记录基础模型

Yuxuan Liu, Joshua Placidi, Jinpei Han, Alfred John Balston, Marek Rei, A. Aldo Faisal

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 研究在自回归电子健康记录基础模型中纳入多模态的方法,通过特定模态潜在压缩和门控交叉注意力框架,研究压缩单模态序列及预训练编码器选择对性能的影响,实验表明精心设计架构及临床评估的必要性。

Comments 5 pages excluding references and supplements, 2 figures and 2 tables, Proceedings of the Workshop on Structured Data for Health at the 43rd International Conference on Machine Learning, Seoul, South Korea

Journal ref ICML2026 workshop on Structured Data for Health (SD4H)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 57%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07738 2026-07-27 cs.SE cs.AI cs.CR cs.PL 版本更新 57%

REFORGE: A Method for Benchmarking LLMs' Reverse Engineering Capabilities in Decompiled Binary Function Naming

REFORGE:一种在反编译二进制函数命名中对大语言模型逆向工程能力进行基准测试的方法

Nicolas Koller, Andreas U. Schmidt

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对大语言模型逆向工程能力评估难的问题,提出Reforge方法,通过特定流程构建函数级真实情况并处理对齐不确定性,经实验验证该方法能揭示优化对模型性能的影响,推动不确定性感知基准测试实践。

Comments 10 pages, 5 figures; accepted for publication to the 23rd International Conference on Applied Computing 2026, Lisbon October 24-26,2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22321 2026-07-27 cs.CR cs.AI cs.SE 版本更新 57%

ASEval: Automated Trajectory-Level Security Testing for Autonomous Agents

对时间、空间和语义规避的自主代理进行基准测试

Jianan Ma, Xiaohu Du, Ruixiao Lin, Yaoxiang Bian, Jialuo Chen, Yunhao Feng, Xiaofang Yang, Shiwen Cui, Changhua Meng, Xinhao Deng, Jingyi Wang, Zhen Wang

机构 * Tsinghua University(清华大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种针对基于大语言模型(LLM)的代理系统的多维规避框架,通过引入时间、空间和语义三种隐蔽攻击向量,系统地量化了这些威胁,并展示了其在实际威胁场景中的效果,揭示了现有自主代理系统在架构层面的系统性漏洞。

Comments 18 pages, 12 figures, 8 tables. Code and data available at https://github.com/antgroup/Agent3Sigma-Stage

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21549 2026-07-24 cs.CY cs.SI 新提交 57%

Seeking Help in the Digital Age: A Cross-Platform Analysis of Online Support Systems for Technology-Facilitated Abuse Victims

数字时代寻求帮助:对技术辅助虐待受害者在线支持系统的跨平台分析

Nowshin Tabassum, Solomon G. Dandekar, Morgan PettyJohn, Tim Ryan, Minjaal Raval, Rachel Voth Schrag, Mohit Singhal, Shirin Nilizadeh

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 研究技术辅助虐待(TFA)受害者在线支持系统,通过构建数据集在网络搜索、论坛、人工智能系统三渠道模拟查询,用统一框架评估回应,发现各平台支持质量有别,揭示数字支持弱点,强调以安全为中心设计等的必要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21384 2026-07-24 cs.AI 新提交 57%

Multimodal Pretraining for Generalizable EEG Representation Learning

用于可泛化脑电信号表征学习的多模态预训练

Targol Bakhtiarvand, Jugal Kalita, Adham Atyabi

机构 * University of Colorado Colorado Springs(科罗拉多大学科罗拉多斯普林斯分校)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对癫痫EEG模型应用局限问题,开发多模态EEG基础模型,结合多种编码器,通过创新预训练技术创建癫痫相关表征。在多个数据集和评估设置下实验,该模型实现强大癫痫检测与适应新场景能力,支持可解释癫痫定位,性能达当前最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21156 2026-07-24 cs.AI cs.MA 新提交 57%

SafeStep: AI-powered Travel Assistance for Elderly People with Frailty or Dementia

SafeStep:为体弱或痴呆老年人提供的人工智能旅行辅助

Elderly People with Frailty or Dementia Azul Debenedetti, David Gamez, Franco Such, Nik Kairinos

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对体弱或痴呆老人出行难题,SafeStep利用旅行图表示,结合大语言模型与Anticip8行为预测引擎,生成个性化失败场景并提出干预措施。经实验和实地研究评估,结合两者的方法性能可靠,虽界面可用性待改进,但能提升旅行信心与安全感,还可拓展应用于其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20925 2026-07-24 cs.AI 新提交 57%

Representing Entity Importance in AI Knowledge Systems: A Dual-Signal Framework of Audience Evaluation and Structural Authority

在人工智能知识系统中表示实体重要性:受众评估与结构权威的双信号框架

Shen Xu

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究人工智能知识系统中实体重要性表示,提出受众评估与结构权威双信号框架,经电影实体实验验证,表明两维度是不可冗余信号,贡献是最小知识表示框架及维度必要性实证测试,支持任务感知AI知识系统。

Comments 12 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20759 2026-07-24 cs.CR cs.AI cs.SE 新提交 57%

IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests

IssueTrojanBench:针对恶意问题请求对人工智能编码代理进行基准测试

Ankur Singh, Jinqiu Yang, Tse-Hsun Chen

机构 * Concordia University(康科德大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对恶意问题请求对人工智能编码代理进行基准测试,通过构建包含多种攻击类别和交付向量的新型基准IssueTrojanBench,发现现代编码代理存在关键漏洞,强调需更强安全机制保护。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20505 2026-07-24 cs.RO cs.LG 新提交 57%

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

HERMES:用于信号交叉口交通冲突预测的异构边缘关系多头嵌入式SSM注意力模型

Md Monzurul Islam, Subasish Das

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究针对交通冲突预测,提出HERMES异构边缘关系图神经网络,利用特定关系注意力等方法,在多指标上表现优异,优于基线模型,联合训练提升目标站点性能,为信号交叉口路边安全监测提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20127 2026-07-23 cs.CL 新提交 57%

Back to Back with a Copy: A Computational Analysis of AI-Generated Visual Contemporary Art Pastiches

与仿作并肩:人工智能生成的视觉当代艺术模仿作品的计算分析

Anca Dinu, Andreiana Mihail, Andra-Maria Florescu, Claudiu Creanga, Liviu Dinu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文研究更新的生成模型模仿当代艺术作品的能力及不同语言模型中风格评估的多维度一致性。利用五个计算机视觉模型,通过余弦距离捕捉多种特征,对比新旧模型。结果显示新模型语义对齐改进、多样性增加,但浅层特征表现稍弱,还通过艺术家反馈进行情境化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19899 2026-07-23 cs.MA cs.LG 新提交 57%

Harnessing Disagreement: Detecting Correlated Agreement Blindness in Multi-Agent Triage

利用分歧:检测多智能体分诊中的相关一致性盲点

Shay Seiya McDonnell, Avantika Singh, Quoc-Viet Pham, Vratislav Havlik, Gregory M. P. O'Hare

机构 * School of Computer Science \& Statistics, Trinity College Dublin, College Green, Dublin 2, Ireland ADAPT Centre, Trinity College Dublin, College Green, Dublin 2, Ireland CKDelta, 28/29 Sir John Rogerson's Quay, Dublin 2, Ireland

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究多智能体分诊中分歧引发升级导致的相关一致性盲点问题,提出结合随机森林、k近邻智能体及校准元模型的ARAT系统。通过实验表明该系统能降低预测不足,跨数据集验证显示多样化产生有效分歧才提升安全,揭示相关故障被忽视的风险。

Comments 14 pages, 2 figures, 3 tables. Accepted at PAAMS 2026; this is the author's pre-review submitted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19834 2026-07-23 cs.CL 新提交 57%

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

D2VBench:在日常场景中使用价值困境对大语言模型进行基准测试

Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) The International Joint Institute of Tianjin University(天津大学国际联合研究院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对大语言模型输出价值含义评估问题,提出D2VBench基准,通过多阶段协作构建含10000个日常困境实例的数据集,采用混合评估范式,对八个主流模型全面评估,结果显示该基准可靠性和鲁棒性高,能反映模型价值一致性。

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 57%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08625 2026-07-23 stat.ML cs.LG math.ST stat.TH 版本更新 57%

Spectral-transport stability and benign overfitting for minimum norm interpolation

谱-传输稳定性与插值学习中的良性过拟合

Gustav Olaf Yunus Laitinen-Fredriksson Lundström-Imanov

机构 * Linköping University(林雪平大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了插值学习中高过参数化模型为何能实现零经验风险并保持预测准确性,提出谱-传输稳定性框架,结合数据分布谱几何、学习规则敏感性和噪声对齐结构,定义了尺度依赖的Fredriksson指数,推导了有限样本风险界和良性过拟合判据,揭示了隐式正则化机制。

Comments 13 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07466 2026-07-23 cs.CR cs.LG 版本更新 57%

Trusting What You Cannot See: Auditable Fine-Tuning and Inference for Proprietary AI

信任你无法看到的东西:可审计的微调与推理用于专有AI

Heng Jin, Chaoyu Zhang, Hexuan Yu, Shanghao Shi, Ning Zhang, Y. Thomas Hou, Wenjing Lou

机构 * Virginia Tech(弗吉尼亚理工学院) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 AFTUNE通过可审计和可验证的框架,确保云上微调和推理的计算完整性,实现可信模型服务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11072 2026-07-23 cs.CL cs.SD eess.AS 版本更新 57%

Simultaneous Speech-to-Speech Translation Without Aligned Data

无需对齐数据的同时语音到语音翻译

Tom Labiausse, Romain Fabre, Yannick Estève, Alexandre Défossez, Neil Zeghidour

机构 * LIA, University of Avignon, France(LIA,阿维尼翁大学,法国)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Hibiki-Zero无需词级对齐数据,通过句子级对齐和强化学习策略实现高精度的同时语音翻译,支持多种语言并提升翻译质量与效率。

Comments See inference code at: https://github.com/kyutai-labs/hibiki-zero

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 57%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18877 2026-07-22 cs.LG 新提交 57%

Physics-Informed Super-Resolution of Atmospheric Data

大气数据的物理信息超分辨率

Chang Xu, Gencer Sumbul, Hugo Porta, Manon Béchaz, Sebastian Schemm, Devis Tuia

机构 * EPFL(洛桑联邦理工学院) University of Cambridge(剑桥大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 针对全球变暖下大气数据超分辨率问题,提出基于原始方程的PISR方法及NPC度量,通过约束SR模型遵循物理方程,实验表明该方法能提升重建保真度,增强极端事件检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏