arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9380 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9380 篇

2608.20218 2026-08-21 cs.AI 新提交 57%

Electronic Navigational Chart Change Classification

电子航海图变化分类

Jacob Arndt, Abhishek Potnis, Alexandre Sorokine

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对电子航海图(ENC)变化分类的人工审核效率低、一致性差的问题,提出结合空间上下文编码器与ENC属性编码器的编码方案,用调优梯度提升树在1308张海图对数据集上取得90%、94%的准确率,提升了海事安全相关的ENC维护效率。

Comments Accepted at 34th ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19802 2026-08-21 cs.CL 新提交 57%

Stopping and Routing LLM Judge Panels

停止与路由大语言模型(LLM)评审小组

Bin Zhu, Yi Xie, Yanghui Rao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Sun Yat-sen University(中山大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究将LLM评审小组设计建模为角色条件分配问题,提出策略优化评审调用,经多类审计对比,生成可复用的评审调用计划。

Comments 21 pages, 2 figures, 20 tables. Accepted at WISE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19710 2026-08-21 cs.CV cs.AI 新提交 57%

Robust Cross-Modal Foundation Model Perception for Underwater Robots under Degraded Visual Conditions

退化视觉条件下水下机器人的鲁棒跨模态基础模型感知

Mohammad Arif Ul Alam

机构 * College of Science and Technology, North Carolina A & T State University(北卡罗来纳农工州立大学科学技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究针对水下机器人视觉退化问题,提出感知退化的视觉-声纳门控融合方法,在极端退化下使平衡准确率较 DINOv2 基线提升 33.5%,实现鲁棒跨模态感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19299 2026-08-21 cs.AI 新提交 57%

Air Traffic Control Using Large Language Models: Prompt Engineering, Architecture, and Evaluation

使用大语言模型的空中交通管制:提示工程、架构与评估

Mahyar Ghazanfari, Matthias Casanova, Jordan Kam, Alex Zongo, Peng Wei, Torsten Darrell, Alexandre Bayen

机构 * The George Washington University(乔治华盛顿大学) California Institute of Technology(加州理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对ATC仍以人工为主的问题,设计5种提示结构并在9种LLMs上实验,发现简洁提示表现最佳,注入正确历史可修复脚本严格提示的错误,明确了LLM辅助ATC的路径与局限。

Comments 39 pages, 12 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19297 2026-08-21 cs.LG 新提交 57%

Holtercare-Bench: A Multimodal Benchmark for Evaluating Long-Term Dynamic ECG Analysis

Holtercare-Bench:用于评估长期动态心电图分析的多模态基准

Yihan Xie, Hanwen Cui, Runze Ye, Juekai Lin, Haoyang Wang, Jinhao Mao, Bo Zhang, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Lei Zhang

机构 * Zhejiang University(浙江大学) Beijing Institute of Technology(北京理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 该研究针对现有多模态大语言模型在长期动态心电图分析中的不足,构建了含22980个问答对的Holtercare-23K数据集及Holtercare-Bench基准,评估发现零样本模型处理超长病理序列性能差,微调后提升显著,为长期医疗多模态大语言模型提供基础基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18900 2026-08-21 cs.AI 版本更新 57%

TestifAI: Tomography-Based Testing for Deep Learning Systems

TestifAI:基于层析成像的深度学习系统测试方法

Arooj Arif, Tobias Hartung, Elena Botoeva, Alexandros Koliousis

机构 * Northeastern University London(伦敦东北大学) University of Kent(肯特大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 TestifAI是一种深度学习测试框架,通过部分模型层析成像从低阶扰动观测预测高阶扰动测试结果,可高效准确估计多扰动下的模型鲁棒性,减少60-80%的推理量且总误差低于7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17417 2026-08-21 cs.LG physics.chem-ph physics.comp-ph quant-ph 版本更新 57%

Grounded verification of chemical and materials reasoning: detection is the bottleneck

化学与材料推理的有根据验证:检测是瓶颈

Can Polat, Mustafa Kurban, Erchin Serpedin, Hasan Kurban

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 研究针对大语言模型在化学推理中虚构对象的问题,提出分层验证器,通过与数据库核对及门控校正减少公式错误,检索次数大幅减少,修复成功率高,但检测召回率是瓶颈,基于事实验证可提高答案质量,长尾错误处提升明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15910 2026-08-21 cs.CL 版本更新 57%

Calibrated Triage, Not Autonomy: Confidence Estimation for Medical Vision-Language Models

校准的分诊,而非自主:医学视觉-语言模型的置信度估计

Reza Khanmohammadi, Kundan Thind, Mohammad M. Ghassemi

机构 * Michigan State University(密歇根州立大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 针对医学视觉-语言模型在回答时可能忽略图像而依赖语言先验的问题,提出使用置信度估计进行校准分诊,通过评估七种置信度估计器,发现高置信度区域是区分可用估计器的关键,最佳探针可将错误率从41-45%降至1-4%,但无估计器在所有领域和模型中一致最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01192 2026-08-21 cs.HC cs.CY cs.RO 版本更新 57%

Design strategies for empathetic AI robots for older adults

面向老年人的共情AI机器人的设计策略

Isabel Pedersen, Andrea Slane

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文针对老年人居家养老需求,运用人文学科与修辞理论,提出共情照护词汇表作为设计社交辅助机器人(SARs)的路径,弥补了现有人机设计忽视共情作为理论化设计路径的空白。

Comments 12 pages, 4 figures, edited and updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18398 2026-08-20 cs.HC cs.AI 新提交 57%

LEDGER: Claim-to-Evidence Trace Graphs for Auditing LLM Agents

LEDGER:用于审计大语言模型智能体的从主张到证据的追踪图

Daehong Kim, Haichao Miao, Shusen Liu

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对LLM智能体输出审计瓶颈,提出LEDGER系统构建分层追踪图,通过分组节点、添加语义边等实现以证据为中心的审计,揭示工作流决策等关键信息。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17574 2026-08-20 cs.AI cs.SY eess.SY 交叉投稿 57%

Quantifying Risk Under Evolving Uncertainty: Belief-Dependent Robustness for Safe Sequential Decision Making

演化不确定性下的风险量化:面向安全序贯决策的信念依赖鲁棒性

Deep Kumar Ganguly, Jan Kretinsky

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出RATTL算法,将智能体谨慎程度与认知不确定性绑定,证明其规划问题适定且满足安全三明治性质,可保障LLM等智能体在不确定性下的运行时安全。

Comments Accepted for presentation at the IJCAI-ECAI 2026 RobustifAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00020 2026-08-20 cs.AR cs.AI 版本更新 57%

Large Language Model for Verilog Code Generation: Literature Review and the Road Ahead

用于Verilog代码生成的大型语言模型:文献综述与未来方向

Guang Yang, Wei Zheng, Xiang Chen, Dong Liang, Peng Hu, Yukui Yang, Shaohang Peng, Zhenghan Li, Jiahui Feng, Xiao Wei, Kexin Sun, Deyuan Ma, Haotian Cheng, Yiheng Shen, Xing Hu, Terry Yue Zhuo, David Lo

机构 * Zhejiang University \& Northwestern Polytechnical University China Northwestern Polytechnical University China Nantong University China Zhejiang University China Monash University Australia Singapore Management University Singapore Zhejiang University \& Northwestern Polytechnical University Northwestern Polytechnical University Nantong University Zhejiang University Monash University Singapore Management University

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文综述了LLMs在Verilog代码生成中的应用,分析了现有方法的有效性、局限性及未来研究方向。

Comments Accept in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13068 2026-08-20 cs.CV cs.LG 版本更新 57%

Eyes on the Image: Gaze Supervised Multimodal Learning for Chest X-ray Diagnosis and Report Generation

聚焦图像:用于胸部X光诊断与报告生成的注视监督多模态学习

Tanjim Islam Riju, Shuchismita Anwar, Saman Sarker Joy, Farig Sadeque, Swakkhar Shatabda

机构 * Department of Computer Science and Engineering, Brac University(计算机科学与工程系,布拉克大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本研究基于MIMIC-Eye数据集构建两阶段多模态框架,引入注视监督提升胸部X光诊断准确率与报告空间可解释性,为该领域提供了可复现的新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17994 2026-08-19 cs.CL 新提交 57%

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

判断、检索或弃权:带有可证明风险保证的不确定性引导大语言模型(LLM)判断

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究针对无参考LLM评判的可靠性问题,提出带可证明风险保证的不确定性引导双模式风险控制框架,在维持目标错误率的同时提升了判决覆盖率。

Comments Accepted at Conference on Language Modelling 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17620 2026-08-19 cs.LG 新提交 57%

OOD Detection for EEG-based Machine Learning in High-Risk Environments

高风险环境下基于脑电图(EEG)的机器学习的分布外(OOD)检测

Philipp Bomatter, Henry Gouk

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 针对脑电图机器学习在高风险环境中易受分布偏移影响的问题,引入EEG OOD检测基准,评估相关方法并结合互补方法构建稳健安全网。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17319 2026-08-19 cs.AI 新提交 57%

Wuying-Browser-Agent: Real-World Centric Fundamental Long-Horizon Browser Agents

Wuying-Browser-Agent:以真实场景为中心的基础长时程浏览器智能体

AIMAE Team, Tianxiang Chen, Yan Cheng, Zhangye Han, Xiaowei Li, Chang Liu, Cheng Liu, Zhongqiang Ma, Long Peng, Xiaobing Tu, Yinggui Wang, Hongliang Wei, Chen Wu, Daiping Xin, Kunyu Zhou, Pengyang Zhou, Peiyuan Chen, Ziyuan Chen, Yutao Deng, Chunyu Dong, Xiangyu Fu, Yicheng Feng, Ruian He, Haochen Li, Miancan Liu, Zhengqin Liu, Wei Peng, Jinkui Ren, Haoyu Tan, Dong Xiao, Rongkun Xue, Shujian Yang, Xianhang Ye, Ziqi Yuan, Ziyang Yu, Linghan Zhang, Xiantao Zhang, Xuanpu Zhao, Yinan Zhao, Zhenghui Zhao, Bin Zhu, Likai Zou

机构 * Alibaba Cloud(阿里云) End-User Intelligent Computing BU(终端用户智能计算业务部) AI Model Application & Engineering Team(AI模型应用与工程团队)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Wuying-Browser-Agent统一框架,通过多层面技术对齐解决浏览器智能体实际部署问题,在多项基准取得最优成绩,且具备通用智能体迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17270 2026-08-19 cs.AI 新提交 57%

Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking

大型语言模型(LLMs)能否判断优质假说?基于logit的能量评分在科学假说排序上优于提示式LLM评判器

Swati Rajwal, Sanjay Das, Tirthankar Ghosal

机构 * Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究针对科学假说评估难题,提出基于logit的能量评分方法,在12学科1323篇论文的基准测试中,该方法的Hit@1显著优于提示式LLM评判器,展现出模型内在置信度的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17070 2026-08-19 cs.LG cs.CR cs.LO 新提交 57%

Certified but Private: Scalable Zero-Knowledge Proofs for Neural Network Guarantees

可验证但隐私性强:用于神经网络保障的可扩展零知识证明

Youwei Zhong, Ben Merbaum, Timos Antonopoulos, Ning Luo, Charalampos Papamanthou, Katerina Sotiraki, Ruzica Piskac

机构 * Yale University(耶鲁大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出基于零知识证明的PANDA系统,可在不泄露神经网络私有参数的情况下高效证明其鲁棒性与公平性,支持参数超290万的网络,规模远超同类方案且开销更低。

Comments 23 pages, 2 figures (11 pages for the main text), for code of implementation and evaluation, see https://github.com/youweizhong/PANDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17044 2026-08-19 cs.CV cs.AI 新提交 57%

The 10th AI City Challenge

第10届AI City挑战赛

Zheng Tang, Shuo Wang, David C. Anastasiu, Ming-Ching Chang, Anuj Sharma, Quan Kong, Munkhjargal Gochoo, Jun-Wei Hsieh, Tomasz Kornuta, Zhedong Zheng, Renran Tian, Judah Goldfeder, Fulgencio Navarro, Yuxing Wang, Yizhou Wang, Sameer Satish Pusegaonkar, Anqi Li, Nalin Dadhich, Ridham Kachhadiya, Dhanishtha Patil, Haoquan Liang, Jiajun Li, Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Shuyu Yang, Ashutosh Kumar, Rong Wang, Rafael Martin Nieto, Peter Christiansen, Ahmed Abduljawad, Mohanrasu Shanmugam, Nadeem Shaik, Sujit Biswas, Xunlei Wu, Vidya Murali, Rama Chellappa

机构 * Santa Clara University(圣克拉拉大学) University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Iowa State University(爱荷华州立大学) Woven by Toyota(丰田编织公司) United Arab Emirates University(阿拉伯联合酋长国大学) National Yang Ming Chiao Tung University(国立阳明交通大学) University of Macau(澳门大学) North Carolina State University(北卡罗来纳州立大学) Columbia University(哥伦比亚大学) Milestone Systems(里程碑系统公司) Xi’an Jiaotong University(西安交通大学) Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文总结了与ECCV 2026同期举办的第10届AI City挑战赛的设置、数据集、评估结果等,该赛事规模扩大,设多类赛道,成功系统结合基础模型与多种技术。

Comments Summary of the 10th AI City Challenge Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15790 2026-08-19 cs.LG 版本更新 57%

CrevasseSeg: A Label-Efficient UAV Crevasse Segmentation Framework

CrevasseSeg:一种标签高效的无人机冰裂缝分割框架

Steven Wallace, William D. Harcourt, Richard Hann, Aiden Durrant, Somayajulu Sripada, Georgios Leontidis

机构 * School of Natural and Computing Sciences, University of Aberdeen(阿伯丁大学自然与计算科学学院) Interdisciplinary Institute, University of Aberdeen(阿伯丁大学跨学科研究所) School of Geosciences, University of Aberdeen(阿伯丁大学地球科学学院) Department of Engineering Cybernetics, Norwegian University of Science and Technology(挪威科技大学工程控制论系) School of Computing Sciences, University of East Anglia(东英吉利大学计算科学学院) Department of Physics and Technology, UiT The Arctic University of Norway(北极挪威大学物理与技术系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 CrevasseSeg框架针对无人机冰裂缝分割,采用多种自监督目标与架构,发现DINOv3特征在不同读出方式下表现反转,其优化 pipeline 性能优于基线,支持遥感标签高效分割研究。

Comments 13 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02876 2026-08-19 cs.CL 版本更新 57%

Eval4Sim: An Evaluation Framework for Persona Simulation

Eval4Sim: 一种用于人设模拟的评估框架

Eliseo Bao, Anxo Perez, Javier Parapar, Xi Wang

机构 * University of Sheffield(谢菲尔德大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 Eval4Sim提出了一种评估框架,用于衡量模拟对话与人类对话模式的契合度,通过三个互补维度评估人设的忠实性、一致性和自然性。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16813 2026-08-18 cs.AI cs.DB 新提交 57%

Quipu: A Governed Bitemporal Knowledge Graph Store

Quipu:一种受管控的双时态知识图存储系统

Steve Brown

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。

Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16775 2026-08-18 cs.CR cs.AI 新提交 57%

Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis

拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16725 2026-08-18 cs.CV cs.AI 新提交 57%

Unsupervised Anomaly Detection for Image Dataset Quality Assurance in Multi-Center Breast MRI

面向多中心乳腺MRI图像数据集质量保证的无监督异常检测

Chiara Tappermann, Steffen Renisch, Lars Ole Schwen, Hans Meine, Horst K. Hahn, Eike Petersen

机构 * Cambridge University Hospitals(剑桥大学医院) Mitera Hospital(米特拉医院) Radboud University Medical Center(拉德堡德大学医学中心) University Hospital Aachen(亚琛大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Ribera Hospital(里贝拉医院) Duke Breast Cancer MRI(杜克乳腺癌磁共振成像项目)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对多中心乳腺MRI数据集,构建含17种异常类型的无监督异常检测基准,评估四种方法,发现带位置编码的投影法性能最优,为医疗AI的可扩展无监督质量保证提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 57%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16411 2026-08-18 cs.SE cs.AI 新提交 57%

Towards Risk-free AI Agent Deployment

迈向无风险的AI智能体部署

Yintong Huo, Rangeet Pan, Abhik Roychoudhury

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 57%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 57%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 57%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16155 2026-08-18 cs.LG cs.CE cs.GT 新提交 57%

REFLEX: Reflexive Equilibrium Fixed-point Learning for Endogenous eXchanges

REFLEX:用于内生交易的自反均衡不动点学习

Vignesh Nagarajan, Shriraghav Ashok

机构 * Texas A&M University(德克萨斯农工大学) University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 REFLEX是一个用于场外公司债券市场报价模型的框架,通过交易商行为的可测量特征构建稳定性裕度,可预测再训练的收敛性,在模拟和市场数据中验证了其有效性,能将抽象收敛定理转化为市场安全裕度。

Comments 8 pages, 6 figures, 5 tables, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏