arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 81 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 30 篇

2608.28205 2026-08-31 cs.CV 新提交 50%

Cut-ViT: Task-Specific Model Pruning via Gram Anchoring Subspace Consistency

Cut-ViT:基于Gram锚定子空间一致性的任务特定模型剪枝

Jianjian Yin, Liulei Li, Tao Chen, Yi Chen, Yazhou Yao, Wenguan Wang

机构 * Nanjing University of Science and Technology(南京理工大学) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(先进工程机械智能制造国家重点实验室) Zhejiang University(浙江大学) Nanjing Normal University(南京师范大学)

专题命中 安全评测 :alignment(abstract)

AI总结 Cut-ViT是一种基于Gram锚定子空间一致性的任务特定视觉模型剪枝方法,可高效生成高鲁棒性子网络,在6项任务9个数据集上达SOTA性能,耗时与内存开销仅为旧方法的约五分之一和近一半。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27511 2026-08-31 cs.CR 新提交 50%

eBPF-Based Cybersecurity Mechanisms: A Systematic Literature Review

基于eBPF的网络安全机制:系统文献综述

Stamatios Kostopoulos, Panagiotis Tsakonas, Evangelos K. Markakis

专题命中 安全评测 :safety(abstract)

AI总结 该综述采用PRISMA方法分析54项eBPF安全研究,明确其低开销、高准确率的优势,指出存在的挑战与研究缺口,为下一代eBPF安全系统提供基础。

Comments 24 pages, 6 figures, journal, systematic literature review, 8 tables, Accepted for publication in the International Journal of Information Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27487 2026-08-31 cs.SE 新提交 50%

Grounded Checklist Partial Credit for Agent Skill Trajectories

智能体技能轨迹的基于接地检查表的部分 credit 评估

Suliu Qin, Lu Yin, Xilu Wang

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对智能体轨迹评估的二元评分缺陷,提出 GCPC 方法,结合人工规则与 LLM 生成检查表,在 SkillsBench 等数据集上验证其评估区分度、与人类评估一致性及跨数据集迁移性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26519 2026-08-31 cs.CE cs.SE 版本更新 50%

Report of the 2026 Workshop on Next-Generation Ecosystems for Scientific Computing: Harnessing Community, Software, and AI for Cross-Disciplinary Team Science

2026年科学计算下一代生态系统研讨会报告:利用社区、软件与AI推进跨学科团队科学

Lois Curfman McInnes, Dorian Arnold, Prasanna Balaprakash, Mike Bernhardt, Franck Cappello, Beth Cerny, Deborah DiazGranados, Anshu Dubey, Nichole Etienne, Roscoe Giles, Diego Gomez-Zara, Denice Ward Hood, Mary Ann Leung, Vanessa Lopez-Marrero, Olivia B. Newton, Irene Qualters, Keita Teranishi, Stefan M. Wild, Gabrielle Allen, Richard Arthur, Alexandra Ballow, Tony Baylis, David E. Bernholdt, Daniel Bielich, Johanna Cohoon, Jeremy Crampton, Charles Ferenbaugh, Stephen M. Fiore, Thomas Herault, Tanzima Islam, Stephen Jacobsohn, Meifeng Lin, Charles Lively, Satoshi Matsuoka, Stasa Milojevic, Daniel Nichols, Chris Oehmen, Santiago Ospina Tabares, Michael E. Papka, Katherine Riley, Damian Rouson, Sudip K. Seal, Brittany Segundo, John Shalf, Andrew Siegel, Valerie Taylor, Jim Willenbring, Lou Woodley

专题命中 安全评测 :trustworthy(abstract)

AI总结 本报告梳理2026年科学计算下一代生态系统研讨会成果,明确四大战略主题及八项社区行动优先事项,为AI时代构建可信可持续的科学计算生态系统指明方向。

Comments 27 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25210 2026-08-31 cs.DB 版本更新 50%

Bolt-on, Verifiable Provenance for LLM-Powered Data Processing

用于大语言模型驱动数据处理的外挂式可验证来源

Yiming Lin, Sepanta Zeighami, Aditya G. Parameswaran

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对LLM黑盒无法提供答案来源及可信度的问题,提出外挂式框架BLIP,可高效生成小尺寸可验证来源,在七个数据集上准确率较最优基线高30%以上且成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12411 2026-08-31 cs.CV 版本更新 50%

DeferredSeg:A Multi-Expert Deferral Framework for Medical Image Segmentation

DeferredSeg: 一种多专家延迟框架用于可信的医学图像分割

Qiuyu Tian, Haoliang Sun, Yunshan Wang, Yinghuan Shi, Yilong Yin

机构 * School of Software, Shandong University(山东大学软件学院) Department of Clinical Laboratory, Shandong Provincial Hospital Affiliated to Shandong First Medical University(山东第一医科大学附属山东省人民医院临床检验科) School of Computer Science and Technology, Nanjing University(南京大学计算机科学与技术学院)

专题命中 安全评测 :trustworthy(abstract)

AI总结 DeferredSeg通过引入延迟感知分割框架,在医学图像分割中实现人机协作,通过动态路由和损失函数提升分割可靠性,优于基线方法。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2608.28228 2026-08-31 cs.AI cs.CY cs.HC 新提交 81%

Generative AI Alignment with Hinduism's Theological Plurality and Sacred Representation

结合印度教神学多元性与神圣表征的生成式AI对齐

Dipto Das, Arpita Kundu, Nusrat Jahan Mim, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Khulna University of Engineering & Technology(库尔纳工程技术大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 该研究以孟加拉国印度教用户的15次半结构化访谈为基础,探讨生成式AI在宗教领域的应用,指出其兼具便捷性与伦理隐患,提出生成式AI的宗教对齐需实现解释性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13574 2026-08-31 cs.AI cs.MA 版本更新 70%

Agentao: A Policy-Governed Runtime Harness for Embeddable Tool-Using LLM Agents

Agentao:面向使用工具的大语言模型智能体的受管控本地优先运行时

Bo Jin, Qiang Jiao, Xin Tong

机构 * The Third Research Institute of the Ministry of Public Security(公安部第三研究所) Bureau of Science and Technology Information Ministry of Public Security of the People’s Republic of China(中华人民共和国公安部科技信息局) School of Information and Cyber Security People’s Public Security University of China(中国人民公安大学信息与网络安全学院)

专题命中 AI治理与伦理 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 针对工具使用型LLM智能体的安全管控需求,提出Agentao运行时,通过分层架构分离动作提案与授权执行,将权限等构建为显式抽象,提升智能体可管控性与可检查性。

Comments The code is publicly available at Github. We are conducting testing and analysis of this framework, and will provide experimental results and examples in future versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13673 2026-08-31 cs.CY 版本更新 57%

Comparing Apples to Oranges: A Taxonomy for Navigating the Global Landscape of AI Regulation

将苹果与橙子对比:AI监管全球格局梳理的分类体系

Sacha Alanoca, Shira Gur-Arieh, Tom Zick, Kevin Klyman

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文针对AI监管全球格局构建分类体系,梳理五大司法管辖区的AI监管规则,提供交互式可视化工具,以减少法律不确定性,助力全球协调的AI治理。

Comments 24 pages, 3 figures, FAccT '25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-31 cs.HC 版本更新 50%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large Language Models

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 11 篇

2608.27971 2026-08-31 cs.CV 新提交 82%

GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

GAAT:面向无人机多模态感知的几何感知对齐Transformer

Jingpu Yang, Debin Tang, Yilin Sun, Fengxian Ji, Jiahua Zhu, Wenrui Ding, Yufeng Wang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Northeastern University(东北大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出面向无人机多模态感知的GAAT模型,引入syncPATC、MG-Sparse-MMA、RA-QCGCL等技术,结合UAVMeta与StateBench数据集,在六个下游任务上实现最优迁移性能,为无人机多模态感知提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26587 2026-08-31 cs.CL 版本更新 79%

Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models

面向临床诊断的大语言模型训练中知识图谱的外科式对齐

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Loyola University(洛约拉大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对临床诊断的LLM训练,通过多维度系统研究引入GID和GD,发现KL正则化下KG判断训练的稀疏更新(外科式对齐)可提升推理质量,需结合优化几何诊断评估KG-LLM整合。

Comments This work has been accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14580 2026-08-31 cs.CL 版本更新 70%

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

说服指数:一个理论指导的说服分析框架

Liancheng Gong, Zhiyang Wang, Yiwei Xu, Julia Mendelsohn

机构 * University of Maryland, College Park(马里兰大学帕克分校) New York University(纽约大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出基于心理学和传播学理论的15维说服指数(PI)及55个子特征实现,在四个数据集上验证其能解释说服相关修辞模式,并提供轻量级预测信号。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27465 2026-08-31 cs.CL cs.AI cs.CY cs.HC 新提交 67%

The Effect of Emotional Context on Large Language Models' Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models

情绪语境对大语言模型支持仓促决策的影响:六种商业模型的情绪脆弱性比较

Cheolho Shin, Yoojin Han, Donghun Shin, Kunho Lee

机构 * Yonsei University(延世大学) Fudan University(复旦大学) St. Johnsbury Academy Jeju(济州圣约翰斯伯里学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究探究情绪语境对LLM支持仓促决策的影响,测试六种商业模型后发现情绪会显著提升模型的支持度,且脆弱性因单个模型而异,仅Claude Opus无显著情绪效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28099 2026-08-31 cs.AI cs.CL 新提交 62%

Speculative Probing: LLM Monitoring at Speculative-Decoding Cost

推测式探测:以推测解码成本实现大语言模型监控

Collin Zhang, Tingwei Zhang, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出将LLM的推测解码模块改造为序列分类器,在可忽略开销下实现高效分类,其小型探测模型在多任务上优于零样本GPT-5.4-mini,部分任务性能匹配专用8B安全分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27763 2026-08-31 cs.LG cs.CL stat.ML 新提交 62%

Fast Weight Attention for Continual Learning

用于持续学习的快速权重注意力

Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang, Yifeng Liu, Huizhuo Yuan, Mengdi Wang, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对持续学习,推导了Falcon系列快速权重更新规则,结合多种计算形式,在语言建模等任务中保持竞争力并提升可变数字加法的长度外推能力,分离了序列模型的时间对齐等关键机制。

Comments Project Page: this https URL (https://github.com/yifanzhang-pro/fast-weight-attention)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28455 2026-08-31 cs.CV cs.AI 新提交 57%

ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

ARC-CT:用于3D胸部CT的解剖路由对比视觉-语言学习

Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol, Şeyda Ertekin

机构 * Harvard Medical School(哈佛医学院) METU-DTX Digital Transformation and Innovation Center(METU-DTX数字转型与创新中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ARC-CT是一种基于LLM提取的报告标签、无需人工标注的区域感知对比视觉-语言框架,通过三个组件解决胸部CT全局对比学习的局限,在18种异常上实现0.86无掩码宏观AUC,性能优于高效基线和大Transformer模型。

Comments Accepted to the Thoracic Image Analysis (TIA) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 57%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27719 2026-08-31 cs.LG q-bio.NC 新提交 57%

Leveraging a Foundation Model for the EEG-Based Diagnosis of Alzheimer's Disease

利用基础模型实现基于脑电图的阿尔茨海默病诊断

Maggie Lin, Chung-Lin Hou, Tzyy-Ping Jung

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) HippoScreen Neurotech Corp.(HippoScreen神经科技公司) Swartz Center for Computational Neuroscience(Swartz计算神经科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本研究针对阿尔茨海默病诊断挑战,采用预训练于2500小时脑电图的大型脑模型LaBraM,结合随机森林分类器,仅用8秒脑电片段即达89.36%的ROC-AUC,优于传统方法,可提取临床相关生物标志物。

Comments 7 pages, 9 figures, 1 table. Accepted and presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-08-31 cs.CV cs.AI 版本更新 57%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Lin Gao, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments Accepted to SIGGRAPH ASIA 2026; Project page: this https URL (https://yuci-gpt.github.io/Beyond-Pixels/)

详情

展开后加载摘要…

URL PDF HTML 收藏