arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-31 至 2026-08-31 共收录 11 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 11 篇

2608.27971 2026-08-31 cs.CV 新提交 82%

GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

GAAT:面向无人机多模态感知的几何感知对齐Transformer

Jingpu Yang, Debin Tang, Yilin Sun, Fengxian Ji, Jiahua Zhu, Wenrui Ding, Yufeng Wang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Northeastern University(东北大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文提出面向无人机多模态感知的GAAT模型,引入syncPATC、MG-Sparse-MMA、RA-QCGCL等技术,结合UAVMeta与StateBench数据集,在六个下游任务上实现最优迁移性能,为无人机多模态感知提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26587 2026-08-31 cs.CL 版本更新 79%

Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models

面向临床诊断的大语言模型训练中知识图谱的外科式对齐

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Loyola University(洛约拉大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对临床诊断的LLM训练,通过多维度系统研究引入GID和GD,发现KL正则化下KG判断训练的稀疏更新(外科式对齐)可提升推理质量,需结合优化几何诊断评估KG-LLM整合。

Comments This work has been accepted to EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14580 2026-08-31 cs.CL 版本更新 70%

Persuasion Index: A Theory-Guided Framework for Persuasion Analysis

说服指数:一个理论指导的说服分析框架

Liancheng Gong, Zhiyang Wang, Yiwei Xu, Julia Mendelsohn

机构 * University of Maryland, College Park(马里兰大学帕克分校) New York University(纽约大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 提出基于心理学和传播学理论的15维说服指数(PI)及55个子特征实现,在四个数据集上验证其能解释说服相关修辞模式,并提供轻量级预测信号。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27465 2026-08-31 cs.CL cs.AI cs.CY cs.HC 新提交 67%

The Effect of Emotional Context on Large Language Models' Endorsement of Premature Decisions: Comparing Emotional Vulnerability Across Six Commercial Models

情绪语境对大语言模型支持仓促决策的影响:六种商业模型的情绪脆弱性比较

Cheolho Shin, Yoojin Han, Donghun Shin, Kunho Lee

机构 * Yonsei University(延世大学) Fudan University(复旦大学) St. Johnsbury Academy Jeju(济州圣约翰斯伯里学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究探究情绪语境对LLM支持仓促决策的影响,测试六种商业模型后发现情绪会显著提升模型的支持度,且脆弱性因单个模型而异,仅Claude Opus无显著情绪效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28099 2026-08-31 cs.AI cs.CL 新提交 62%

Speculative Probing: LLM Monitoring at Speculative-Decoding Cost

推测式探测:以推测解码成本实现大语言模型监控

Collin Zhang, Tingwei Zhang, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出将LLM的推测解码模块改造为序列分类器,在可忽略开销下实现高效分类,其小型探测模型在多任务上优于零样本GPT-5.4-mini,部分任务性能匹配专用8B安全分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27763 2026-08-31 cs.LG cs.CL stat.ML 新提交 62%

Fast Weight Attention for Continual Learning

用于持续学习的快速权重注意力

Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang, Yifeng Liu, Huizhuo Yuan, Mengdi Wang, Quanquan Gu, Andrew Chi-Chih Yao

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对持续学习,推导了Falcon系列快速权重更新规则,结合多种计算形式,在语言建模等任务中保持竞争力并提升可变数字加法的长度外推能力,分离了序列模型的时间对齐等关键机制。

Comments Project Page: this https URL (https://github.com/yifanzhang-pro/fast-weight-attention)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28455 2026-08-31 cs.CV cs.AI 新提交 57%

ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

ARC-CT:用于3D胸部CT的解剖路由对比视觉-语言学习

Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol, Şeyda Ertekin

机构 * Harvard Medical School(哈佛医学院) METU-DTX Digital Transformation and Innovation Center(METU-DTX数字转型与创新中心)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 ARC-CT是一种基于LLM提取的报告标签、无需人工标注的区域感知对比视觉-语言框架,通过三个组件解决胸部CT全局对比学习的局限,在18种异常上实现0.86无掩码宏观AUC,性能优于高效基线和大Transformer模型。

Comments Accepted to the Thoracic Image Analysis (TIA) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28246 2026-08-31 cs.RO cs.AI 新提交 57%

Training-free Suction Grasp Detection for Deformed Aseptic Cartons Using Vision-Language Models and Geometric Surface Scoring

基于视觉语言模型与几何表面评分的免训练变形无菌纸箱吸盘抓取检测

Marin Maletic, Goran Vasiljevic

机构 * University of Zagreb Faculty of Electrical Engineering and Computing(萨格勒布大学电气工程与计算机学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对可回收废物机器人分拣的挑战,提出一种免训练的变形无菌纸箱吸盘抓取系统,结合视觉语言模型、SAM2与几何表面评分方法,在真实机器人实验中取得了良好的抓取与检索效果。

Comments 6 pages, ICCAS 2026 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27719 2026-08-31 cs.LG q-bio.NC 新提交 57%

Leveraging a Foundation Model for the EEG-Based Diagnosis of Alzheimer's Disease

利用基础模型实现基于脑电图的阿尔茨海默病诊断

Maggie Lin, Chung-Lin Hou, Tzyy-Ping Jung

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校) HippoScreen Neurotech Corp.(HippoScreen神经科技公司) Swartz Center for Computational Neuroscience(Swartz计算神经科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本研究针对阿尔茨海默病诊断挑战,采用预训练于2500小时脑电图的大型脑模型LaBraM,结合随机森林分类器,仅用8秒脑电片段即达89.36%的ROC-AUC,优于传统方法,可提取临床相关生物标志物。

Comments 7 pages, 9 figures, 1 table. Accepted and presented at the 48th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01335 2026-08-31 cs.CV cs.AI 版本更新 57%

Beyond Pixels: Visual Metaphor Transfer via Schema-Driven Agentic Reasoning

超越像素:通过基于模式的代理推理实现视觉隐喻转移

Yu Xu, Yuxin Zhang, Lin Gao, Oliver Deussen, Tong-Yee Lee, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) University of Konstanz(康斯坦茨大学) National Cheng-Kung University(国立成功大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出基于模式的代理推理框架,实现视觉隐喻转移,通过多代理协作提升隐喻生成的抽象逻辑与视觉创造力。

Comments Accepted to SIGGRAPH ASIA 2026; Project page: this https URL (https://yuci-gpt.github.io/Beyond-Pixels/)

详情

展开后加载摘要…

URL PDF HTML 收藏