arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-28 至 2026-08-28 共收录 86 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 31 篇

2608.26382 2026-08-28 cs.CV 新提交 50%

VIPER: An Expert-Curated Benchmark for Vision-Language Models in Veterinary Pathology

VIPER:用于兽医病理学视觉语言模型的专家策划基准

Luca L. Weishaupt, Simone de Brot, Javier Asin, Llorenç Grau-Roma, Nic G. Reitsam, Andrew H. Song, Dongmin Bang, Stefan T. Kaluziak, Long Phi Le, Jakob Nikolas Kather, Faisal Mahmood, Guillaume Jaume

机构 * Harvard-MIT HST(哈佛-麻省理工卫生科学与技术部) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) COMPATH, University of Bern(伯尔尼大学COMPATH) UC Davis(加州大学戴维斯分校) University of Augsburg(奥格斯堡大学) UT MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) TU Dresden(德累斯顿工业大学) University of Lausanne(洛桑大学)

专题命中 安全评测 :safety(abstract)

AI总结 研究针对现有病理视觉语言模型基准聚焦人体组织的问题,推出首个兽医病理学视觉语言模型评估基准VIPER,测试16类模型发现领域差距,验证领域特定训练的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 安全评测 :alignment(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-28 cs.CE 版本更新 50%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23749 2026-08-28 cs.SE 版本更新 50%

A Survey of LLM-based Automated Program Repair: Taxonomies, Design Paradigms, and Applications

基于大型语言模型的自动程序修复综述:分类、设计范式与应用

Boyang Yang, Zijian Cai, Fengling Liu, Bach Le, Lingming Zhang, Tegawendé F. Bissyandé, Yang Liu, Haoye Tian

专题命中 安全评测 :alignment(abstract)

AI总结 本文综述了基于LLM的自动程序修复,提出统一分类法,涵盖四种范式,并讨论了评估实践和未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 4 篇

2608.26696 2026-08-28 cs.AI cs.CR cs.SE 新提交 57%

Five Primitives for Governing Autonomous AI Agents at Runtime

运行时管控自主AI智能体的五大原语

Jiten Oswal, John Cadeddu

机构 * Aurite AI(奥莱特人工智能公司)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 针对企业自主AI智能体管控的适配问题,提出发现、身份等五大运行时管控原语,描述其实现方案、成本及部分原语的开发状态。

Comments 14 pages, 2 figures, 1 table. Describes an implemented system in private pilot deployment; four of five primitives implemented

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26182 2026-08-28 cs.AI cs.HC cs.RO 新提交 57%

Why did My Robot Just Change Personality? Prompting Guidelines for a Grounded Robot Persona in LLM-Based HRI

我的机器人为什么刚改变了人格?面向基于大语言模型(LLM)的人机交互(HRI)的具身机器人人格提示设计指南

Ashita Ashok, Franziska Babel, Patrick Holthaus, Rucha Khot, Karla Bransky, Fethiye Irmak Dogan, Karsten Berns, Silvia Rossi, Minha Lee, Guy Laban

机构 * RPTU Kaiserslautern(凯泽斯劳滕工业大学) Linköping University(林雪平大学) University of Hertfordshire(赫特福德大学) Eindhoven University of Technology(埃因霍温理工大学) Australian National University(澳大利亚国立大学) University of Cambridge(剑桥大学) University of Naples Federico II(那不勒斯费德里科二世大学) Ben-Gurion University of the Negev(本-古里安大学内盖夫分校) The Azrieli National Center for Autism and Neurodevelopment Research(阿兹列利国家自闭症与神经发育研究中心)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文针对基于LLM的HRI中机器人人格模糊等问题,提出含八个组件的提示设计框架及指南,为HRI研究提供结构化设计与报告辅助,强调提示设计需作为社会技术问题处理。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26157 2026-08-28 cs.AI 新提交 57%

GROUND: Reducing Hallucinations in LLM-Based Enterprise Analytics Through Governed Semantic Definitions

GROUND:通过受监管的语义定义减少基于大语言模型的企业分析中的幻觉现象

Aravind Sasidharan Pillai

机构 * Cox Automotive Inc(考克斯汽车公司)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该研究提出GROUND框架,通过受监管语义层约束大语言模型生成的企业分析内容,在多模型多数据集测试中消除了所有评估类别的幻觉,保障了数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05281 2026-08-28 cs.HC 版本更新 50%

Algorithmic Fairness Perceptions in the Global South: Evidence from Bangladesh on Ride-Sharing, Beauty Filters, and Large

全球南方的算法公平感知:来自孟加拉国关于网约车、美颜滤镜和大型语言模型的证据

Ahmed Abdal Shafi Rasel, Ahmed Mustafa Amlan, Tasmim Shajahan Mim

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 该研究通过对孟加拉国199名民众的双语调查,揭示了情境影响算法公平感知、对算法保护需求普遍、美颜滤镜损害自我形象、识别与阐明LLM文化偏见存在差异等四个关键模式,指出仅结果导向的公平指标存在局限。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 18 篇

2608.27115 2026-08-28 cs.CL 新提交 79%

Cross-Lingual Alignment Without Joint Training: Do Monolingual Language Models Converge on Universal Representations?

无联合训练的跨语言对齐:单语言模型是否会收敛到通用表示?

Ej Zhou, Suchir Salhan, Catherine Arnett, Anna Korhonen

机构 * University of Cambridge(剑桥大学) EleutherAI

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究发现无联合训练时,单语言模型可通过语言结构和信息承载形成跨语言对齐,提出用Procrustes旋转映射模型隐藏状态,为模块化多语言系统构建提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26587 2026-08-28 cs.CL 新提交 79%

Surgical Alignment in Knowledge Graph Training for Clinical Diagnosis with Large Language Models

面向临床诊断的大语言模型训练中知识图谱的外科式对齐

Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校区) University of Wisconsin Madison(威斯康星大学麦迪逊分校) Loyola University(洛约拉大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 该研究针对临床诊断的LLM训练,通过多维度系统研究引入GID和GD,发现KL正则化下KG判断训练的稀疏更新(外科式对齐)可提升推理质量,需结合优化几何诊断评估KG-LLM整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26820 2026-08-28 cs.CV 新提交 78%

LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

LLaVAFlow:用于参数高效多模态微调的潜在对齐流保留方法

Muyao Yuan, Muyan Jiao, Jiangyong Ying, Weizhan Zhang, Yuanhong Zhang, Lan Ma, Yuan Gao, Haipeng Du

机构 * MOEKLINNS China Telecom(中国电信)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对多模态大语言模型微调的灾难性遗忘问题,本文提出即插即用的LLaVAFlow框架,通过信息论蒸馏保留跨模态对齐流,提升下游任务性能与泛化能力。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-08-28 cs.CV cs.AI 版本更新 74%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 62%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-08-28 cs.AI cs.LG 版本更新 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27348 2026-08-28 cs.CL 新提交 57%

INTENT-AS-A-TOOL Makes it Easy to Track Agentic Misalignment

意图作为工具:轻松追踪智能体失配问题

Yutong Zhang, Jianshuo Dong, Peng Xu, Long Wang, Jie Zhang, Tianwei Zhang, Xiaoping Zhang, Han Qiu

机构 * Tsinghua University(清华大学) MatrixOrigin(矩阵起源) SiliconProspect AI(硅景人工智能) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本研究针对智能体失配问题,提出INTENT-AS-A-TOOL方法,通过添加意图专用工具追踪智能体推理过程中的意图变化,补充CoT监控,为智能体安全追踪提供细粒度信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26895 2026-08-28 cs.IR cs.AI 新提交 57%

When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems

当记忆获取梯度:面向智能体推荐系统的协同向量记忆

Hanchong Chen, Xing Tang, Lingjie Li, Xiongfeng Shan, Xiuqiang He

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究针对智能体推荐系统中文本记忆的局限,提出CoVeMem协同向量记忆方法,在四个推荐基准上多数指标优于现有文本记忆智能体,无需额外LLM调用即可利用完整交互历史优化模型。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26848 2026-08-28 cs.CV cs.AI 新提交 57%

MedFG-VQA: Low-Frequency Memory and Graph Attention for Lightweight Medical VQA

MedFG-VQA:用于轻量级医学视觉问答的低频记忆与图注意力

Haowen Gu, Gensheng Pei, Zeren Sun, Mingwu Ren, Xiangbo Shu, Yazhou Yao, Fumin Shen

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) State Key Laboratory of Intelligent Manufacturing of Advanced Construction Machinery(高端工程机械智能制造国家重点实验室) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电气与计算机工程系) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 MedFG-VQA是轻量级医学VQA框架,通过FMF和GACA实现高效视觉-文本对齐,构建含200万对问答的SynMed-VQA数据集,性能优于大模型且计算成本低,适用于临床部署。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26829 2026-08-28 cs.LG cs.CV 新提交 57%

SAGE: Variate-Wise Semantic Augmentation for Vision-Language Time Series Forecasting

SAGE:面向视觉-语言时间序列预测的逐变量语义增强方法

Haizhao Fan, Xinyi Le

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对时间序列预测模型缺乏语义知识的问题,提出基于CLIP的SAGE框架,通过双重利用CLIP实现多模态监督,在8个长期基准及M4数据集上取得最优精度。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26596 2026-08-28 cs.CL 新提交 57%

Not Just Reason, Not Just Scan: Reinforcement Learning for Proactive Scientific Error Verification over Academic Paper

不仅是推理,不仅是扫描:面向学术论文的主动科学错误验证强化学习

Rongjin Li, Yuanxin Liu, Hao Zhou, Fandong Meng, Jie Zhou, Xu Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) WeChat AI, Tencent Inc.(腾讯微信人工智能部门)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 针对现有无预设问题/证据的学术论文科学错误验证研究不足的问题,提出VERA-RL强化学习框架,构建VERA-13K数据集,训练Qwen3-VL-8B后其可验证推理能力接近旗舰级多模态大语言模型。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-08-28 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19449 2026-08-28 cs.SE cs.LG 版本更新 57%

Stack Trace-Based Crash Deduplication with Transformer Adaptation

基于栈跟踪的Transformer适配崩溃重复检测

Md Afif Al Mamun, Gias Uddin, Lan Xia, Longyu Zhang

机构 * University of Calgary(卡尔加里大学) York University(约克大学) IBM Canada(IBM加拿大)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出基于Transformer的dedupT方法,适配预训练语言模型处理栈跟踪,训练全连接网络排序重复崩溃,在四个公开数据集上优于现有方法,减少人工分类工作量。

Comments This work is currently under review at IEEE Transactions on Software Engineering (TSE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27190 2026-08-28 cs.CV 新提交 50%

Unsupervised Adaptation of 3D CT Foundation Models for 3D CBCT Segmentation

用于3D CBCT分割的3D CT基础模型的无监督适配

Gauthier Miralles, Loic Le Folgoc, Vincent Jugnon, Pietro Gori

机构 * LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎综合理工学院电信学院LTCI研究所) GE HealthCare(GE医疗)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对3D CBCT分割面临的标注数据稀缺与跨模态域偏移问题,提出基于降冗余特征对齐的无监督域适应框架,适配CNN及ViT基础模型,在肝脏分割基准上表现优于现有策略,且公开了相关资源。

Comments Accepted at the EMA4MICCAI workshop at MICCAI 2026. 11 pages, 4 figures, 1 table. Code, trained models, weights, and liver annotations are available at this https URL (https://github.com/mirabll/FARR3D/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26868 2026-08-28 cs.CV cs.RO 新提交 50%

CGS-SLAM: Collaborative Gaussian Splatting based SLAM for Multi-Agent Reconstruction

CGS-SLAM:基于协作高斯溅射(Gaussian Splatting)的多智能体重建SLAM算法

Jean-Daniel de Ambrogi, Aladine Chetouani, Vincent Nguyen, Aurélien Chateigner

机构 * Université Sorbonne Paris Nord(巴黎北大学) SAS IMPACT(SAS IMPACT公司) Université d’Orléans(奥尔良大学) INSA CVL(中央卢瓦尔河谷国立应用科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对消费级智能手机无RGB-D输入、多智能体3DGS协作SLAM方法缺失的问题,提出仅用RGB和惯性数据的CGS-SLAM算法,结合局部跟踪、动态关键帧共享与中央服务器子图对齐,在GNSS拒止环境下实现多智能体重建,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26771 2026-08-28 cs.CV 新提交 50%

Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification

面向茶叶病害分类的、从视觉基础模型到轻量视觉状态空间模型的跨架构知识蒸馏

Zibo Zhou, Zongsen Qiu, Rui Chen, Yujie Yao, Yue Zhou, Jianjun Wang

专题命中 其他安全 :alignment(abstract)

AI总结 本文针对茶叶病害分类,通过跨架构知识蒸馏将DINOv2教师模型的知识迁移到轻量LVSSM学生模型,提升了边缘部署的轻量模型准确率,参数仅为教师模型的1/5,准确率保留98.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26716 2026-08-28 cs.CV 新提交 50%

Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models

超越原子布局:基于视觉-语言模型的组合式设计理解

Yiyang Huang, Zhaowen Wang, Simon Jenni, Jing Shi, Yitian Zhang, Yizhou Wang, Yun Fu

机构 * Northeastern University(东北大学) Adobe Research(奥多比研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文针对组合式布局理解任务,提出后训练范式MASON,利用约2万布局的CoDeLayout数据集,使Qwen2.5-VL 7B准确率达91.66%,优于基线及全数据微调。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26531 2026-08-28 cs.CV 新提交 50%

FAN-LoRA: A Fourier-Adaptive Nonlinear Low-Rank Adaptor for Medical Foundation Model Domain Adaptation

FAN-LoRA:用于医学基础模型领域适应的傅里叶自适应非线性低秩适配器

Ziquan Liu, Zhewei Zhu, Xuyang Shi

机构 * School of Information and Control Engineering, Southwest University of Science and Technology(西南科技大学信息与控制工程学院)

专题命中 其他安全 :alignment(abstract)

AI总结 针对SAM迁移至医学成像的领域差距问题,提出FAN-LoRA架构,通过频率解耦微调实现结构与纹理补偿,在三类基准上优于现有PEFT方法,提升分割性能且兼顾效率。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏