arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-09-01 至 2026-09-01 共收录 222 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 67 篇

2605.27887 2026-09-01 cs.AI q-fin.PM 版本更新 57%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12824 2026-09-01 cs.IR cs.CV cs.LG 版本更新 57%

NanoVDR: Distilling a 2B Vision-Language Retriever into a 70M Text-Only Encoder for Visual Document Retrieval

NanoVDR:将20亿参数的视觉语言检索器蒸馏为7000万参数的纯文本编码器用于视觉文档检索

Zhuchenyang Liu, Yao Zhang, Yu Xiao

机构 * Aalto University(阿alto大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 利用查询-文档不对称性,通过蒸馏将20亿参数的视觉语言模型教师蒸馏为7000万参数的纯文本学生编码器,采用点态余弦对齐目标,实现视觉文档检索的高效推理。

Comments Accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08814 2026-09-01 cs.RO cs.AI cs.ET cs.MA 版本更新 57%

Scale-Plan: Scalable Language-Enabled Task Planning for Heterogeneous Multi-Robot Teams

Scale-Plan: 为异构多机器人团队实现可扩展的语言赋能任务规划

Piyush Gupta, Sangjae Bae, Jiachen Li, David Isele

机构 * Honda Research Institute(本田研究院) University of California(加州大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Scale-Plan通过生成紧凑的任务相关问题表示,提升异构多机器人团队的可扩展性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29661 2026-09-01 cs.CE 新提交 50%

OmniClimate-TC: Physics-Aware Visual Abstractions for Multimedia Reasoning over Tropical Cyclones

OmniClimate-TC:面向热带气旋多媒体推理的物理感知视觉抽象

Luwei Xiao, Xin Wang, Keane Ong, Jiawen Wei, Chenyu Dong, Rui Mao, Erik Cambria, Gianmarco Mengaldo

专题命中 安全评测 :alignment(abstract)

AI总结 该研究针对VLMs处理热带气旋灾害场时的感知不匹配问题,提出PAVA接口并构建OmniClimate-TC基准,证实该表示设计可提升VLMs的相关推理能力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29480 2026-09-01 cs.SD cs.IR 新提交 50%

What Are You Listening to? Temporal Music Grounding for Audio-to-Text Large Language Models

你在听什么?面向音频-文本大语言模型的时序音乐定位

Kun Fang, Ziyu Wang, Ichiro Fujinaga

机构 * Schulich School of Music, McGill University(麦吉尔大学舒利希音乐学院) CIRMMT (Centre for Interdisciplinary Research in Music Media and Technology)(音乐媒体与技术跨学科研究中心(CIRMMT)) Courant Institute, New York University(纽约大学柯朗研究所) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学(MBZUAI))

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出时序音乐定位任务,构建基准集MusicGroundingBench评估音频-语言模型的该能力,发现当前模型完成该任务仍具挑战,任务特定训练可提升性能,该基准可用于评估模型回应是否基于音乐证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28935 2026-09-01 physics.flu-dyn 新提交 50%

NeuralFlowNet: Towards Data-Free Physics-Informed Neural Network Solutions of Navier-Stokes Equations Across Low and High Reynolds Numbers

NeuralFlowNet:面向低至高雷诺数下无数据物理信息神经网络的纳维-斯托克斯方程求解方案

Jayanga T. Samarasinghe, Luis De la Fuente, Laura Alvarez

专题命中 安全评测 :trustworthy(abstract)

AI总结 NeuralFlowNet是一种无数据物理信息神经网络框架,可在不依赖外部流场数据的情况下,准确求解低至高雷诺数下的稳态纳维-斯托克斯方程,为开发高雷诺数流体动力学AI求解器提供了可靠基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21300 2026-09-01 cs.CV 版本更新 50%

When Adaptation Hurts: Connecting Representational Drift to OOD Failures in MedSAM Fine-Tuning

当适应适得其反:将表征漂移与MedSAM微调中的分布外故障关联起来

Marko Haralović, Sounic Akkaraju, Carlo Baretta, Vasil Zapryanov, Alexia Briassouli

机构 * University of Zagreb(萨格勒布大学) University of Twente(特温特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究分析MedSAM的六种微调策略在不同医学图像数据集上的泛化表现,发现仅编码器LoRA等策略可缓解远分布外性能下降,提示随机抖动能提升模型鲁棒性。

Comments Accepted at the SAFER Workshop, MICCAI 2026, non camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21861 2026-09-01 cs.NI cs.MA cs.SY eess.SY 版本更新 50%

Spatiotemporal Continual Federated Learning for Agentic Multi-UAV Edge Networks: Mitigating Catastrophic Forgetting

空间时间连续学习用于移动边缘UAV网络:缓解灾难性遗忘

Chuan-Chi Lai

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出STCL框架,通过G-MAPPO算法结合GDPO机制和梯度正交化层,平衡异质目标,提升UAV网络在动态环境中的服务可靠性与性能。

Comments 13 pages, 5 figures, 2 tables. Substantially revised and extended version with an agentic multi-UAV edge networking framework, enhanced theoretical analysis, and additional experimental evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23766 2026-09-01 cs.IR 版本更新 50%

UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents

UniFAR: 一种统一的面向面检索框架用于科学文档

Zheng Dou, Zhao Zhang, Deqing Wang, Yikun Ban, Fuzhen Zhuang

专题命中 安全评测 :alignment(abstract)

AI总结 UniFAR提出一种统一的面向面检索框架,通过自适应多粒度聚合、可学习的面向锚点和联合训练,有效解决文档与问题驱动检索之间的不匹配问题,提升科学文档检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 10 篇

2607.02368 2026-09-01 stat.ML cs.AI cs.LG math.DG 版本更新 62%

Cultural Bias Without a Cultural Self:A Disassociation Study of LLM's Persona and Bias

LLM人格的双重性质:聚合倾向与框架依赖的几何结构

Yuan Yuan

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 通过心理测量问卷评估LLM人格时,发现人格表达包含聚合特征(大五人格分数)和几何特征(SPD流形)两种可分离成分,其中几何特征并非内在属性,而是框架依赖的协调模式,揭示了LLM人格的双重性质。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03211 2026-09-01 cs.CY cs.AI 版本更新 62%

Retrofitters, pragmatists and activists: Public interest litigation for accountable automated decision-making

改造者、实用主义者和活动家:为可问责的自动化决策而进行的公益诉讼

Henry L Fraser, Zahra Stardust

机构 * Queensland University of Technology, School of Law(昆士兰理工大学法学院) Centre for Automated Decision-Making and Society(自动化决策与社会研究中心) Queensland University of Technology, School of Communication(昆士兰理工大学传播学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨公益诉讼在澳大利亚促进AI和自动化决策问责中的作用,基于访谈分析策略与局限,强调制度安排对有效诉讼的关键性。

Comments Accepted version, Law and Society Review (forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29306 2026-09-01 cs.CY 新提交 57%

The relationship between professional and general ethics in generative AI

生成式AI中职业伦理与一般伦理的关系

Omri Asscher, Mirco Musolesi

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CY

AI总结 本文针对生成式AI领域一般伦理与职业伦理的冲突问题,提出二者层级关系与情境平衡的框架,可用于系统评估AI模型职业伦理,还给出干预调整方案,为相关研究提供基础。

Comments 26 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29206 2026-09-01 cs.AI 新提交 57%

Benevolent Bias in Multi-Turn Human-Agent Dialogue

多轮人机对话中的善意偏见

Qianqi Liu, Jin Huang, Fethiye Irmak Dogan, Hatice Gunes

机构 * University of Cambridge(剑桥大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本研究针对人机对话中隐藏在积极语气后的善意偏见,构建了标注语料库并测试两类检测器,发现现有安全检测器难识别善意偏见,LLM评判器易误判,需关注对待方式差异以实现公平监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-09-01 cs.CL econ.GN q-fin.EC 版本更新 57%

Tastes without distinction: silicon samples and the synthetic construction of tastes

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08698 2026-09-01 cs.LG q-bio.GN 版本更新 57%

EvoLen: Evolution-Guided Tokenization for DNA Language Model

EvoLen:基于进化的标记化方法用于DNA语言模型

Nan Huang, Xiaoxiao Zhou, Junxia Cui, Mario Tapia-Pacheco, Tiffany Amariuta, Yang Li, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 EvoLen通过整合进化信息优化DNA标记化,优先保留功能序列模式,提升基因组上下文区分和进化约束对齐,优于标准BPE。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16013 2026-09-01 cs.CL 版本更新 57%

Political Ideology Shifts in Large Language Models

大语言模型中的政治意识形态转变

Pietro Bernardelle, Stefano Civelli, Leon Fröhling, Riccardo Lunardi, Kevin Roitero, Gianluca Demartini

机构 * The University of Queensland(昆士兰大学) University of Udine(乌迪内大学)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本研究以政治指南针测试为探针,发现大语言模型的意识形态可塑性随规模变化,显式启动会引发不同程度的意识形态转变,凸显评估其政治属性时需考虑交互因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30938 2026-09-01 cs.MA 新提交 50%

Evidence, Logic, and Compliance: Multi-Agent Structured Graph Reasoning with Expert Arbitration for Medical Referral

证据、逻辑与合规性:面向医疗转诊的专家仲裁多智能体结构化图推理

Qi Peng, Yi Cai, Jialin Cui, Tong Zhu, Yujuan Ding, Qingbao Huang, Tao Wang, Jiayuan Xie, Changmeng Zheng, Qing Li

专题命中 AI治理与伦理 :safety(abstract)

AI总结 该研究针对LLM用于医疗转诊的信息过载与非结构化协作问题,提出MASGR框架,通过多智能体结构化图推理及专家仲裁机制提升复杂医疗转诊的精准度,表现优于现有模型。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29590 2026-09-01 cs.CV 新提交 50%

Guardrail-Agnostic Societal Bias Evaluation in Large Vision-Language Models

强安全护栏下大型视觉语言模型的护栏无关社会偏见评估

Yusuke Hirota, Michael Ross Boone, Arun George Zachariah, Jibin Rajan Varghese, Yu-Chiang Frank Wang, Boyi Li, Ryo Hachiuma

机构 * NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract)

AI总结 本研究针对强护栏LVLMs的偏见评估难题,提出解耦人物属性推断的评估方法,发现20款LVLMs均存在不当使用用户人口统计信息的偏见,且专有模型偏见低于开源模型。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28340 2026-09-01 cs.IR 50%

Rethinking Fairness in LLM-Based Recommender Systems: A Survey

重新思考基于LLM的推荐系统中的公平性:一项综述

Song-Duo Ma, Chu-Yun Chen, Bang-An Li, Pin-Yu Chen, Shau-Yung Hsu, Yun-Nung Chen

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 53 篇

2608.29610 2026-09-01 cs.CL 新提交 85%

Beyond Surface Alignment: Grounding the Dynamics of Situational Understanding and Generative Control in LLMs

超越表面对齐:基于情境理解与生成控制的动态机制研究

Chenghao Yang

专题命中 其他安全 :alignment(title,abstract);safety(abstract);分类 cs.CL

AI总结 本研究针对LLM表面对齐导致的情境脆弱问题,提出根基对齐框架,通过多维度评估缺陷并开发动态控制方法,实现锚定上下文与生成的智能体。

Comments PhD Thesis submitted to UChicago (https://knowledge.uchicago.edu/records/5jrnc-nvp13). Update Branching Factor, AI Realtor, and BACo to the latest versions

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25493 2026-09-01 cs.CV 版本更新 82%

SMART: MLLM-guided Temporal Alignment for Unifying Sign Language Recognition and Spotting

SMART:用于统一手语识别与定位的多模态大语言模型(MLLM)引导的时间对齐框架

Eunjee Choi, JungHoon Sung, Seongwhan Cho, Chu Xin, Younggeun Choi

机构 * Dankook University(檀国大学)

专题命中 其他安全 :alignment(title,abstract);safety(abstract)

AI总结 本研究提出 MLLM 引导的 SMART 框架,整合多尺度时间适配器与 CSFormer 模块,在四个手语基准数据集上实现了手语识别与定位任务的性能提升。

Comments 19 pages, Accepted 37th British Machine Vision Conference, BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-09-01 cs.CL cs.AI 版本更新 81%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, AprilPyone MaungMaung, Isao Echizen

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

Comments Accepted to the EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05078 2026-09-01 cs.CL cs.AI 版本更新 81%

From Isolation to Alignment: Unified LoRA for Efficient Multi-Task Learning

从孤立到对齐:用于高效多任务学习的统一LoRA

Jinda Liu, Yi Chang, Yuan Wu

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多任务PEFT中复杂LoRA变体的范式提出挑战,提出统一高效的Align-LoRA框架,通过显式对齐损失实现表示对齐,保留标准LoRA架构并实现零推理延迟,性能优于现有方法。

Comments To appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29123 2026-09-01 cs.CL 版本更新 79%

Learning Concepts, Not Tokens: Self-Supervised Semantic Alignment for Language Models

学习概念,而非词元:语言模型的自我监督语义对齐

Christine Zhang, Dan Jurafsky, Chen Shani

机构 * Stanford University(斯坦福大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 提出一种自我监督框架,通过预测语义等价词元集合(概念)替代下一个词元预测,提升语言模型的语义对齐能力,并在分类、聚类、重排序及下游推理任务中取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12962 2026-09-01 cs.CY 版本更新 79%

ACE-Align: Attribute Causal Effect Alignment for Cultural Values under Varying Persona Granularities

ACE-Align:属性因果效应对齐用于不同人格粒度下的文化价值观

Jiatang Luo, Bingbing Xu, Rongxin Chen, Xiaoyan Zhao, Yang Zhang, Liang Pang, Zhiyong Huang, Huawei Shen

专题命中 其他安全 :alignment(title,abstract);分类 cs.CY

AI总结 ACE-Align通过属性因果效应对齐,提升不同人格粒度下文化价值观的公平性,减少高低资源地区差距。

Comments Accepted to the Main Conference of EMNLP 2026. 20 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30643 2026-09-01 cs.RO 新提交 78%

Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models

时序强制:面向视觉-语言-动作模型的四维表示对齐

Xingyu Ding, Yuzhong Zhao, Chunhai Zhao, Yinghuan Shi, Chaoyang Zhao, Yifan Zhang

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究针对视觉-语言-动作模型缺乏时序信息的问题,提出 Temporal Forcing 方法,通过历史通路与时序一致的四维几何特征对齐,在 LIBERO 等任务上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29716 2026-09-01 cs.SE 新提交 78%

Agent-Driven Verification of Memory Safety for liblzma Decoder Components with VST

基于VST的Agent驱动liblzma解码器组件内存安全验证

Prokhor Shlyakhtun, Alexander Gryzlov, Vladimir Kukharenko, Vasilii Nesterov, Nikolai Vasiliev, Kirill Ziborov, Eugene Zolotarev, Alex Pokras

专题命中 其他安全 :safety(title,abstract)

AI总结 该研究基于VST,通过AI智能体辅助验证了liblzma生产级C解码器组件的内存安全,发现了其中的未定义行为,并解决了智能体驱动形式化验证的相关工程问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30503 2026-09-01 astro-ph.IM 新提交 78%

DINOspec: Efficient Multimodal Alignment of Vision and Spectral Foundation Models for Astronomy

DINOspec:面向天文学的视觉与光谱基础模型的高效多模态对齐

Erica Lastufka, Mariia Drozdova, Daniel Schaerer, Svyatoslav Voloshynovskiy

专题命中 其他安全 :alignment(title,abstract)

AI总结 DINOspec框架通过轻量适配器和对比学习,对齐冻结的DINOv3图像编码器与预训练的AION-1光谱分词器,在20472对天体数据上提升了星系形态和光谱分类性能,验证了科学基础模型可通过轻量表征对齐组合。

Comments 4 pages, 1 figure, submitted to NeurIPS Representations for the Physical Sciences Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29978 2026-09-01 cs.CL cs.LG cs.NE 新提交 76%

Evolutionary Soups: Evolving Mixture-of-Experts for Multi-Objective LLM Alignment

进化组合模型:面向多目标大语言模型对齐的进化型专家混合模型

Lingxiao Kong, Steffen Staab, Cong Yang, Oya Beyan, Zeyd Boukhers

机构 * Fraunhofer Institute for Applied Information Technology FIT(弗劳恩霍夫应用信息技术研究所FIT) University of Cologne(科隆大学) University of Stuttgart(斯图加特大学) University of Southampton(南安普顿大学) Soochow University(苏州大学) University Hospital of Cologne(科隆大学医院)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.LG

AI总结 针对大语言模型多目标对齐需求,提出进化型专家混合框架,通过进化算法训练门控网络,在多任务上实现了优于基线的超体积、线性效用和切比雪夫效用,提升约20%。

Comments Accepted at EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29446 2026-09-01 cs.CL 新提交 74%

Whose Assessment of Distress? Community Perspectives and LLM Alignment on Well-Being Posts

谁来评估心理困扰?社区视角与大语言模型在福祉帖子上的对齐

Andrew Aquilina, Xiang Lorraine Li, Yu-Ru Li

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 该研究通过标注Reddit社区帖子的心理困扰判断,发现LLM存在无至轻度困扰高估问题,其先验判断异于人类,这对心理健康领域公平AI部署有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏